Eval Harnessスキル
Claude Codeセッションの正式な評価フレームワークで、評価駆動開発(EDD)の原則を実装します。
哲学
評価駆動開発は評価を「AI開発のユニットテスト」として扱います:
- 実装前に期待される動作を定義
- 開発中に継続的に評価を実行
- 変更ごとにリグレッションを追跡
- 信頼性測定にpass@kメトリクスを使用
評価タイプ
能力評価
Claudeが以前できなかったことができるようになったかをテスト:
リグレッション評価
変更が既存の機能を破壊しないことを確認:
評価者タイプ
1. コードベース評価者
コードを使用した決定論的チェック:
2. モデルベース評価者
Claudeを使用して自由形式の出力を評価:
3. 人間評価者
手動レビューのためにフラグを立てる:
メトリクス
pass@k
「k回の試行で少なくとも1回成功」
- pass@1: 最初の試行での成功率
- pass@3: 3回以内の成功
- 一般的な目標: pass@3 > 90%
pass^k
「k回の試行すべてが成功」
- より高い信頼性の基準
- pass^3: 3回連続成功
- クリティカルパスに使用
評価ワークフロー
1. 定義(コーディング前)
2. 実装
定義された評価に合格するコードを書く。
3. 評価
4. レポート
統合パターン
実装前
.claude/evals/feature-name.mdに評価定義ファイルを作成
実装中
現在の評価を実行してステータスを報告
実装後
完全な評価レポートを生成
評価の保存
プロジェクト内に評価を保存:
ベストプラクティス
- コーディング前に評価を定義 - 成功基準について明確に考えることを強制
- 頻繁に評価を実行 - リグレッションを早期に検出
- 時間経過とともにpass@kを追跡 - 信頼性のトレンドを監視
- 可能な限りコード評価者を使用 - 決定論的 > 確率的
- セキュリティは人間レビュー - セキュリティチェックを完全に自動化しない
- 評価を高速に保つ - 遅い評価は実行されない
- コードと一緒に評価をバージョン管理 - 評価はファーストクラスの成果物


