Eval Harness

affaan-m/ECC/docs/tr/skills/eval-harness

作者 affaan-mef648e01899ba3e8dc6371642deaaf64b4477775無授權條款275K 個星標收錄於 2026年10月9日更新於 2026年10月9日儲存庫4 天前更新

Eval-driven development (EDD) ilkelerini uygulayan Claude Code oturumları için formal değerlendirme çerçevesi

僅含說明AI & Agents
AI 產生的概覽

為 Claude Code 工作階段設計的正式評估驅動開發框架,定義能力與回歸評估及 pass@k 指標。

功能
為 Claude Code 工作階段提供評估驅動開發的結構化框架,涵蓋能力評估與回歸評估、程式碼/模型/人工評分器類型,以及 pass@k 與 pass^k 可靠性指標。它定義了「定義、實作、評估、報告」的評估工作流程,並提供評估定義與報告的範本。它也規定了 .claude/evals 下的存放結構、發佈評估摘要,以及最佳實務與反模式。
適用情境
適用於為 AI 輔助工作流程建立評估驅動開發、為 Claude Code 任務完成定義通過/失敗準則,或以 pass@k 指標衡量代理可靠性。也適合為提示詞或代理變更建立回歸測試套件,並跨模型版本對代理效能進行基準測試。
執行需求
僅為說明文件,未附帶指令碼。文中引用 Read、Write、Edit、Bash、Grep、Glob 等工具,範例假定專案具備 npm test 與 npm run build。

Eval Harness Skill

Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.

Ne Zaman Aktifleştirmeli

  • AI destekli iş akışları için eval-driven development (EDD) kurarken
  • Claude Code görev tamamlama için geçti/kaldı kriterleri tanımlarken
  • pass@k metrikleriyle agent güvenilirliğini ölçerken
  • Prompt veya agent değişiklikleri için regresyon test paketleri oluştururken
  • Model versiyonları arasında agent performansını benchmark ederken

Felsefe

Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır:

  • İmplementasyondan ÖNCE beklenen davranışı tanımla
  • Geliştirme sırasında eval'ları sürekli çalıştır
  • Her değişiklikle regresyonları izle
  • Güvenilirlik ölçümü için pass@k metriklerini kullan

Eval Tipleri

Capability Eval'ları

Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:

markdown
[CAPABILITY EVAL: feature-name]Görev: Claude'un başarması gereken şeyin açıklamasıBaşarı Kriterleri:  - [ ] Kriter 1  - [ ] Kriter 2  - [ ] Kriter 3Beklenen Çıktı: Beklenen sonucun açıklaması

Regression Eval'ları

Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:

markdown
[REGRESSION EVAL: feature-name]Baseline: SHA veya checkpoint adıTestler:  - existing-test-1: PASS/FAIL  - existing-test-2: PASS/FAIL  - existing-test-3: PASS/FAILSonuç: X/Y geçti (önceden Y/Y)

Grader Tipleri

1. Code-Based Grader

Kod kullanarak deterministik kontroller:

bash
# Dosyanın beklenen pattern içerip içermediğini kontrol etgrep -q "export function handleAuth" src/auth.ts && echo "PASS" || echo "FAIL"
# Testlerin geçip geçmediğini kontrol etnpm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"
# Build'in başarılı olup olmadığını kontrol etnpm run build && echo "PASS" || echo "FAIL"

2. Model-Based Grader

Açık uçlu çıktıları değerlendirmek için Claude kullan:

markdown
[MODEL GRADER PROMPT]Aşağıdaki kod değişikliğini değerlendir:1. Belirtilen sorunu çözüyor mu?2. İyi yapılandırılmış mı?3. Edge case'ler işleniyor mu?4. Hata işleme uygun mu?
Puan: 1-5 (1=kötü, 5=mükemmel)Gerekçe: [açıklama]

3. Human Grader

Manuel inceleme için işaretle:

markdown
[HUMAN REVIEW REQUIRED]Değişiklik: Neyin değiştiğinin açıklamasıSebep: Neden insan incelemesi gerekliRisk Seviyesi: DÜŞÜK/ORTA/YÜKSEK

Metrikler

pass@k

"k denemede en az bir başarı"

  • pass@1: İlk deneme başarı oranı
  • pass@3: 3 denemede başarı
  • Tipik hedef: pass@3 > %90

pass^k

"Tüm k denemeler başarılı"

  • Güvenilirlik için daha yüksek çıta
  • pass^3: Ardışık 3 başarı
  • Kritik yollar için kullan

Eval İş Akışı

1. Tanımla (Kodlamadan Önce)

markdown
## EVAL DEFINITION: feature-xyz
### Capability Eval'ları1. Yeni kullanıcı hesabı oluşturabilir2. Email formatını doğrulayabilir3. Şifreyi güvenli şekilde hash'leyebilir
### Regression Eval'ları1. Mevcut login hala çalışıyor2. Oturum yönetimi değişmedi3. Logout akışı sağlam
### Başarı Metrikleri- capability eval'lar için pass@3 > %90- regression eval'lar için pass^3 = %100

2. Uygula

Tanımlanan eval'ları geçmek için kod yaz.

3. Değerlendir

bash
# Capability eval'ları çalıştır[Her capability eval'ı çalıştır, PASS/FAIL kaydet]
# Regression eval'ları çalıştırnpm test -- --testPathPattern="existing"
# Rapor oluştur

4. Rapor

markdown
EVAL REPORT: feature-xyz========================
Capability Eval'ları:  create-user:     PASS (pass@1)  validate-email:  PASS (pass@2)  hash-password:   PASS (pass@1)  Genel:           3/3 geçti
Regression Eval'ları:  login-flow:      PASS  session-mgmt:    PASS  logout-flow:     PASS  Genel:           3/3 geçti
Metrikler:  pass@1: %67 (2/3)  pass@3: %100 (3/3)
Durum: İNCELEMEYE HAZIR

Entegrasyon Kalıpları

İmplementasyondan Önce

/eval define feature-name

.claude/evals/feature-name.md konumunda eval tanım dosyası oluşturur

İmplementasyon Sırasında

/eval check feature-name

Mevcut eval'ları çalıştırır ve durumu raporlar

İmplementasyondan Sonra

/eval report feature-name

Tam eval raporu oluşturur

Eval Depolama

Eval'ları projede sakla:

.claude/  evals/    feature-xyz.md      # Eval tanımı    feature-xyz.log     # Eval çalıştırma geçmişi    baseline.json       # Regression baseline'ları

En İyi Uygulamalar

  1. Kodlamadan ÖNCE eval'ları tanımla - Başarı kriterleri hakkında net düşünmeyi zorlar
  2. Eval'ları sık çalıştır - Regresyonları erken yakala
  3. pass@k'yı zaman içinde izle - Güvenilirlik trendlerini gözle
  4. Mümkün olduğunda code grader kullan - Deterministik > olasılıksal
  5. Güvenlik için insan incelemesi - Güvenlik kontrollerini asla tam otomatikleştirme
  6. Eval'ları hızlı tut - Yavaş eval'lar çalıştırılmaz
  7. Eval'ları kodla versiyonla - Eval'lar birinci sınıf artifact'lardır

Örnek: Kimlik Doğrulama Ekleme

markdown
## EVAL: add-authentication
### Faz 1: Tanımla (10 dk)Capability Eval'ları:- [ ] Kullanıcı email/şifre ile kayıt olabilir- [ ] Kullanıcı geçerli kimlik bilgileriyle giriş yapabilir- [ ] Geçersiz kimlik bilgileri uygun hatayla reddedilir- [ ] Oturumlar sayfa yeniden yüklemelerinde kalıcıdır- [ ] Logout oturumu temizler
Regression Eval'ları:- [ ] Halka açık rotalar hala erişilebilir- [ ] API yanıtları değişmedi- [ ] Veritabanı şeması uyumlu
### Faz 2: Uygula (değişir)[Kod yaz]
### Faz 3: DeğerlendirÇalıştır: /eval check add-authentication
### Faz 4: RaporlaEVAL REPORT: add-authentication==============================Capability: 5/5 geçti (pass@3: %100)Regression: 3/3 geçti (pass^3: %100)Durum: YAYINLA

Product Eval'ları (v1.8)

Davranış kalitesi sadece birim testlerle yakalanamadığında product eval'ları kullan.

Grader Tipleri

  1. Code grader (deterministik assertion'lar)
  2. Rule grader (regex/şema kısıtlamaları)
  3. Model grader (LLM-as-judge rubric)
  4. Human grader (belirsiz çıktılar için manuel karar)

pass@k Kılavuzu

  • pass@1: doğrudan güvenilirlik
  • pass@3: kontrollü yeniden denemeler altında pratik güvenilirlik
  • pass^3: kararlılık testi (3 çalıştırmanın tümü geçmeli)

Önerilen eşikler:

  • Capability eval'ları: pass@3 >= 0.90
  • Regression eval'ları: yayın-kritik yollar için pass^3 = 1.00

Eval Anti-Kalıpları

  • Prompt'ları bilinen eval örneklerine overfitting yapmak
  • Sadece mutlu-yol çıktılarını ölçmek
  • Geçme oranlarını kovalamken maliyet ve gecikme kaymasını görmezden gelmek
  • Yayın kapılarında kararsız grader'lara izin vermek

Minimal Eval Artifact Düzeni

  • .claude/evals/<feature>.md tanımı
  • .claude/evals/<feature>.log çalıştırma geçmişi
  • docs/releases/<version>/eval-summary.md yayın snapshot'ı

來源與署名

來源:affaan-m/ECC位於docs/tr/skills/eval-harness提交ef648e0

授權條款: 無授權條款

內容歸原作者所有。SourceWeft 從公開儲存庫中收錄這些內容。

檢舉或申請下架