Eval Harness Skill
Claude Code oturumları için eval-driven development (EDD) ilkelerini uygulayan formal değerlendirme çerçevesi.
Ne Zaman Aktifleştirmeli
- AI destekli iş akışları için eval-driven development (EDD) kurarken
- Claude Code görev tamamlama için geçti/kaldı kriterleri tanımlarken
- pass@k metrikleriyle agent güvenilirliğini ölçerken
- Prompt veya agent değişiklikleri için regresyon test paketleri oluştururken
- Model versiyonları arasında agent performansını benchmark ederken
Felsefe
Eval-Driven Development, eval'ları "AI geliştirmenin birim testleri" olarak ele alır:
- İmplementasyondan ÖNCE beklenen davranışı tanımla
- Geliştirme sırasında eval'ları sürekli çalıştır
- Her değişiklikle regresyonları izle
- Güvenilirlik ölçümü için pass@k metriklerini kullan
Eval Tipleri
Capability Eval'ları
Claude'un daha önce yapamadığı bir şeyi yapıp yapamadığını test et:
Regression Eval'ları
Değişikliklerin mevcut fonksiyonaliteyi bozmadığından emin ol:
Grader Tipleri
1. Code-Based Grader
Kod kullanarak deterministik kontroller:
2. Model-Based Grader
Açık uçlu çıktıları değerlendirmek için Claude kullan:
3. Human Grader
Manuel inceleme için işaretle:
Metrikler
pass@k
"k denemede en az bir başarı"
- pass@1: İlk deneme başarı oranı
- pass@3: 3 denemede başarı
- Tipik hedef: pass@3 > %90
pass^k
"Tüm k denemeler başarılı"
- Güvenilirlik için daha yüksek çıta
- pass^3: Ardışık 3 başarı
- Kritik yollar için kullan
Eval İş Akışı
1. Tanımla (Kodlamadan Önce)
2. Uygula
Tanımlanan eval'ları geçmek için kod yaz.
3. Değerlendir
4. Rapor
Entegrasyon Kalıpları
İmplementasyondan Önce
.claude/evals/feature-name.md konumunda eval tanım dosyası oluşturur
İmplementasyon Sırasında
Mevcut eval'ları çalıştırır ve durumu raporlar
İmplementasyondan Sonra
Tam eval raporu oluşturur
Eval Depolama
Eval'ları projede sakla:
En İyi Uygulamalar
- Kodlamadan ÖNCE eval'ları tanımla - Başarı kriterleri hakkında net düşünmeyi zorlar
- Eval'ları sık çalıştır - Regresyonları erken yakala
- pass@k'yı zaman içinde izle - Güvenilirlik trendlerini gözle
- Mümkün olduğunda code grader kullan - Deterministik > olasılıksal
- Güvenlik için insan incelemesi - Güvenlik kontrollerini asla tam otomatikleştirme
- Eval'ları hızlı tut - Yavaş eval'lar çalıştırılmaz
- Eval'ları kodla versiyonla - Eval'lar birinci sınıf artifact'lardır
Örnek: Kimlik Doğrulama Ekleme
Product Eval'ları (v1.8)
Davranış kalitesi sadece birim testlerle yakalanamadığında product eval'ları kullan.
Grader Tipleri
- Code grader (deterministik assertion'lar)
- Rule grader (regex/şema kısıtlamaları)
- Model grader (LLM-as-judge rubric)
- Human grader (belirsiz çıktılar için manuel karar)
pass@k Kılavuzu
pass@1: doğrudan güvenilirlikpass@3: kontrollü yeniden denemeler altında pratik güvenilirlikpass^3: kararlılık testi (3 çalıştırmanın tümü geçmeli)
Önerilen eşikler:
- Capability eval'ları: pass@3 >= 0.90
- Regression eval'ları: yayın-kritik yollar için pass^3 = 1.00
Eval Anti-Kalıpları
- Prompt'ları bilinen eval örneklerine overfitting yapmak
- Sadece mutlu-yol çıktılarını ölçmek
- Geçme oranlarını kovalamken maliyet ve gecikme kaymasını görmezden gelmek
- Yayın kapılarında kararsız grader'lara izin vermek
Minimal Eval Artifact Düzeni
.claude/evals/<feature>.mdtanımı.claude/evals/<feature>.logçalıştırma geçmişidocs/releases/<version>/eval-summary.mdyayın snapshot'ı


