
Eval Audit
hamelsmu/evals-skills/skills/eval-audit作者 hamelsmu22418da2bfb159f28a1b0dcf64e969e14ae56c99無授權條款1.6K 個星標收錄於 2026年10月9日更新於 2026年10月9日儲存庫7 週前更新
Audit an LLM eval pipeline and surface problems: missing error analysis, unvalidated judges, vanity metrics, etc. Use when inheriting an eval system, when unsure whether evals are trustworthy, or as a starting point when no eval infrastructure exists. Do NOT use when the goal is to build a new evaluator from scratch (use error-analysis, write-judge-prompt, or validate-evaluator instead).
- 22418da2bfb159f28a1b0dcf64e969e14ae56c99目前提交 22418da發布於 2026年10月9日
來源與署名
來源:hamelsmu/evals-skills位於skills/eval-audit提交22418da
授權條款: 無授權條款
內容歸原作者所有。SourceWeft 從公開儲存庫中收錄這些內容。
更多來自 hamelsmu/evals-skills 的技能

Validate Evaluator
hamelsmu
使用資料切分、TPR/TNR 指標與偏差校正,將 LLM 評審器與人工標註進行校準。

Generate Synthetic Data
hamelsmu
指導使用以維度為基礎的元組生成方式,為 LLM 流程評估建立多樣化的合成測試查詢。

Evaluate Rag
hamelsmu
指導 RAG 檢索與生成品質評估,涵蓋指標、合成問答資料集與分塊最佳化。

Error Analysis
hamelsmu
指導對 LLM 管線 trace 進行系統性錯誤分析,建立失敗模式目錄並排出修正優先順序。
更多AI & Agents技能

Discernment Nudge
anthropics
在實質回答後附加 2-3 個具體追問,協助使用者查核事實、推理與缺少的背景。

Ppt Template Creator
anthropics
將使用者的 PowerPoint 範本轉換為可重用的技能,用來產生品牌簡報。

Skill Development
anthropics
指導建立 Claude Code 外掛技能,涵蓋結構、描述、漸進式揭露與驗證。

Plugin Structure
anthropics
說明 Claude Code 外掛的結構、資訊清單與元件配置方式。

Command Development
anthropics
指導建立 Claude Code 斜線命令,涵蓋結構、YAML frontmatter、參數與外掛功能。

Claude Md Improver
anthropics
稽核儲存庫中的 CLAUDE.md 檔案、評估其品質,並在取得核准後套用針對性的改進。