Phoenix Evals

arize-ai/phoenix/.agents/skills/phoenix-evals

作者 arize-ai4b1fa58bc7d6Apache-2.011K 个星标收录于 2026年10月9日更新于 2026年10月9日仓库今天更新

Build and run evaluators for AI/LLM applications using Phoenix.

仅含说明AI & Agents
AI 生成的概览

指导使用 Phoenix 为 AI/LLM 应用构建和运行评估器,涵盖代码与 LLM 评判、数据集、实验和 CI 门禁。

功能
该技能提供使用 Phoenix 为 AI 和 LLM 应用构建评估器的参考文档。内容涵盖 Python 与 TypeScript 环境搭建、评判模型选择、预置及自定义的代码或 LLM 评估器、RAG 评估、数据集与合成数据、运行实验、依据人工标注验证评估器准确度、追踪与采样、错误分析以及生产防护措施。它仅为说明文档,本身不生成脚本或文件。
适用场景
当你需要为 LLM 应用创建、运行或验证评估器,搭建 Phoenix 追踪与错误分析,构建评估数据集或实验,或依据评估结果设置 CI 门禁时使用。
运行要求
需要 Phoenix 服务器。Python 相关工作需要 phoenix 和 openai 包;TypeScript 相关工作需要 @arizeai/phoenix-client。不附带脚本,仅为参考文档。

Phoenix Evals

Build evaluators for AI/LLM applications. Code first, LLM for nuance, validate against humans.

Quick Reference

TaskFiles
Setupsetup-python [blocked], setup-typescript [blocked]
Decide what to evaluateevaluators-overview [blocked]
Choose a judge modelfundamentals-model-selection [blocked]
Use pre-built evaluatorsevaluators-pre-built [blocked]
Build code evaluatorevaluators-code-python [blocked], evaluators-code-typescript [blocked]
Build LLM evaluatorevaluators-llm-python [blocked], evaluators-llm-typescript [blocked], evaluators-custom-templates [blocked]
Batch evaluate DataFrameevaluate-dataframe-python [blocked]
Run experimentexperiments-running-python [blocked], experiments-running-typescript [blocked]
Run evals in a test runner (CI gate)integrations-pytest [blocked], integrations-vitest-jest [blocked]
Create datasetexperiments-datasets-python [blocked], experiments-datasets-typescript [blocked]
Generate synthetic dataexperiments-synthetic-python [blocked], experiments-synthetic-typescript [blocked]
Validate evaluator accuracyvalidation [blocked], validation-evaluators-python [blocked], validation-evaluators-typescript [blocked]
Export spansobserve-tracing-setup [blocked]
Write a span filter (SpanQuery().where)filter-expressions [blocked]
Sample traces for reviewobserve-sampling-python [blocked], observe-sampling-typescript [blocked]
Analyze errorserror-analysis [blocked], error-analysis-multi-turn [blocked], axial-coding [blocked]
RAG evalsevaluators-rag [blocked]
Avoid common mistakescommon-mistakes-python [blocked], fundamentals-anti-patterns [blocked]
Productionproduction-overview [blocked], production-guardrails [blocked], production-continuous [blocked]

Workflows

Starting Fresh: observe-tracing-setup [blocked] → error-analysis [blocked] → axial-coding [blocked] → evaluators-overview [blocked]

Building Evaluator: fundamentals [blocked] → common-mistakes-python [blocked] → evaluators-{code|llm}-{python|typescript} → validation-evaluators-{python|typescript}

RAG Systems: evaluators-rag [blocked] → evaluators-code-* (retrieval) → evaluators-llm-* (faithfulness)

Gating CI: evaluators-{code|llm}-{python|typescript} → integrations-{pytest|vitest-jest} → production-continuous [blocked]

Production: production-overview [blocked] → production-guardrails [blocked] → production-continuous [blocked]

Reference Categories

PrefixDescription
fundamentals-*Types, scores, anti-patterns
observe-*Tracing, sampling
error-analysis-*Finding failures
axial-coding-*Categorizing failures
evaluators-*Code, LLM, RAG evaluators
experiments-*Datasets, running experiments
integrations-*Run evals from test runners (pytest, Vitest, Jest) as a CI gate
validation-*Validating evaluator accuracy against human labels
production-*CI/CD, monitoring

Key Principles

PrincipleAction
Error analysis firstCan't automate what you haven't observed
Custom > genericBuild from your failures
Code firstDeterministic before LLM
Validate judges>80% TPR/TNR
Binary > LikertPass/fail, not 1-5
Invariants gate, signals trendassert/expect hard invariants (CI red); log LLM-judge quality signals and gate the aggregate (acceptance criteria), not every case

来源与署名

来源:arize-ai/phoenix位于.agents/skills/phoenix-evals提交4b1fa58

许可证: Apache-2.0

内容归原作者所有。SourceWeft 从公开仓库中收录这些内容。

举报或申请下架