模式目录/横切工程面/X2
ADPS 横切工程面规范
X2 · Evals & Testing · 评测与测试
以可重复样本、评分器、回归和外部验收管理 Agent 能力证据。
X2 管理 Agent 能力的验证证据。它把确定性测试、行为评测、外部验收和生产反馈接到同一发布与复验流程。
范围
被测对象可以是模型、提示词、工具、Skill、路由、工作流、治理策略或完整 Agent 系统。对象不同,样本、环境、评分器和发布门也随之变化。
| 证据 | 适用判断 |
|---|---|
| 外部事实与业务回执 | 现实状态是否达到目标 |
| schema、规则、状态机与幂等断言 | 确定性合同是否成立 |
| 轨迹、沙箱与故障注入 | 执行路径、恢复和权限边界是否可靠 |
| 校准后的模型评分器 | 难以写成硬规则的语义质量 |
| 专家或用户复核 | 含糊标准与高风险发布裁决 |
Eval Contract
eval_id: payroll-change-regression-v3
system_under_test: payroll-agent@v8
task: change_one_allowance
environment: payroll-sandbox@2026.08
allowed_authority: no_production_write
required_outcomes: [receipt_matches_after_read]
forbidden_outcomes: [modify_unrelated_employee]
graders: [schema_contract, ledger_probe]
trials: 5
release_gate: all_required_cases_pass
evidence: artifacts/evals/payroll-v3/
生命周期
设计阶段定义能力样本与负例;发布前同时运行能力集和回归集;灰度阶段比较影子流量与现行版本;运行故障进入可重放样本;模型、工具、策略或数据变化后重新认证。G3 的授权升降级使用 X2 的结果,不能只看一次演示。
与 X1、X3 的边界
X1 记录发生了什么,X2 按合同判断结果是否合格,X3 限制评测器和候选系统各自能够访问或改写什么。Agent 与 grader 同时修改,或由候选系统自由改写发布门,会破坏结论的独立性。
常见失效
- 只测最终文本,不检查外部状态;
- 只运行一次,将随机成功当成稳定能力;
- 只有正例,没有拒绝、越权、恢复和未知输入;
- 用一条 golden trajectory 排除其他正确路径;
- 只公布综合分数,不保留样本级失败和轨迹;
- grader 未经人工校准,分数变化无法解释。
引用建议:ADPS,《X2 · Evals & Testing · 评测与测试》,ADPS 横切工程面规范 v0.5,2026-08-20。
Evals 与测试专题 · 反思研讨会 · CC BY 4.0
使用边界:本页定义工程范围与接口,不构成产品认证。具名实践以案例页与公开代码为准。