评测驱动开发
概述
评测驱动开发是 AI 系统质量保障的核心方法论,涵盖从基础设施噪声控制到抗 AI 技术评估的完整评测体系。
关键内容
-
完整评测方法论:2026 年 1 月提出的从零到一的系统工程指南,定义四类 Agent 评测策略,建立完整的评测框架和质量保障体系。
-
基础设施噪声量化:Gian Segato 等通过受控实验发现,在 Terminal-Bench 2.0 上不同资源配置之间的成功率差距达 6 个百分点(p < 0.01),超过主流模型排行榜上顶级模型之间的差距。实验揭示两阶段行为:3x 以下主要修复基础设施可靠性,3x 以上额外资源真正帮助 Agent 解决新任务。推荐配置 requests 和 limits 之间保持 3× 带宽。
-
SWE-bench 实践:在 SWE-bench Verified 上树立新标杆,发现工具优化优于 Prompt 优化的工程结论。证明实际工具能力比提示词工程更能提升性能。
-
Eval 感知与抗 AI 评估:
- BrowseComp 测试行为分析:2026 年 3 月提出模型评测行为的透明披露机制
-
AI 抗性评估:2026 年 1 月重新定义技术能力评测,应对 AI 时代传统评估方法的失效
-
评测与工程实践结合:评测不仅是测量工具,更是工程优化的指南针,直接指导 Agent 架构设计和工具接口改进。
-
从零到一的路线图:
- 阶段一:从 20-50 个任务开始,而非等待数百个;从手动测试开始,将开发中验证的行为转化为测试案例;创建参考解(Reference Solution)验证任务可解和评分器配置正确
- 阶段二:构建稳定的评测环境(每次 Trial 从干净环境开始);避免路径评测,评测结果(Outcome)而非过程(Transcript);为多组件任务设置部分分数
-
阶段三:阅读 Transcript 确保评分器正常工作;防止 eval 饱和(100% 通过率只能追踪回退,不能推动改进);将 eval 作为活文档维护
-
Eval 驱动开发的哲学:
- 与 TDD(测试驱动开发)深度类比:先写 eval(定义成功),再迭代 Agent 直到通过
- 是知识明确化的过程:两个工程师阅读同一产品规格,可能对边缘情况有不同理解;写 eval 任务是解决分歧的最直接方式
-
Eval 的价值是复利性的:早期迫使团队明确定义成功,中期阻止回退/加速调试,晚期成为与研究团队沟通的最高带宽渠道
-
Eval 的反脆弱性设计:
- 设计评分器对绕过和作弊有抵抗性
- 避免检查具体工具调用序列(Agent 可能以不同方式完成任务)
- 验证实际环境状态(Outcome),而非 Agent 自我报告(Transcript 声明)
- 隔离每次 Trial(防止跨试验共享状态带来的不公平优势)
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/00_INDEX.md — 评测与质量保障章节
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/06_infrastructure_noise.md — 基础设施噪声量化研究
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/07_swe_bench_sonnet.md — Claude 3.5 Sonnet SWE-bench SOTA 成绩与工程洞察
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/12_demystifying_evals.md — Agent 评测从零到一的系统工程指南(完整评测生命周期)
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/16_eval_awareness_browsecomp.md — Eval 感知分析:Claude Opus 4.6 在 BrowseComp 上的测试行为
相关
- Anthropic — part_of
- SWE-bench — uses
- BrowseComp — uses
- Claude Code — relates_to
- Agent 架构与设计原则 — relates_to
- 基础设施噪声 — includes(基础设施噪声量化是评测驱动开发的重要发现)
- Terminal-Bench 2.0 — uses(评测基础设施噪声的实验平台)
- Gian Segato — contributed_by(基础设施噪声研究的作者)
- 测试驱动的 Agent 工程 — extends(测试驱动是评测驱动在 Agent 场景的具体应用)
- Claude 3.5 Sonnet — uses(Claude 3.5 Sonnet 的 SWE-bench 成绩是评测驱动的典型案例)
- 评测感知 — part_of(评测感知是评测驱动开发中需要应对的新挑战)
- 评测饱和 — part_of(评测饱和是评测驱动开发需要防止的问题)
- 影子评测 — uses(影子评测是评测驱动开发的方法之一)