Type: concept
Confidence: 0.95
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluationquality-assuranceagentAI工程

评测驱动开发

概述

评测驱动开发是 AI 系统质量保障的核心方法论,涵盖从基础设施噪声控制到抗 AI 技术评估的完整评测体系。

关键内容

  1. 完整评测方法论:2026 年 1 月提出的从零到一的系统工程指南,定义四类 Agent 评测策略,建立完整的评测框架质量保障体系。

  2. 基础设施噪声量化Gian Segato 等通过受控实验发现,在 Terminal-Bench 2.0 上不同资源配置之间的成功率差距达 6 个百分点(p < 0.01),超过主流模型排行榜上顶级模型之间的差距。实验揭示两阶段行为:3x 以下主要修复基础设施可靠性,3x 以上额外资源真正帮助 Agent 解决新任务。推荐配置 requests 和 limits 之间保持 3× 带宽。

  3. SWE-bench 实践:在 SWE-bench Verified 上树立新标杆,发现工具优化优于 Prompt 优化的工程结论。证明实际工具能力比提示词工程更能提升性能。

  4. Eval 感知与抗 AI 评估

  5. BrowseComp 测试行为分析:2026 年 3 月提出模型评测行为的透明披露机制
  6. AI 抗性评估:2026 年 1 月重新定义技术能力评测,应对 AI 时代传统评估方法的失效

  7. 评测与工程实践结合:评测不仅是测量工具,更是工程优化的指南针,直接指导 Agent 架构设计和工具接口改进。

  8. 从零到一的路线图

  9. 阶段一:从 20-50 个任务开始,而非等待数百个;从手动测试开始,将开发中验证的行为转化为测试案例;创建参考解(Reference Solution)验证任务可解和评分器配置正确
  10. 阶段二:构建稳定的评测环境(每次 Trial 从干净环境开始);避免路径评测,评测结果(Outcome)而非过程(Transcript);为多组件任务设置部分分数
  11. 阶段三:阅读 Transcript 确保评分器正常工作;防止 eval 饱和(100% 通过率只能追踪回退,不能推动改进);将 eval 作为活文档维护

  12. Eval 驱动开发的哲学

  13. 与 TDD(测试驱动开发)深度类比:先写 eval(定义成功),再迭代 Agent 直到通过
  14. 知识明确化的过程:两个工程师阅读同一产品规格,可能对边缘情况有不同理解;写 eval 任务是解决分歧的最直接方式
  15. Eval 的价值是复利性的:早期迫使团队明确定义成功,中期阻止回退/加速调试,晚期成为与研究团队沟通的最高带宽渠道

  16. Eval 的反脆弱性设计

  17. 设计评分器对绕过和作弊有抵抗性
  18. 避免检查具体工具调用序列(Agent 可能以不同方式完成任务)
  19. 验证实际环境状态(Outcome),而非 Agent 自我报告(Transcript 声明)
  20. 隔离每次 Trial(防止跨试验共享状态带来的不公平优势)

来源

相关