Type: concept
Confidence: 0.60
Created: 2026-04-25
Updated: 2026-04-25
Tags: ai-engineeringarchitecture-decisiondebateAI工程

Build Heavy Harness vs Trust The Model

概述

AI Agent工程中的一个重要争议,涉及如何平衡Harness(执行环境)的复杂度与对模型能力的信任度。

关键内容

  1. Build Heavy Harness 阵营
  2. 认为需要构建复杂的Harness来约束和引导AI Agent
  3. 证据包括:OpenAI的百万行代码实验、Stripe的Minions Agent、LangChainSWE-agent的数据
  4. 强调确定性分析工具与LLM结合的重要性(IBM Research数据显示:纯LLM代码审查仅捕获45%错误,结合确定性工具后跃升至94%)
  5. 通过Terminal Bench 2.0成绩从52.8%升至66.5%的案例证明Harness优化效果

  6. Trust The Model 阵营

  7. 认为应采用"模型之上尽可能薄的包装层"的设计哲学
  8. AnthropicClaude Code团队为代表
  9. 认为模型能力才是核心,Harness越轻越好
  10. 认为较弱模型的复杂脚手架会被更强模型替代
  11. METR研究发现基础脚手架与专门构建系统表现相当

  12. 争议焦点

  13. OpenAI研究员Noam Brown认为复杂脚手架会被更强模型替代
  14. Martin Fowler质疑OpenAI文章缺乏对行为正确性的验证
  15. 对遗留代码库改造代价的担忧

  16. 综合观点

  17. 模型确实在变强,一些过去需要精心构造的prompt现在可直接完成
  18. 但Harness不会因此消失,如同编译器增强并未淘汰CI/CD
  19. 架构规范和测试不会因Agent能力强而可以删除
  20. 最优Harness厚度可能取决于项目规模和生命周期

  21. 未来发展

  22. 模型进化速度是否会快到让精心构建的Harness来不及发挥价值就过时
  23. Harness形态会随模型能力变化而演化,但底层逻辑(自动化验证和约束)不变

来源

相关