Type: concept
Confidence: 0.70
Created: 2026-04-25
Updated: 2026-04-25
Tags: ai-engineeringexperimentcase-studyAI工程

OpenAI百万行代码实验

概述

OpenAI进行的一项实验,展示了3名工程师在5个月内使用Codex Agent从空仓库构建了超过100万行代码的产品,所有代码均由AI生成,无一行手写。

关键内容

  1. 实验设置
  2. 参与人员:3名工程师
  3. 时间周期:5个月
  4. 提交数量:大约1,500个PR(平均每人每天3.5个)
  5. 代码总量:超过100万行代码
  6. 生成方式:所有代码由Codex生成,无一行手写

  7. 早期挑战

  8. 进展比预期慢,不是因为Codex编码能力不足
  9. 主要原因是环境未搭建好,Agent不了解项目依赖结构、架构约束
  10. 无法验证产出的正确性
  11. AI表现出类似新人入职的体验:能力没问题,但不了解组织规矩

  12. 解决方案 - 规则编码

  13. 将项目规则写下来,让机器能读懂
  14. 设计严格的依赖方向:Types → Config → Repo → Service → Runtime → UI
  15. 将约束编码成自定义Linter规则,CI自动拒绝违规代码
  16. 创建约100行的AGENTS.md,称为"地图,而不是百科全书"

  17. 关键创新

  18. 本地可观测性系统:每个git worktree启动独立应用实例
  19. Agent通过Chrome DevTools Protocol直接操控浏览器验证UI
  20. Agent可随时查看自己产出的效果,无需人工检查

  21. 自动化清理

  22. 团队最初每周花费20%时间清理Agent产生的"AI slop"(风格不一致、过度抽象、命名奇怪的代码)
  23. 后来将清理标准编码为"golden principles",让Codex根据原则自动重构
  24. 实现从人工清理到自动清理的反馈回路闭合

  25. 核心哲学

  26. "Humans steer. Agents execute."(人负责掌舵,Agent负责执行)
  27. 工程师角色从写代码转变为设计让代码被正确写出来的系统

来源

相关