基础设施噪声
概述
Agentic 编码评测中,基础设施配置差异导致评测结果产生系统性偏差的现象,不同资源配置之间的成功率差距可达 6 个百分点,超过主流模型排行榜上顶级模型之间的差距。
关键内容
- 核心机制:在 SWE-bench 和 Terminal-Bench 2.0 等 Agentic 评测中,运行环境不再是被动容器,而是问题解决过程的核心组件。资源配置不同的 Agent 实际上在"做不同的测试"。
- 两阶段行为:
- 阶段一(1x → 3x):额外资源主要解决基础设施可靠性问题(容器被意外杀死),成功率在噪声范围内波动(p=0.40)
- 阶段二(3x → Uncapped):额外资源帮助 Agent 采用需要大量资源的解题策略,成功率跳跃 +4 个百分点
- 典型策略差异:富资源策略可安装 pandas + networkx + scikit-learn 等大型依赖库,贫资源策略被迫使用标准库从零实现——不同资源配置在评测不同的模型能力维度。
- 量化影响:
- Terminal-Bench 2.0:1x → Uncapped 差距达 6 个百分点(p < 0.01)
- SWE-Bench:5x vs 1x 仅高 1.54 个百分点(任务资源需求普遍较低)
- 分差 < 3 个百分点时应保持怀疑,可能处于基础设施噪声范围内
- 其他噪声来源:时间效应(通过率随一天中的时段波动)、并发级别、出口带宽、集群健康度。
- 校准建议:分别规定 resources 的 requests(保证分配)和 limits(硬性上限),推荐 3× requests 作为 limits 起点。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/06_infrastructure_noise.md — Quantifying infrastructure noise in agentic coding evals
相关
- Terminal-Bench 2.0 — affects(主要实验平台,6 个百分点差距)
- SWE-bench — affects(交叉验证,1.54 个百分点差距)
- 评测驱动开发 — challenges(挑战当前 Leaderboard 文化的可信度)
- OOM Kill — causes(资源超限导致容器终止,是基础设施错误的主要来源)
- Google Kubernetes Engine (GKE) — originates_from(在 GKE 集群上首次被发现)
- Gian Segato — discovered_by(由 Gian Segato 等量化研究)