Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: evaluationinfrastructurebenchmarkreliabilityLua编程

基础设施噪声

概述

Agentic 编码评测中,基础设施配置差异导致评测结果产生系统性偏差的现象,不同资源配置之间的成功率差距可达 6 个百分点,超过主流模型排行榜上顶级模型之间的差距。

关键内容

  1. 核心机制:在 SWE-benchTerminal-Bench 2.0 等 Agentic 评测中,运行环境不再是被动容器,而是问题解决过程的核心组件。资源配置不同的 Agent 实际上在"做不同的测试"。
  2. 两阶段行为
  3. 阶段一(1x → 3x):额外资源主要解决基础设施可靠性问题(容器被意外杀死),成功率在噪声范围内波动(p=0.40)
  4. 阶段二(3x → Uncapped):额外资源帮助 Agent 采用需要大量资源的解题策略,成功率跳跃 +4 个百分点
  5. 典型策略差异:富资源策略可安装 pandas + networkx + scikit-learn 等大型依赖库,贫资源策略被迫使用标准库从零实现——不同资源配置在评测不同的模型能力维度。
  6. 量化影响
  7. Terminal-Bench 2.0:1x → Uncapped 差距达 6 个百分点(p < 0.01)
  8. SWE-Bench:5x vs 1x 仅高 1.54 个百分点(任务资源需求普遍较低)
  9. 分差 < 3 个百分点时应保持怀疑,可能处于基础设施噪声范围内
  10. 其他噪声来源:时间效应(通过率随一天中的时段波动)、并发级别、出口带宽、集群健康度。
  11. 校准建议:分别规定 resources 的 requests(保证分配)和 limits(硬性上限),推荐 3× requests 作为 limits 起点。

来源

相关