Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-20
Tags: AI方法论AI工程评测

SWE-bench

概述

SWE-bench 是软件工程 Agent 的基准测试集,用于评估 AI Agent 自动修复 GitHub 仓库中真实 issue 和 bug 的能力。采用 pass@1 指标,即 Agent 一次性成功修复问题的比例。

关键内容

测试机制

代表性结果

该结果被用来支撑核心论点:交互式 Agent + 专门设计的 ACI,比"只让模型直接输出 patch"更适合真实软件工程任务。

在 ACI 研究中的角色

Agent计算机接口 研究中,SWE-bench 被用作工具设计质量的验证平台: - Anthropic 在 SWE-bench 中花费在工具优化上的时间多于整体提示词优化 - 仅改工具描述就在 SWE-bench 上达到 SOTA - 证明了"接口设计质量直接决定 Agent 成功率"的核心假设

Claude 3.5 Sonnet 的 SOTA 成绩

Claude 3.5 Sonnet 在 SWE-bench Verified 上实现 49% 解决率(当时 SOTA,后续迭代达到更高): - 采用简单单 Agent 架构(无复杂多 Agent 编排) - 核心发现:工具优化比 prompt 优化花更多时间 - 关键工具改进:要求绝对路径解决相对路径错误 - Think 工具 集成:实验提升 1.6%(Welch t 检验 p < 0.001,d=1.47) - 测试驱动反馈循环:生成补丁 → 运行测试 → 分析失败 → 修改策略 → 重试

与其他评估体系的对比

维度 SWE-bench HumanEvalFix DeepAgents评估体系
评估对象 真实仓库 issue 修复 单函数级代码修复 多轮 Agent 轨迹
粒度 仓库级(跨文件) 函数级 工作流级
指标 pass@1 成功率 pass@1 成功率 成功断言 + 效率断言
SWE-agent pass@1 12.5% 87.7%
场景 静态代码修复 静态代码修复 动态多步工作流

SWE-agentHumanEvalFix 上 87.7% vs SWE-bench 上 12.5% 的巨大差距说明:ACI 设计在复杂任务上的价值远大于简单任务——当任务复杂度从函数级提升到仓库级时,好的交互界面带来的优势更加显著。

Eval 饱和问题

SWE-bench 是评测饱和(eval saturation)的典型案例: - 从 30% 开始,顶级模型现在接近 80%,差距越来越难推动 - 100% 通过率只能追踪回退,不能推动改进 - 当 eval 饱和时,需要构建更难的新 eval - 这是 Anthropic 工程博客中强调的评测维护重要教训

来源

Think 工具在 SWE-bench 上的表现

Think 工具 被集成到 SWE-bench 评估中: - 实验规模:n=30(有 think 工具) vs n=144(无 think 工具) - 性能提升:平均提升 1.6%(Welch t 检验:p < 0.001,效应量 d=1.47) - 效应量相当大但平均提升仅 1.6%,说明 think 工具在编码场景中改善了稳定性(减少极端失败),而非系统性提升所有任务

相关