Type: concept
Confidence: 0.80
Created: 2026-04-16
Updated: 2026-04-16
Tags: AI方法论AI工程

HumanEvalFix

概述

HumanEvalFix 是代码修复能力的基准测试,评估 AI 模型或 Agent 在给定有缺陷的代码后,能否正确修复 bug 并通过所有测试用例。与 SWE-bench 聚焦真实仓库 issue 不同,HumanEvalFix 更侧重单函数级别的代码修复能力。

关键内容

测试机制

代表性结果

与 SWE-bench 的对比

维度 HumanEvalFix SWE-bench
粒度 单函数级别 真实仓库 issue 级别
复杂度 低(上下文有限) 高(需跨文件导航)
SWE-agent pass@1 87.7% 12.5%
评估重点 代码修复正确性 完整工程工作流

这一差距说明:ACI 设计在复杂任务上的价值远大于简单任务——当任务复杂度提升时,好的交互界面带来的优势更加显著。

来源

相关