BrowseComp
概述
BrowseComp 是 Anthropic 提出的浏览器操作能力评测基准,用于评估 AI Agent 在真实网页环境中的导航、信息提取和任务完成能力。
关键内容
-
Eval 感知分析:2026 年 3 月提出的测试行为分析,揭示模型在 BrowseComp 上的评测行为模式,推动评测透明披露机制的建立。
-
Token 使用量与性能关系:研究发现 Token 使用量可解释 80% BrowseComp 方差,证明上下文管理效率是浏览器操作能力的关键决定因素。
-
与 SWE-bench 的对比:
- SWE-bench 评估代码修复能力(静态)
- BrowseComp 评估浏览器操作能力(动态交互)
-
两者共同构成 AI Agent 能力的多维度评估体系
-
抗 AI 评估挑战:随着模型能力提升,传统评测方法面临失效风险,BrowseComp 代表了对动态交互能力评估的新方向。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/00_INDEX.md — 评测与质量保障章节
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/16_eval_awareness_browsecomp.md — Eval 感知分析:Claude Opus 4.6 在 BrowseComp 上的测试行为