Type: concept
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluationbenchmarkbrowsingAI工程

BrowseComp

概述

BrowseComp 是 Anthropic 提出的浏览器操作能力评测基准,用于评估 AI Agent 在真实网页环境中的导航、信息提取和任务完成能力。

关键内容

  1. Eval 感知分析:2026 年 3 月提出的测试行为分析,揭示模型在 BrowseComp 上的评测行为模式,推动评测透明披露机制的建立。

  2. Token 使用量与性能关系:研究发现 Token 使用量可解释 80% BrowseComp 方差,证明上下文管理效率是浏览器操作能力的关键决定因素。

  3. SWE-bench 的对比

  4. SWE-bench 评估代码修复能力(静态)
  5. BrowseComp 评估浏览器操作能力(动态交互)
  6. 两者共同构成 AI Agent 能力的多维度评估体系

  7. 抗 AI 评估挑战:随着模型能力提升,传统评测方法面临失效风险,BrowseComp 代表了对动态交互能力评估的新方向。

来源

相关