Type: concept
Confidence: 0.80
Created: 2026-04-25
Updated: 2026-04-25
Tags: LLM代理评估综合能力AI工程

AgentBench

概述

AgentBench是由Liu等人提出的LLM代理能力全面评估基准,在8个不同环境中测试代理能力。它揭示了GPT-4等顶级模型与其他模型之间的显著能力断层。

关键内容

  1. 八大测试环境
  2. OS(操作系统操作):Bash命令、文件管理
  3. DB(数据库):SQL查询、数据操作
  4. KG(知识图谱):SPARQL、推理
  5. 数字卡牌游戏:规则理解、策略规划
  6. 横向思维谜题:创意推理
  7. 家务模拟:多步骤物理规划
  8. 网购:搜索、比较、决策
  9. 网页浏览:DOM操作、信息提取

  10. 关键发现

  11. GPT-4总分约为第二名的2倍(存在显著能力断层)
  12. 开源模型在"需要多步规划的环境"(OS、DB)上远落后于GPT-4
  13. 工具调用的稳定性(格式正确率)是区分模型的关键指标

  14. 评估维度

  15. 任务规划能力
  16. 工具调用能力
  17. 环境交互能力
  18. 长期记忆能力

来源

相关