Type: concept
Confidence: 0.80
Created: 2026-04-25
Updated: 2026-04-25
Tags: LLM工具调用大规模工具工具检索工具与框架

ToolBench

概述

ToolBench是由Qin等人提出的大型工具调用基准和框架,涵盖RapidAPI上的49类、16,464个真实API,构建了268,000条工具使用指令和多工具协作场景。ToolLLM是基于ToolBench微调的模型。

关键内容

  1. 数据集规模
  2. 覆盖49类、16,464个真实API
  3. 268,000条工具使用指令
  4. 包含多工具协作场景(需要3-5个API组合完成)

  5. 核心技术:DFSDT

  6. DFSDT(深度优先搜索决策树):将工具调用建模为决策树搜索
  7. 遇到工具调用失败时,不是无脑重试,而是系统性探索替代路径
  8. 与传统ReAct线性方式不同,支持回溯和路径探索

  9. 评估指标ToolEval

  10. 通过率(Pass Rate):任务是否成功完成
  11. 偏好胜率(Win Rate):人类偏好哪个解决方案(相对于ChatGPT-ReAct

  12. 实验结果

  13. ToolLLaMA在Win Rate上达到ChatGPT的83%
  14. 证明了大规模工具调用的可行性

来源

相关