ToolBench
概述
ToolBench是由Qin等人提出的大型工具调用基准和框架,涵盖RapidAPI上的49类、16,464个真实API,构建了268,000条工具使用指令和多工具协作场景。ToolLLM是基于ToolBench微调的模型。
关键内容
- 数据集规模:
- 覆盖49类、16,464个真实API
- 268,000条工具使用指令
-
包含多工具协作场景(需要3-5个API组合完成)
-
核心技术:DFSDT:
- DFSDT(深度优先搜索决策树):将工具调用建模为决策树搜索
- 遇到工具调用失败时,不是无脑重试,而是系统性探索替代路径
-
与传统ReAct线性方式不同,支持回溯和路径探索
-
评估指标ToolEval:
- 通过率(Pass Rate):任务是否成功完成
-
实验结果:
- ToolLLaMA在Win Rate上达到ChatGPT的83%
- 证明了大规模工具调用的可行性
来源
- llm-skill-research-series.md — LLM Skill研究系列
- Paper — "ToolLLM: Facilitating Large Language Models to Master 16000+ Real-world APIs", ICLR 2024
相关
- LLM-Skill-技术全景 — relates_to
- Large-Scale-Tools — relates_to
- Tool-Retrieval — relates_to
- Tool-Evaluation — relates_to