Type: concept
Confidence: 0.75
Created: 2026-04-25
Updated: 2026-04-25
Tags: LLM任务编排评估基准AI工程

TaskBench

概述

TaskBench是由Shen等人提出的基准,用于评估LLM的任务自动化能力,特别关注任务编排能力。它从三个维度评估LLM在技能编排方面的能力。

关键内容

  1. 三个评估维度
  2. Tool Graph Construction(工具图构建):能否正确识别任务依赖关系
  3. Tool Selection(工具选择):能否在多个可选工具中选最合适的
  4. Parameter Prediction(参数预测):能否正确填写工具调用的参数

  5. 关键发现

  6. GPT-4在工具图构建上显著优于其他模型(复杂依赖推理)
  7. 工具描述歧义是导致工具选择错误的首要原因(43%的错误)
  8. 工具数量超过20个时,所有模型性能均显著下降

  9. 技能文件设计的启示

  10. 清晰的工具描述至关重要
  11. 工具间依赖关系需要明确定义
  12. 参数规范需要详细说明

来源

相关