Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: 基准测试对话Agent评测AnthropicAI工程

τ-Bench

概述

τ-Bench 是对话 Agent 的评测基准,用于评估 Agent 在多轮对话任务中的表现,由 Anthropic 相关团队提出。

关键内容

  1. 评测目标
  2. 专注于对话式 Agent 的质量评估
  3. 模拟真实用户与 Agent 的多轮交互场景
  4. 衡量任务完成率、对话效率和用户满意度

  5. τ2-Bench 的关系

  6. τ2-Bench 是其后续版本(arxiv: 2506.07982)
  7. 两者共同构成对话 Agent 评测的标准基准

  8. 在评测体系中的位置

  9. SWE-bench(编码)、WebArena/OSWorld计算机使用)共同构成多类型 Agent 评测矩阵
  10. Anthropic 工程博客引用为对话 Agent 评测的参考标准

来源

相关