τ-Bench
概述
τ-Bench 是对话 Agent 的评测基准,用于评估 Agent 在多轮对话任务中的表现,由 Anthropic 相关团队提出。
关键内容
- 评测目标:
- 专注于对话式 Agent 的质量评估
- 模拟真实用户与 Agent 的多轮交互场景
-
衡量任务完成率、对话效率和用户满意度
-
与 τ2-Bench 的关系:
- τ2-Bench 是其后续版本(arxiv: 2506.07982)
-
两者共同构成对话 Agent 评测的标准基准
-
在评测体系中的位置:
- 与 SWE-bench(编码)、WebArena/OSWorld(计算机使用)共同构成多类型 Agent 评测矩阵
- 被 Anthropic 工程博客引用为对话 Agent 评测的参考标准
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/12_demystifying_evals.md — 参考与扩展阅读