Terminal-Bench
概述
Terminal-Bench 是通用终端任务的评测基准,用于评估 AI Agent 在命令行环境中的任务完成能力。
关键内容
- 评测目标:
- 评估 Agent 在终端/命令行环境中的操作能力
- 涵盖文件操作、系统管理、脚本编写等通用任务
-
提供标准化的终端任务评测框架
-
在评测体系中的位置:
- 与 SWE-bench(代码修复)、τ-Bench(对话)共同构成多维度 Agent 评测矩阵
-
相关研究:
- Anthropic 团队发现 Terminal-Bench 上资源配置差异导致的结果波动
- 推荐 requests 和 limits 之间保持 3× 带宽以获得稳定结果
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/12_demystifying_evals.md — 参考与扩展阅读