Type: entity
Confidence: 0.80
Created: 2026-04-20
Updated: 2026-04-20
Tags: 基准测试终端通用Agent评测AI工程

Terminal-Bench

概述

Terminal-Bench 是通用终端任务的评测基准,用于评估 AI Agent 在命令行环境中的任务完成能力。

关键内容

  1. 评测目标
  2. 评估 Agent 在终端/命令行环境中的操作能力
  3. 涵盖文件操作、系统管理、脚本编写等通用任务
  4. 提供标准化的终端任务评测框架

  5. 在评测体系中的位置

  6. SWE-bench(代码修复)、τ-Bench(对话)共同构成多维度 Agent 评测矩阵
  7. Anthropic 用于基础设施噪声量化研究(不同资源配置对成功率的影响达 6 个百分点)

  8. 相关研究

  9. Anthropic 团队发现 Terminal-Bench 上资源配置差异导致的结果波动
  10. 推荐 requests 和 limits 之间保持 3× 带宽以获得稳定结果

来源

相关