Type: concept
Confidence: 0.90
Created: 2026-04-20
Updated: 2026-04-20
Tags: ai-engineeringevaluation评分器质量保障AI工程

评分器设计

概述

评分器设计是 Agent 评测的核心组件,涵盖基于代码、基于模型(LLM-as-Judge)、人工三类评分器的选择策略与最佳实践。

关键内容

  1. 基于代码的评分器
  2. 字符串匹配(精确/正则/模糊):快速、便宜、客观,但对格式变体过于严格
  3. 二进制测试(fail-to-pass/pass-to-pass):天然适合编码任务,但缺乏细粒度
  4. 静态分析(lint/类型/安全):客观评估代码质量,不能评估语义正确性
  5. 结果验证(检查 DB 状态等):最接近真实用户体验,需要可访问的持久化状态
  6. 工具调用验证:验证关键流程步骤,但 Agent 可能以不同方式完成任务

  7. 基于模型的评分器(LLM-as-Judge

  8. 灵活、可扩展、能捕捉细粒度、适合开放性任务
  9. 非确定性、更昂贵、需要与人类持续校准
  10. 最佳实践:给退路、独立维度、结构化 Rubric、定期校准

  11. 人工评分器

  12. 黄金标准,捕捉自动化检查遗漏的边缘情况
  13. 典型案例:Descript 发现 Agent 视频编辑意外行为;Anthropic 发现研究 Agent 偏向 SEO 内容农场
  14. 应用于校准 LLM 评分器和发现系统性偏差

  15. 设计原则

  16. 避免检查具体工具调用序列(Agent 可能以不同方式完成任务)
  17. 验证实际环境状态(Outcome),而非 Agent 自我报告(Transcript 声明)
  18. 为多组件任务设置部分分数(如解决但遗漏退款的客服 Agent 比立即失败的强)
  19. 设计评分器对绕过和作弊有抵抗性

来源

相关