Type: concept
Confidence: 0.95
Created: 2026-04-15
Updated: 2026-04-20
Tags: AI评估LLM测试机器学习AI工程评分器

LLM-as-Judge

概述

使用 LLM 作为自动评判器(Judge),对 AI 系统的输出按预定义准则打分,代替人工评估。适用于难以用规则/子串匹配表达的语义正确性、风格、完整性、多条件综合等评估目标。核心假设:强模型(如 Claude Sonnet)对人类语言理解足够准确,其判断可近似替代人工标注

关键内容

适用场景

方式 适用 优点 注意
确定性断言(子串/文件相等) 事实性短答案、精确固定短语 成本低、可复现、无模型方差 无法覆盖语义等价表述
LLM-as-Judge 语义正确性、语气风格、推理完整性、多条件组合 灵活,接近人类验收标准 成本/延迟更高;需固定 judge 模型以便横向对比

工作原理

  1. 将 Agent 输出(或完整轨迹)序列化
  2. 对每条评判准则单独调用 LLM:evaluator(outputs=..., criterion=...)
  3. LLM 返回 {"score": ..., "comment": ...}
  4. 所有准则 score 为真 → 评判通过

最佳实践

DeepAgents 实现(LLMJudge

scorer = TrajectoryScorer().success(
    llm_judge(
        "答案正确提到了巴黎是法国首都",
        "语气自然,非机器人式",
        include_tool_calls=False,
    )
)

局限性

来源

Anthropic Research 系统的 LLM-as-Judge 实践

相关