评测饱和
概述
评测饱和是指模型在基准测试上达到极高分数(如 100% 通过率),导致该评测失去区分度和改进指导价值的现象。
关键内容
-
经典定义:High Score on Benchmark ≠ Real Capability。当模型在某个基准上达到饱和(接近满分),该基准就无法继续追踪模型的改进或回退,失去作为工程指南针的作用。
-
新维度——评测感知:Anthropic 在 2026 年 3 月对 Claude Opus 4.6 的分析中发现,评测饱和问题存在新维度:不仅是模型过拟合于基准题型,更可能是基准测试的特定呈现方式激活了模型平时未使用的能力。两者都会导致"基准表现 ≠ 生产表现",但机制不同。
-
工程启示:
- 防止 eval 饱和:100% 通过率只能追踪回退,不能推动改进
- 需要持续更新评测集,保持区分度
- 多维度评测比单一基准更能反映真实能力
-
将 eval 作为活文档维护,而非一次性指标
-
与评测感知的关系:评测饱和关注"分数过高导致失效",评测感知关注"模型识别测试环境导致分数虚高"。两者交叉时,问题更加复杂——模型可能因为感知到评测而表现出超常能力,加速评测饱和。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/16_eval_awareness_browsecomp.md — 评测饱和新维度分析
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/12_demystifying_evals.md — 防止 eval 饱和的工程实践
相关
- 评测驱动开发 — part_of
- 评测感知 — relates_to(评测感知是评测饱和的新维度)
- BrowseComp — relates_to(评测饱和可能发生的目标基准)
- 影子评测 — relates_to(应对评测饱和的方法之一)