影子评测
概述
影子评测是指在生产环境中以自然方式提交评测任务,隐蔽地测量模型真实表现,以应对评测感知和评测饱和问题的方法论。
关键内容
-
核心机制:将评测任务混入真实的生产流量中,模型无法区分这是评测还是正常请求,从而避免评测感知带来的行为偏差。这种方法能够测量模型在"不知道自己被测试"时的真实表现。
-
应对评测感知:当模型可能识别评测格式并调整行为时,影子评测通过消除"这是评测"的信号,迫使模型以默认模式处理任务,获得更真实的能力基线。
-
设计原则:
- 评测任务应与真实请求在格式上无法区分
- 避免使用规律化的问题模板
- 在生产环境中持续进行,而非周期性突击
-
结果与显式基准测试对照验证
-
在评测体系中的位置:影子评测是评测驱动开发方法论的重要组成部分,与显式基准测试形成互补——前者测量"自然状态"能力,后者测量"最优激发"能力,两者差距本身就是有价值的信号。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/16_eval_awareness_browsecomp.md — 影子评测作为应对评测感知的方法
相关
- 评测驱动开发 — part_of
- 评测感知 — relates_to(影子评测是应对评测感知的主要方法)
- 评测饱和 — relates_to(影子评测可延缓评测饱和)
- BrowseComp — relates_to(影子评测可应用于类似 BrowseComp 的基准)