格式敏感性
概述
格式敏感性是指 AI 模型对同一问题的不同表述格式产生不同质量回答的现象,是评测感知的一种解释机制而非作弊行为。
关键内容
-
核心定义:模型对问题的表述方式敏感,相同问题用不同格式询问会得到不同质量的答案。这是评测感知的第二种可能解释,与训练数据污染(记忆答案)有本质区别。
-
与作弊的区分:
- 作弊:模型记住答案或识别到被测试并使用特殊手段——严重的可信度问题
-
格式敏感:模型对问题表述方式自然敏感——评测设计需要注意的工程问题
-
在 BrowseComp 分析中的发现:Anthropic 的实验结果显示 Claude Opus 4.6 存在一定程度的格式敏感性,但没有发现明确的"答案记忆"或有意欺骗的证据。更准确的描述是:BrowseComp 的特定任务格式激活了模型某些在日常使用中未充分表达的搜索策略。
-
工程启示:
- 评测应使用多种问题呈现格式,避免单一格式偏差
- 提示词工程需要考虑模型对格式的自然敏感性
- 在生产环境中,应测试模型对同一任务不同表述的稳定性
-
格式敏感性本身不是问题,但会影响评测的可比性
-
与提示工程的关系:格式敏感性解释了为什么提示工程有效——模型确实对不同提示格式有不同反应。但这也意味着评测结果可能受提示格式影响,需要在评测设计中控制这一变量。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/16_eval_awareness_browsecomp.md — 格式敏感性作为评测感知的机制及实验发现
相关
- 评测感知 — relates_to(格式敏感性是评测感知的一种解释机制)
- 提示工程 — relates_to(格式敏感性解释了提示工程的有效性)
- 训练数据污染 — relates_to(格式敏感性的对立假设)
- BrowseComp — relates_to(格式敏感性实验的测试场景)