反蒸馏系统
概述
反蒸馏系统是 Claude Code 中用于防止竞争对手通过 API 流量录制来训练竞品模型的安全机制。
关键内容
- 蒸馏攻击定义:
- 通过记录强大模型(Teacher)的输入输出,训练出成本更低的模型(Student)来模仿 Teacher 的行为
-
竞争对手可能系统性地记录 Claude Code 的 API 请求和响应,训练功能类似的模型而无需支付 API 费用
-
假工具注入机制:
- 当启用
ANTI_DISTILLATION_CC标志时,服务器端会向系统提示词中注入虚假的工具定义 - 这些虚假工具对真实 Claude Code 无影响,但会污染训练数据
-
训练出的模型会"学到"根本不存在的工具,产生奇怪的行为
-
服务端响应摘要:
- 仅对 Anthropic 内部用户启用
- 服务器缓冲 AI 的响应,生成摘要并附上加密签名返回
-
外部记录者只能看到摘要,看不到完整的推理链
-
实际效果:
- 真实目的不是技术上完全阻止蒸馏,而是增加攻击成本、污染非授权训练数据质量、作为法律证据
来源
- 06_security_antidistillation.md — 反蒸馏系统详细分析
相关
- Claude Code — implements
- Client Proof — relates_to