Type: concept
Confidence: 0.80
Created: 2026-04-25
Updated: 2026-04-25
Tags: securityanti-distillationai-protectionAI工程

反蒸馏系统

概述

反蒸馏系统是 Claude Code 中用于防止竞争对手通过 API 流量录制来训练竞品模型的安全机制。

关键内容

  1. 蒸馏攻击定义
  2. 通过记录强大模型(Teacher)的输入输出,训练出成本更低的模型(Student)来模仿 Teacher 的行为
  3. 竞争对手可能系统性地记录 Claude Code 的 API 请求和响应,训练功能类似的模型而无需支付 API 费用

  4. 假工具注入机制

  5. 当启用 ANTI_DISTILLATION_CC 标志时,服务器端会向系统提示词中注入虚假的工具定义
  6. 这些虚假工具对真实 Claude Code 无影响,但会污染训练数据
  7. 训练出的模型会"学到"根本不存在的工具,产生奇怪的行为

  8. 服务端响应摘要

  9. 仅对 Anthropic 内部用户启用
  10. 服务器缓冲 AI 的响应,生成摘要并附上加密签名返回
  11. 外部记录者只能看到摘要,看不到完整的推理链

  12. 实际效果

  13. 真实目的不是技术上完全阻止蒸馏,而是增加攻击成本、污染非授权训练数据质量、作为法律证据

来源

相关