提示注入防御
概述
提示注入防御是保护 AI Agent 免受恶意输入操控的安全策略,通过在语义层和系统层建立多重防线,防止 Agent 被外部注入的恶意指令欺骗执行未授权操作。
关键内容
-
攻击场景:Claude Code 读取包含恶意指令的文件时,可能被操控尝试:上传项目文件到外部服务器、修改系统配置、访问其他项目的代码。这类攻击利用 LLM 对输入内容的信任。
- 网络请求 → 被拦截(目标域名不在白名单)
- 系统文件修改 → 被拦截(超出文件系统访问范围)
-
其他项目访问 → 被拦截(文件系统隔离限制)
-
纵深防御中的位置:提示注入防御是纵深防御体系中的重要一环。语义层分类器可识别可疑意图,沙箱层提供硬性系统约束,两者结合确保即使语义层失效,系统层仍能兜底。
-
与传统 Web 安全的类比:类似 Web 安全中的 CSP(Content Security Policy)和沙箱 iframe,不信任输入内容,通过执行环境约束限制恶意代码的影响范围。
来源
- Beyond permission prompts: making Claude Code more secure and autonomous — Anthropic Engineering Blog, 2025 年 10 月 20 日
相关
- Claude Code 沙箱机制 — prevents
- 纵深防御 — part_of
- 提示工程 — compares_to