三道防线模式
将 LLM 的不确定性转化为系统确定性的分层防御架构。核心矛盾:LLM 输出是随机的,但系统执行必须是可控的。
关键内容
- 第一道防线:意图过滤(ExecPolicy)
- 命令在执行前先过策略规则集
- 三态决策:
allow(放行)/prompt(暂停等待审批)/forbidden(拒绝并返回替代方案) -
本质:在"意图层"拦截危险操作
-
第二道防线:人机协同(Approval Gate)
- 不确定的命令暂停,等人类批准
approval_policy精细控制暂停粒度-
本质:在"决策层"引入人类判断
-
第三道防线:执行隔离(Codex沙箱系统)
- 即使策略放行了,OS 内核也限制文件系统和网络边界
- macOS Seatbelt / Linux Landlock+seccomp
- 本质:在"执行层"用内核强制兜底
设计原则
- 纵深防御(Defense in Depth):三层独立,任何单层失效不影响整体安全
- 策略与执行分离:策略层定义"意图",沙箱层定义"边界",即使策略有漏洞,沙箱兜底
- 内核级强制:最后一道防线在 OS 内核层,LLM 无法绕过
来源
- raw/articles/ai-tools/codex/01_codex_architecture_overview.md — 第五节"不确定性 → 确定性的系统设计"
相关
- Codex CLI — 实现三道防线模式的编码 Agent
- ExecPolicy — 第一道防线的具体实现
- Codex沙箱系统 — 第三道防线的具体实现
- Policy-First 设计 — 三道防线的上层设计哲学