瑞士奶酪模型
概述
瑞士奶酪模型是安全工程中的多层防御理念,比喻每层质量保障方法都有漏洞,但多层叠加能拦截大多数问题,用于理解 Agent 性能的综合体系。
关键内容
- 核心理念:
- 每层质量保障方法都有漏洞(像瑞士奶酪的孔洞)
- 多层叠加能拦截大多数问题(孔洞不会完全对齐)
-
eval 只是理解 Agent 性能的工具之一,不是唯一手段
-
六层质量保障体系:
- 自动化 eval:可重复、快速、无用户影响;需要前期投资,可能与真实使用不符;最佳时机:部署前、每次提交
- 生产监控:真实用户行为,发现意外问题;被动,问题先触达用户;最佳时机:部署后持续运行
- A/B 测试:测量真实用户结果;慢(需要几天到几周),需要流量;最佳时机:显著功能变更
- 用户反馈:发现意外问题,真实示例;稀疏、自选偏差,倾向严重问题;最佳时机:持续分类
- 手动 Transcript 审查:发现细微质量问题;不可扩展,时间密集;最佳时机:每周抽样
-
系统性人工评测:黄金标准,处理主观任务;昂贵、周期长;最佳时机:校准 LLM 评分器时
-
工程启示:
- 不要依赖单一评测方法
- 每层方法有其最佳使用时机
- 综合使用才能建立完整的质量保障体系
- 类似安全工程中的纵深防御(Defense in Depth)策略
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/12_demystifying_evals.md — Eval 与其他方法的综合体系章节
相关
- 评测驱动开发 — part_of(瑞士奶酪模型是评测驱动开发的宏观框架)
- Agent 评测体系 — relates_to(评测体系是瑞士奶酪模型中的一层)
- LLM-as-Judge — relates_to(LLM 评分器需要人工评测作为校准层)