注意力预算
概述
注意力预算(Attention Budget)是对 Transformer 模型处理上下文时有限注意力资源的比喻性描述:每个新 token 的加入都从这一"预算"中消耗一份,导致模型对任意 token 的关注深度随上下文增长而下降。这一概念类比人类工作记忆的有限容量。
关键内容
架构根因:n² 注意力计算
Transformer 架构的自注意力机制要求每个 token 对上下文中所有其他 token 执行注意力计算,产生 n² 对位关系(n 为 token 数)。
n=1000 → 1,000,000 对位关系
n=10000 → 100,000,000 对位关系
n=100k → 10^10 对位关系(理论极值)
计算量虽可通过 Flash Attention 等技术优化,但模型理解这些关系的能力随 n 增大而被稀释——每一对关系分配到的"有效参数容量"减少。
与人类工作记忆的类比
人类的工作记忆容量有限(Miller's Law:约 7±2 个独立 chunk),超出容量时信息处理质量下降。LLM 的注意力预算扮演相同角色:
| 人类 | LLM | |
|---|---|---|
| 有限资源 | 工作记忆 chunk 数 | 注意力机制</td> </tr> <tr> <td>退化现象</td> <td>认知过载、遗忘</td> <td>[[上下文腐烂、长距推理弱化 |
| 优化策略 | 外部笔记、分阶段处理 | 结构化笔记法、上下文压缩 |
工程含义
找到最小化的高信噪比 token 集合,最大化目标行为的概率。
具体工程手段: - 系统提示精简:找到"合适高度"(right altitude)——不过于细碎、不过于抽象 - 工具集精简:最小可行工具集,避免决策点模糊 - 即时上下文检索:用轻量标识符替代全量数据,按需加载 - 压缩(Compaction):对话历史定期压缩,清除冗余工具输出 - 结构化笔记法:关键信息外置到持久记忆,按需调入
系统提示的"合适高度"(Right Altitude)
Anthropic 工程实践中,系统提示存在两个常见失败极端:
| 失败模式 | 问题 |
|---|---|
| 过于细碎(硬编码 if-else) | 脆弱、维护成本高、浪费上下文 |
| 过于抽象(高层泛泛指引) | 缺乏具体信号,假设共享上下文 |
最优"合适高度":具体到能有效引导行为,灵活到给模型足够的启发式空间。最小化但不一定简短——前提是给出充分行为约束所必要的信息。
来源
- raw/articles/ai-engineering/anthropic-engineering/Effective context engineering for AI agents.md
相关
- 上下文腐烂 — related_to(注意力预算有限导致上下文腐烂现象)
- Context-Engineering — part_of(注意力预算是上下文工程的核心约束)
- 渐进式披露-Progressive-Disclosure — related_to(渐进式披露是保护注意力预算的策略)
- 即时上下文检索 — related_to(按需加载是节约注意力预算的主要手段)
- Self-Attention机制 — relates_to(注意力预算的根因在于自注意力的 n² 计算结构)
- Transformer架构 — relates_to(Transformer 的架构设计决定了注意力预算的存在)