Type: concept
Confidence: 0.90
Created: 2026-04-15
Updated: 2026-04-15
Tags: 技术AI研究AI工程

注意力预算

概述

注意力预算(Attention Budget)是对 Transformer 模型处理上下文时有限注意力资源的比喻性描述:每个新 token 的加入都从这一"预算"中消耗一份,导致模型对任意 token 的关注深度随上下文增长而下降。这一概念类比人类工作记忆的有限容量。

关键内容

架构根因:n² 注意力计算

Transformer 架构的自注意力机制要求每个 token 对上下文中所有其他 token 执行注意力计算,产生 n² 对位关系(n 为 token 数)。

n=1000  →  1,000,000 对位关系
n=10000 →  100,000,000 对位关系
n=100k  →  10^10 对位关系(理论极值)

计算量虽可通过 Flash Attention 等技术优化,但模型理解这些关系的能力随 n 增大而被稀释——每一对关系分配到的"有效参数容量"减少。

与人类工作记忆的类比

人类的工作记忆容量有限(Miller's Law:约 7±2 个独立 chunk),超出容量时信息处理质量下降。LLM 的注意力预算扮演相同角色:

人类 LLM
有限资源 工作记忆 chunk 数 注意力机制</td> </tr> <tr> <td>退化现象</td> <td>认知过载、遗忘</td> <td>[[上下文腐烂、长距推理弱化
优化策略 外部笔记、分阶段处理 结构化笔记法上下文压缩

工程含义

注意力预算有限直接推出上下文工程的核心指导原则:

找到最小化的高信噪比 token 集合,最大化目标行为的概率。

具体工程手段: - 系统提示精简:找到"合适高度"(right altitude)——不过于细碎、不过于抽象 - 工具集精简:最小可行工具集,避免决策点模糊 - 即时上下文检索:用轻量标识符替代全量数据,按需加载 - 压缩(Compaction:对话历史定期压缩,清除冗余工具输出 - 结构化笔记法:关键信息外置到持久记忆,按需调入

系统提示的"合适高度"(Right Altitude)

Anthropic 工程实践中,系统提示存在两个常见失败极端:

失败模式 问题
过于细碎(硬编码 if-else) 脆弱、维护成本高、浪费上下文
过于抽象(高层泛泛指引) 缺乏具体信号,假设共享上下文

最优"合适高度":具体到能有效引导行为,灵活到给模型足够的启发式空间。最小化但不一定简短——前提是给出充分行为约束所必要的信息。

来源

相关