上下文工程
概述
上下文工程是在 LLM 推理过程中,从不断演化的可用信息宇宙中策展最优上下文 token 集合的艺术与科学——本质上是动态的、多轮的信息策展问题,正在替代提示工程成为 AI Agent 的核心挑战。
关键内容
-
从提示工程到上下文工程的范式跃迁:提示工程关注"如何编写和组织 LLM 指令"——是一次性、静态的文本设计问题;上下文工程关注"何时加入什么信息"——是动态的、多轮的信息策展问题。单次 LLM 调用([System Prompt + User Query] → Response)演化为多轮 Agent 循环([System Prompt + Tools + Memory + Message History + Tool Results] × N turns → Behavior),每一轮都生成新数据,无限堆积最终导致上下文质量下降。
-
上下文有限性的深层原因:即使上下文窗口不断扩大,上下文工程的重要性也不会消失。三大根因:①注意力稀释——Transformer 中 n 个 token 产生 n² 对注意力关系,超过一定规模后关系质量下降;②训练分布偏移——训练数据中较短序列比较长序列更常见,模型对长序列依赖的特化参数相对较少;③位置编码插值——长上下文通常需要 RoPE 外推等位置编码插值,引入位置理解退化。更大的窗口只是推迟问题,而非消除它。
-
注意力预算的经济学:LLM 的"注意力"是有限的认知资源,每个新 token 消耗一定预算,边际回报递减。最优策略是找到最小高信噪比 token 集合,使期望输出质量最大化。这是所有具体技术的统一基础。
-
系统提示设计——"适当高度(Right Altitude)"原则:介于两种极端之间的黄金区间。极端一(过低):硬编码复杂逻辑,脆弱难维护;极端二(过高):过度抽象,缺乏具体信号。最优区间是提供足够具体的行为启发,同时允许灵活处理未预见情形。建议使用 XML 标签或 Markdown 标题划分不同部分(
<background_information>、<instructions>、工具指南、输出格式),目标是充分说明预期行为所需的最少信息量。 -
工具设计原则:工具是 Agent 与信息/动作空间的契约,需满足 Token 高效(返回精炼信息)、行为高效(鼓励高效行为模式)、功能清晰(明确单一用途)、最小化工具集。常见失败模式是工具集过于臃肿、功能重叠,导致 Agent 在工具选择上浪费推理资源。
-
少样本示例策略:精心选择多样化、有代表性的典范示例,而非穷举所有边缘情况。危险做法是将大量边缘情况堆砌到 prompt 中——示例是"图片"不是规则集,过多边缘示例会淹没核心模式。
-
即时检索(JIT)vs 传统 RAG:传统 RAG 在查询时间前批量检索并注入上下文;JIT 检索在推理过程中由 Agent 主动用工具按需加载。JIT 核心优势:按需加载避免预置无用信息、动态适应任务进展、渐进式发现类似人类研究过程。Claude Code 是典型案例:CLAUDE.md 直接注入高价值预置信息,glob/grep 等工具允许按需检索,绕过静态索引过期问题。
-
长时任务三大技术:①上下文压缩——当上下文接近窗口限制时,将对话历史总结为摘要替换原始内容,Claude Code 方案是保留最近 5 个访问文件、架构决策、未解决 Bug,丢弃冗余工具输出;②结构化笔记法——Agent 定期将重要信息写入持久化存储(如 NOTES.md),在需要时重新加载,Claude 玩宝可梦时自发建立结构化记忆展示了跨会话长时任务能力;③子 Agent 模式(Sub-Agent Pattern)——将长时任务分解,专业子 Agent 在各自干净上下文窗口中处理聚焦任务,返回精炼摘要(通常 1000-2000 token)给协调者。
-
与人类认知的对应关系:工作记忆 ↔ 上下文窗口;外部组织系统(笔记、文件夹)↔ 持久化存储;注意力集中 ↔ 注意力权重集中;认知负荷限制 ↔ 上下文腐烂现象。这种类比提示了解决方案的设计方向——人类如何扩展认知能力,Agent 就可以如何设计。
-
未来趋势:随着模型能力提升,Agentic 设计会趋向于让智能模型更智能地行动,人类策展的需求会逐渐减少。短期内上下文工程是核心竞争力,长期内模型可能自主掌握上下文管理策略,工程师角色将从"上下文策展者"转向"上下文质量保障者"。
来源
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/00_INDEX.md — 上下文工程与知识管理章节
- raw/articles/ai-engineering/anthropic-engineering/claude-engineering/04_context_engineering.md — Anthropic Applied AI 团队原文分析(Prithvi Rajasekaran, Ethan Dixon, Carly Ryan, Jeremy Hadfield 等,2025 年 9 月 29 日)
相关
- Anthropic — part_of
- RAG 系统 — extends
- Agent 架构与设计原则 — extends
- 上下文腐烂 — relates_to(上下文工程存在的核心动机)
- 即时上下文检索 — extends(动态检索策略)
- 上下文压缩 — extends(长时任务技术之一)
- 结构化笔记法 — extends(长时任务技术之一)
- 子 Agent 模式(Sub-Agent Pattern) — extends(长时任务技术之一)
- Claude Code — relates_to(JIT 检索典型案例)
- Token 资源管理 — relates_to(注意力预算框架)