分层记忆架构
概述
分层记忆架构(Hierarchical Memory Architecture)是 Context-Engineering 的核心实现模式。将 LLM 上下文从单一聊天历史升级为五个功能分层(L0–L4),每层承担不同的记忆职责和时效性,从而将"把整段历史一路往前拖"替换为"结构化状态检索与压缩"。灵感来源于 MemGPT 和 LongMem 将有限上下文与外部慢存储协同工作的思路。
关键内容
五层架构
| 层 | 名称 | 内容 | 特性 | |
|---|---|---|---|---|
| L0 | Cached Prefix | 系统指令、output schema、few-shot、工具契约 | 固定不变,天然适合KV 缓存命中率</td> </tr> <tr> <td><strong>L1</strong></td> <td>[[工作记忆</td> <td>Working Memory | 当前任务目标、约束、实体、术语表、未解决问题、当前计划 |
| L2 | 情节记忆</td> <td>Episodic Memory | 按阶段压缩的"回合摘要":决策、证据、结论、pending items | ||
| L3 | 语义记忆</td> <td>Semantic Memory | 近似最近邻检索</td>
</tr>
<tr>
<td><strong>L4</strong></td>
<td>Raw Archive</td>
<td>原始会话、原始文档、原始工具输出</td>
<td>只做审计和回源,不进 prompt</td>
</tr>
</tbody>
</table>
<h3 id="_5">各层分工原则</h3>
<ul>
<li><strong>L0</strong>:稳定 + 高复用 → 最适合被 [[Prompt缓存 命中
Memory Object 结构上下文管理的单元是 memory object,而非 message:
关键设计:"说过一次的话"不应和"已确认的约束"拥有相同地位。 层间晋升规则
压缩触发条件
⚠️ 禁止压缩:数字/合同/代码逻辑(失真风险)、事实与推断混写(审计风险)。 与 MemGPT 对比MemGPT (2023) 将 LLM 上下文类比为操作系统的主存,外部存储类比为磁盘。本架构在此基础上增加了: - 明确的五层语义定义 - memory object 结构化模型 - 与 Prompt 缓存的协同(L0 exact-prefix match) - 与混合检索的协同(L3 hybrid retrieve) 来源
相关
|