Type: concept
Confidence: 0.90
Created: 2026-04-15
Updated: 2026-04-15
Tags: 技术方法论AIAI工程

分层记忆架构

概述

分层记忆架构(Hierarchical Memory Architecture)是 Context-Engineering 的核心实现模式。将 LLM 上下文从单一聊天历史升级为五个功能分层(L0–L4),每层承担不同的记忆职责和时效性,从而将"把整段历史一路往前拖"替换为"结构化状态检索与压缩"。灵感来源于 MemGPT 和 LongMem 将有限上下文与外部慢存储协同工作的思路。

关键内容

五层架构

名称 内容 特性
L0 Cached Prefix 系统指令、output schema、few-shot、工具契约 固定不变,天然适合KV 缓存命中率</td> </tr> <tr> <td><strong>L1</strong></td> <td>[[工作记忆</td> <td>Working Memory 当前任务目标、约束、实体、术语表、未解决问题、当前计划
L2 情节记忆</td> <td>Episodic Memory 按阶段压缩的"回合摘要":决策、证据、结论、pending items
L3 语义记忆</td> <td>Semantic Memory 近似最近邻检索</td> </tr> <tr> <td><strong>L4</strong></td> <td>Raw Archive</td> <td>原始会话、原始文档、原始工具输出</td> <td>只做审计和回源,不进 prompt</td> </tr> </tbody> </table> <h3 id="_5">各层分工原则</h3> <ul> <li><strong>L0</strong>:稳定 + 高复用 → 最适合被 [[Prompt缓存 命中
  • L1:当前轮最关键信息 → token 成本最高,严格筛选
  • L2:过去的结构化 checkpoint → 压缩后仍可计算
  • L3:按需检索 → hybrid retrieve(dense + BM25 + graph)
  • L4:保留 source anchor,不直接注入 prompt
  • Memory Object 结构

    上下文管理的单元是 memory object,而非 message:

    {
      "id": "mem_xxx",
      "type": "fact | decision | preference | plan | episode",
      "text": "用户更关心 latency 而不是 peak accuracy",
      "source": "chat:turn_18",
      "freshness": "2026-04-14",
      "salience": 0.82,
      "reuse_count": 6,
      "confidence": 0.91,
      "anchors": ["turn18", "doc:spec#p4"]
    }
    

    关键设计:"说过一次的话"不应和"已确认的约束"拥有相同地位

    层间晋升规则

    • L4 → L3:多次检索命中的片段 → 晋升为语义记忆条目
    • L2 → L1:当前轮用到的 episode checkpoint → 临时注入工作记忆
    • L1 → L2:任务阶段切换时 → 压缩为 episode 条目
    • 压缩产出物:durable facts / decisions / open loops / source anchors

    压缩触发条件

    • 任务阶段切换
    • 做出关键决策
    • 工具返回超长结果
    • Token 预算逼近阈值

    ⚠️ 禁止压缩:数字/合同/代码逻辑(失真风险)、事实与推断混写(审计风险)。

    与 MemGPT 对比

    MemGPT (2023) 将 LLM 上下文类比为操作系统的主存,外部存储类比为磁盘。本架构在此基础上增加了: - 明确的五层语义定义 - memory object 结构化模型 - 与 Prompt 缓存的协同(L0 exact-prefix match) - 与混合检索的协同(L3 hybrid retrieve)

    来源

    相关