闭环学习系统
概述
AI Agent 在执行任务后自动学习、改进并沉淀经验的机制,使 Agent 越用越聪明,而非每次从同一基线出发。
关键内容
- 核心差异:传统 Agent 每次任务后状态清零,闭环学习系统使 Agent 执行→学习→改进→下次执行更好,形成持续循环
- 五大协同机制:记忆管理(定期 nudge 持久化重要知识)、自主技能创建(成功工作流变 SKILL.md)、技能自我改进(使用中发现不足自动更新)、FTS5 跨会话召回(SQLite 全文检索 + LLM 摘要搜索历史)、Honcho 用户建模(辩证推理构建动态用户画像)
- 架构哲学:这不是实现细节,而是架构哲学层面的分叉点——未来最有价值的 AI Agent 是积累了最多经验、能够持续自我改进的那个
- 实现方式:通过 SQLite + FTS5 实现跨会话持久化记忆,成功经验自动转化为可复用技能,技能在使用中持续自我优化
- 价值体现:重复性工程任务加速(第 1 次 30 分钟→自动创建 Skill→第 2 次 5 分钟→Skill 自我优化→第 N 次更快更准)
- 完整学习飞轮:会话 1 执行任务学习环境和用户偏好(MEMORY.md + USER.md 更新,Honcho 收集初始数据)→ 会话 5 发现重复模式创建第一个技能(SKILL.md 创建,Level 0 目录可见)→ 会话 10 技能被复用发现改进点(SKILL.md 更新 version bump,用户纠正更新 USER.md,Honcho 模型更精准)→ 会话 50 已有 15+ 技能深度了解用户(同类型任务速度提升 3-5x,响应风格完全契合用户偏好,FTS5 找到相关历史避免重复踩坑)→ 持续运行成为专属 AI
- 复利增长效应:技能质量提升加速新技能创建,记忆积累提高技能触发准确率,用户模型精准化减少无效交互——不是线性增长而是复利增长
- Memory Nudge 驱动:Agent 在自然暂停点自我反思(学到环境新事实→MEMORY.md,用户新偏好→USER.md+Honcho,可复用工作流→SKILL.md,技能问题→更新 SKILL.md,错误认知纠正→删除/替换旧记忆)
- 技能创建权重体系:任务步骤数≥4(高)、有明确验证步骤(高)、有易出错关键步骤(高)、用户显式要求(确定触发)、同类型任务历史≥2 次(高)、涉及特定工具非显而易见用法(中)、通用模式非本次特有(高)、高度特定本次情况(降低权重)
- 安全性边界:自我改进带来新安全考虑——记忆安全扫描(凭证拦截、指令注入防护)、命令执行授权(危险模式需用户批准)、容器隔离(Docker/Singularity 命名空间隔离)、凭证过滤(工具结果返回 LLM 前过滤)
来源
- NousResearch/hermes-agent — 2026 年 4 月版本
- NousResearch/hermes-agent — 2026 年 4 月版本,Hermes Agent 深度解析第四篇:Skills 系统
- 06_hermes_learning_loop.md — Hermes Agent 深度解析第六篇:闭环学习引擎,完整学习飞轮、Memory Nudge、技能创建权重、安全边界
相关
- Hermes Agent — implements
- Honcho — uses
- 跨会话记忆 — extends
- 开放技能标准 — extends
- 自我进化代理 — part_of
- 程序性记忆 — extends
- SKILL.md 格式规范 — part_of
- 技能自我改进 — extends
- SOUL.md 人格系统 — part_of
- 辩证推理 — uses
- Memory Nudge — part_of
- 轨迹压缩 — extends
- Batch Runner — extends