挖掘管道
概述
MemPalace 系统中将源代码、文档、对话记录等原始数据自动分析并导入记忆宫殿的数据处理管道。包含三种模式:Projects、Convos、General。核心工作流分两个阶段:Mine(挖掘)和 Search(检索)。
关键内容
- 两种模式:
- Phase 1: Mine(挖掘):文件/对话 → 切块 → 分类 → 存入宫殿
- Phase 2: Search(检索):问题 → 定位 Wing/Room → 语义搜索 → 返回相关 Drawer
- 三种挖掘模式:
- Projects(默认):
mempalace mine ~/projects/myapp— 挖掘代码库、文档、笔记 - Convos:
mempalace mine ~/chats/ --mode convos— 挖掘 AI 对话导出文件 - General:
mempalace mine ~/docs/ --mode convos --extract general— 任意文本,自动分类 - Projects 模式详情:
- 递归遍历目录,跳过
.git、node_modules、__pycache__等目录和二进制文件 - 支持 20 种扩展名:
.py、.js、.ts、.md、.json、.yaml、.html、.css、.sql等 - Room 检测四级级联:路径匹配 → 文件名匹配 → 内容关键词评分 → 兜底 general
- 切块策略:800 字符 + 100 重叠,优先段落边界(
\n\n),其次句子边界(. ? !),最后硬截断 - Convos 模式详情:
- 支持多平台适配器:Claude Code(
.jsonl)、Claude.ai(.json)、ChatGPT(conversations.json)、Slack(频道.json) - 统一格式化为
>标记的用户输入 + AI 回复 - Exchange 切块:以"用户提问 + AI 回答"问答对为单元,确保语义完整性
- Room 检测:5 类关键词评分(technical、architecture、planning、decisions、problems),扫描前 2000 字符
- General 模式详情:
- 用约 100 个正则模式从任意文本中提取 5 类记忆:decisions(20 模式)、preferences(16 模式)、milestones(33 模式)、problems、emotional_context
- 提取结果映射到对应 Hall:decisions → decisions、preferences → preferences、milestones → events、problems → discoveries、emotional_context → facts
- 去重机制:MD5 哈希去重,每次挖掘前从 ChromaDB 加载现有哈希,只存储不重复的块
- 零 LLM 调用:整个挖掘管道没有任何 LLM API 调用,所有决策都是确定性规则运算
- 增量挖掘:支持随时追加挖掘,MD5 去重保证幂等性,可设置 cron job 自动同步
三种模式全流程对比
Projects 模式:
目录树遍历 → 过滤扩展名 → 读取文件
↓
Room 检测(路径→文件名→内容评分→general)
↓
字符切块(800c + 100 overlap,段落优先)
↓
MD5 去重 → ChromaDB 写入
Convos 模式:
多平台导出 → 统一格式(> 标记)
↓
Room 检测(5 类关键词评分,扫前 2000 字符)
↓
Exchange 切块(问答对为单元)/ 段落兜底
↓
MD5 去重 → ChromaDB 写入
General 模式(在 Convos 基础上):
正则提取(5 类记忆类型,合计 ~100 个模式)
↓
按类型映射到对应 Hall
↓
MD5 去重 → ChromaDB 写入
来源
- raw/articles/ai-tools/mempalace/mempalace_01_overview.md — MemPalace 系列总览篇
- raw/articles/ai-tools/mempalace/mempalace_05_mining_pipelines.md — MemPalace 深度解析第五篇:三种挖掘管道