文档结构化提取
概述
文档结构化提取是将非结构化的文档(如 PDF)转换为带有语义标签的结构化数据(如 Markdown、JSON)的过程,是 RAG 系统和知识库构建的前置环节。
关键内容
核心挑战
- PDF 是"打印指令集",没有语义结构
- 需要还原标题层级、段落、列表、表格、公式、图注等语义元素
- 需要保持正确的阅读顺序
- 需要处理多栏、脚注、侧边栏等复杂排版
输出格式
- Markdown:人类可读,保留标题、列表、表格、公式(LaTeX)等结构
- JSON(带 bbox 坐标):机器可读,每个内容块附带原始坐标信息
- 多模态格式:结合文本和图像资源
在 AI 应用中的重要性
RAG 系统、知识库构建、文档问答,全都依赖精准的文档结构化提取。提取质量直接决定下游应用的上限。
MinerU 的解决方案
通过七层流水线实现:PDF 类型判断 → 底层解析 → 布局检测 → 内容专项识别 → 内容块分类 → 阅读顺序重建 → Markdown/JSON 生成。
来源
- raw/assets/MinerU/minerU_01_architecture.md — MinerU 深度解析系列 · 第一篇