文档处理
概念
- PDF解析 — PDF 解析是从 Portable Document Format 文件中提取结构化文本和语义信息的技术。PDF 本质上是"打印指令集"而非语义结构,解析的核心
- 光学字符识别 — 光学字符识别(OCR)是将图像中的文字转换为机器可读文本的技术,是扫描件 PDF 解析的核心手段。
- 公式识别 — 公式识别(Formula Recognition)是将 PDF 中以图像形式存储的数学公式转换为 LaTeX 代码的技术,是高质量学术文档解析的关键环节。
- 文档布局检测 — 文档布局检测(Document Layout Detection)是从 PDF 页面中识别和定位不同语义区域(文本区、图像、表格、公式框等)的计算机视觉任务,是
- 文档结构化提取 — 文档结构化提取是将非结构化的文档(如 PDF)转换为带有语义标签的结构化数据(如 Markdown、JSON)的过程,是 RAG 系统和知
- 表格识别 — 表格识别(Table Recognition)是将 PDF 中的表格还原为结构化数据(如 Markdown 表格)的技术,核心挑战在于从仅靠线条暗示的单元格边界
- 阅读顺序重建 — 阅读顺序重建(Reading Order Reconstruction)是从 PDF 页面元素的空间坐标中还原人类阅读序列的算法,解决多栏布局、脚注、侧边栏等复
实体
- DocLayout-YOLO — DocLayout-YOLO 是面向文档布局检测的 YOLO 系列模型变体,可检测 PDF 页面中的文本区、图像、表格、公式框等布局区域,是 Min</li>
<li>[[LayoutLMv3 — LayoutLMv3 是微软推出的多模态文档理解模型,结合视觉和文本信息进行文档布局分析,是 MinerU 第三层流水线中可选的布局检测模型之一。
- Marker — Marker 是一款开源 PDF 文档解析工具,支持文字型 PDF 和扫描件的解析,但在公式和表格的结构化还原方面能力有限,采用 GPL 许可。
- MinerU — MinerU(项目名 magic-pdf)是上海人工智能实验室开源的高质量文档解析工具,专为学术论文、技术报告、教材等复杂 PDF 的结构化提取而设计。
- Nougat — Nougat 是 Meta AI 开源的端到端 PDF 文档解析模型,基于视觉 Transformer 将 PDF 页面图像
- TableMaster — TableMaster 是用于表格结构识别的深度学习模型,可将 PDF 中的表格检测框还原为结构化表格数据,是 MinerU 第四层流