pdfminer
概述
pdfminer 是 Python 的 PDF 文本提取库,可从 PDF 中提取文本内容,但对多栏布局的处理能力有限,提取结果常为乱序字符流。
关键内容
功能与局限
- 功能:从文字型 PDF 中提取文本内容
- 局限:
- 多栏布局、脚注、侧边栏全部混在一起,无法保持阅读顺序
- 无法处理扫描件(无文字层 PDF)
- 公式以图像形式存储时无法提取
- 表格结构难以还原
与 MinerU 的对比
MinerU 通过七层流水线(布局检测 + 阅读顺序重建 + 内容专项识别)解决了 pdfminer 无法处理的核心问题:乱序字符流、扫描件、公式表格还原。
来源
- raw/assets/MinerU/minerU_01_architecture.md — MinerU 深度解析系列 · 第一篇