三线表
概述
三线表是学术论文中最常见的表格格式,仅有顶线、表头分隔线、底线三条横线,无竖线。列边界不靠线条而靠"列内文字的水平对齐"来推断,对表格识别算法是极大挑战。
关键内容
结构特征
三线表仅有三条线:
指标 方法A 方法B 方法C
────────────────────────────
准确率 90.1 88.3 92.5
召回率 87.6 91.2 89.0
F1 88.8 89.7 90.7
- 顶线:表格顶部边界
- 表头分隔线:区分表头与数据行
- 底线:表格底部边界
- 无竖线:列边界完全不可见
识别挑战
- 无垂直参考线:列边界无法直接检测,需靠文字水平对齐推断
- 列宽不均:各列宽度可能差异很大
- 表头识别:第一行通常是粗体,是确定列数的关键线索
- 对齐方式多样:左对齐、右对齐、居中对齐混合出现
MinerU 处理策略
MinerU 通过以下方式处理三线表:
- 文档布局检测(DocLayout-YOLO)识别出
table框区域 - TableMaster 通过学习到的特征理解"列对齐",即使无竖线也能识别列边界
- 表头行特征:第一行通常为粗体,用来确定列数和表格结构
- 文字型 PDF:PyMuPDF 提取的 Span 坐标帮助验证列对齐
在学术出版中的地位
三线表在学术论文中极为常见,是科技期刊的标准表格格式。其简洁的设计避免了多余线条对阅读的干扰,但对自动化解析提出了更高的算法要求。
来源
- raw/assets/MinerU/minerU_06_table.md — MinerU 深度解析系列 · 第六篇:表格识别系统
相关
- 表格识别 — 所属技术领域
- TableMaster — 处理三线表的核心模型
- MinerU — 支持三线表识别的文档解析工具
- 文档布局检测 — 前置检测环节