PP-OCRv4
概述
PP-OCRv4 是 PaddleOCR 的第四代 OCR 系统,包含文字检测、方向分类、文字识别三个子模块,是 MinerU 默认使用的 OCR 模型系列。
关键内容
系统组件
PP-OCRv4 系统组件:
├── 文字检测(Detection):DBNet++ 变体
│ 输入:图像
│ 输出:文字区域的多边形轮廓
│
├── 文字方向分类(Direction Classification):
│ 输入:检测到的文字图像块
│ 输出:0° / 90° / 180° / 270°
│
└── 文字识别(Recognition):SVTR(Scene Text Recognizer)
输入:矫正后的文字行图像
输出:文字字符串 + 置信度
三个子模块
- 文字检测(DBNet++):基于可微分二值化的检测模型,输出文字区域的多边形轮廓
- 文字方向分类:判断文字图像块的方向(0°/90°/180°/270°),用于处理竖排、倒排等场景
- 文字识别(SVTR):基于 Vision Transformer 的识别模型,通过 CTC解码 输出文字
在 MinerU 中的应用
MinerU 主要使用 PP-OCRv4 系列作为默认 OCR 引擎,原因包括: - 中文识别极强:专门针对中文优化,字符集包含 6763 个常用汉字(GB2312 标准) - 速度快:轻量级模型,区域裁剪 OCR 仅需 0.1~0.5 秒 - 检测+识别一体:完整的 OCR 流水线 - 版式理解:PP-Structure 支持文档结构分析 - 工业验证:阿里、京东等大厂使用
中文优化
- 字符集:6763 个常用汉字,覆盖 99% 以上常用中文场景
- 形近字处理:训练集中加入形近字混淆样本(己/已/巳,戊/戌/戍)
- 中英混排:统一字符集,同时包含中文和英文字符
- 垂直排版:方向分类器支持竖排文字识别
来源
- raw/assets/MinerU/minerU_04_ocr.md — MinerU 深度解析系列 · 第四篇:OCR 引擎