Type: entity
Confidence: 0.85
Created: 2026-04-16
Updated: 2026-04-18
Tags: 技术AI工具文档处理OCR

PaddleOCR

概述

PaddleOCR 是百度飞桨(PaddlePaddle)开源的 OCR(光学字符识别)工具,以强大的中文识别能力著称,是 MinerU OCRBased 管道的核心文字识别引擎。Apache-2.0 许可。

关键内容

在 MinerU 中的角色

OCR 在 MinerU按需激活,而非全程使用:

这个设计非常精明:对于文字型 PDF,PyMuPDF 的精确坐标远优于 OCR 识别结果,没有必要浪费计算资源。

技术优势对比

维度 PaddleOCR Tesseract EasyOCR TrOCR
中文识别 ✅ 极强,专门优化 ⚠️ 一般 ✅ 较好 ⚠️
速度 ✅ 快(PP-OCR 轻量级) 极慢
检测+识别一体 ⚠️
版式理解 ✅ PP-Structure
开源协议 Apache-2.0 Apache-2.0 Apache-2.0 MIT
工业验证 ✅ 阿里/京东 ⚠️ ⚠️

对于 MinerU 最重要的场景——中文学术论文/教材扫描件,PaddleOCR 有无可比拟的优势。

PP-OCRv4 系统组件

MinerU 主要使用 PaddleOCR 的 PP-OCRv4 系列,包含三个子模块:

  1. 文字检测(Detection)DBNet++ 变体,输入图像,输出文字区域的多边形轮廓
  2. 文字方向分类(Direction Classification):输入检测到的文字图像块,输出 0°/90°/180°/270°
  3. 文字识别(Recognition)SVTRScene Text Recognizer),输入矫正后的文字行图像,输出文字字符串 + 置信度

OCR 流水线

完整的 OCR 处理流程:

  1. 文字区域检测(DBNet++:基于可微分二值化,输出概率图 → 自适应阈值二值化 → 轮廓提取 → 多边形文字框。多边形而非矩形框能更精确地框定倾斜的文字行
  2. 透视变换矫正:将检测到的文字多边形通过透视变换矫正为水平的矩形图像(高度固定 48px)
  3. 文字识别(SVTR:CNN + Transformer 混合特征提取 → 序列特征 → CTC解码 → 文字字符串

中文 OCR 的特殊挑战与解法

MinerU 中的关键优化

来源

相关