Type: entity
Confidence: 0.80
Created: 2026-04-18
Updated: 2026-04-18
Tags: AIOCR工具深度学习百度文档处理

PP-OCRv4

概述

PP-OCRv4 是 PaddleOCR 的第四代 OCR 系统,包含文字检测、方向分类、文字识别三个子模块,是 MinerU 默认使用的 OCR 模型系列。

关键内容

系统组件

PP-OCRv4 系统组件:
├── 文字检测(Detection):DBNet++ 变体
│   输入:图像
│   输出:文字区域的多边形轮廓
│
├── 文字方向分类(Direction Classification):
│   输入:检测到的文字图像块
│   输出:0° / 90° / 180° / 270°
│
└── 文字识别(Recognition):SVTR(Scene Text Recognizer)
    输入:矫正后的文字行图像
    输出:文字字符串 + 置信度

三个子模块

  1. 文字检测(DBNet++:基于可微分二值化的检测模型,输出文字区域的多边形轮廓
  2. 文字方向分类:判断文字图像块的方向(0°/90°/180°/270°),用于处理竖排、倒排等场景
  3. 文字识别(SVTR:基于 Vision Transformer 的识别模型,通过 CTC解码 输出文字

在 MinerU 中的应用

MinerU 主要使用 PP-OCRv4 系列作为默认 OCR 引擎,原因包括: - 中文识别极强:专门针对中文优化,字符集包含 6763 个常用汉字(GB2312 标准) - 速度快:轻量级模型,区域裁剪 OCR 仅需 0.1~0.5 秒 - 检测+识别一体:完整的 OCR 流水线 - 版式理解:PP-Structure 支持文档结构分析 - 工业验证:阿里、京东等大厂使用

中文优化

来源

相关