Type: concept
Confidence: 0.90
Created: 2026-04-16
Updated: 2026-04-18
Tags: 技术AI文档处理OCR

光学字符识别

概述

光学字符识别(OCR,Optical Character Recognition)是将图像中的文字转换为机器可读文本的技术,是扫描件 PDF 解析的核心手段。

关键内容

在 PDF 解析中的角色

OCR 在 MinerU 中不是全程使用,而是按需激活

这个设计的核心思想:对于文字型 PDF,PyMuPDF 的精确坐标远优于 OCR 识别结果,没有必要浪费计算资源。

OCR 三阶段流水线

现代 OCR 系统(如 PaddleOCR)的完整处理流程:

  1. 文字区域检测:使用 DBNet++ 等检测模型,输出文字区域的多边形轮廓(而非简单矩形框,能更精确框定倾斜文字行)
  2. 透视变换矫正:将检测到的多边形文字区域通过透视变换矫正为水平矩形图像
  3. 文字识别:使用 SVTR 等识别模型,基于 Vision Transformer 架构,通过 CTC解码 输出文字字符串

PaddleOCR 的中文优势

PaddleOCR 的中文识别能力是 MinerU 相比同类工具(MarkerNougat)的核心差异化优势:

工具 中文支持
MinerUPaddleOCR ✅ 极佳
Marker ⚠️
Nougat

中文 OCR 的特殊挑战

OCR 结果质量过滤

OCR 原始输出需要多层过滤: - 置信度过滤:默认阈值 0.5 - 乱码检测:特殊字符比例 > 0.3 视为乱码 - 空白行和极短文本过滤:长度 < 2 或仅有标点的行过滤掉

来源

相关