SVTR
概述
SVTR(Scene Text Recognizer)是 PaddleOCR 的文字识别骨干模型,基于 Vision Transformer 架构,负责将矫正后的文字行图像转换为文字字符串。
关键内容
识别流程
文字行图像(48×W)
→ 特征提取(CNN + Transformer 混合)
→ 序列特征(长度为 W/4)
→ CTC解码(Connectionist Temporal Classification)
→ 文字字符串
输入:矫正后的文字行图像(高度固定为 48px,宽度按比例缩放) 输出:文字字符串 + 置信度
CTC 解码的妙处
CTC解码 允许模型输出比输入序列更短的字符序列,天然处理了字符宽度不一、字符间隔不均匀等问题,不需要字符级的对齐标注。这是 SVTR 能够高效识别文字的关键机制。
架构特点
- CNN + Transformer 混合:CNN 提取局部特征,Transformer 捕获全局上下文依赖
- 固定高度输入:文字行图像高度统一为 48px,宽度按比例缩放,便于批处理
- 序列输出:输出长度为 W/4 的序列特征,经 CTC 解码得到最终文字
在 MinerU 中的应用
在 MinerU 中,SVTR 是 OCR 流水线的第三阶段——文字识别。它接收经过 DBNet++ 检测和透视变换矫正后的文字行图像,输出最终的文字内容。
来源
- raw/assets/MinerU/minerU_04_ocr.md — MinerU 深度解析系列 · 第四篇:OCR 引擎