Type: concept
Confidence: 0.80
Created: 2026-04-18
Updated: 2026-04-18
Tags: AIOCR文字识别Vision Transformer深度学习文档处理

SVTR

概述

SVTR(Scene Text Recognizer)是 PaddleOCR 的文字识别骨干模型,基于 Vision Transformer 架构,负责将矫正后的文字行图像转换为文字字符串。

关键内容

识别流程

文字行图像(48×W)
→ 特征提取(CNN + Transformer 混合)
→ 序列特征(长度为 W/4)
→ CTC解码(Connectionist Temporal Classification)
→ 文字字符串

输入:矫正后的文字行图像(高度固定为 48px,宽度按比例缩放) 输出:文字字符串 + 置信度

CTC 解码的妙处

CTC解码 允许模型输出比输入序列更短的字符序列,天然处理了字符宽度不一、字符间隔不均匀等问题,不需要字符级的对齐标注。这是 SVTR 能够高效识别文字的关键机制。

架构特点

在 MinerU 中的应用

MinerU 中,SVTR 是 OCR 流水线的第三阶段——文字识别。它接收经过 DBNet++ 检测和透视变换矫正后的文字行图像,输出最终的文字内容。

来源

相关