1. 文本检测的技术实现
文本检测的核心目标是在图像中精确定位文字区域并返回边界框坐标。现代检测模型主要采用以下技术路线:
- 基于锚点的方法:如 CTPN,在特征图上预设不同尺度和长宽比的锚点,通过分类和回归预测文字区域
- 无锚点方法:如 EAST,直接回归文本框的几何属性,简化检测流程,在 MSRA-TD500 数据集上处理速度达 13.2 fps
- 基于分割的方法:如 DBNet,通过预测概率图和阈值图实现任意形状文本的像素级分割,在 Total-Text 数据集上取得约 84.6% 的 F-measure
2. 字符识别的技术实现
字符识别将检测到的文字区域图像转换为字符序列,核心挑战在于处理字符间的上下文依赖和序列对齐:
- CRNN+CTC 方案:CNN 提取局部特征,双向 LSTM 建模上下文序列,CTC 损失函数解决帧级预测与字符级标签的对齐问题,在 IIIT5K、SVT 等标准数据集上表现优异
- 注意力解码器:Transformer 架构的识别模型(如 TRBA)通过自注意力机制捕捉全局依赖,在英文场景下识别精度显著优于传统 CRNN
- 端到端识别:如 Donut,完全摒弃传统 OCR 模块,直接从文档图像生成结构化文本输出
3. 检测与识别的协同
在实际生产系统中,文本检测和字符识别通常以流水线方式协同工作。检测模型首先定位所有文本行,然后对每个区域调用识别模型进行字符解码。近年来,端到端模型将两个环节统一为单一网络,避免了级联误差,但模块化流水线在边缘部署和批量处理场景中仍具效率优势。