视觉语言模型将计算机视觉与自然语言理解融合,能够端到端处理文档图像,无需传统的多步骤流水线。VLM 的核心优势在于:
在实际生产系统中,OCR 与 VLM 通常以分层方式协同:
2025~2026 年,紧凑型专用 VLM-OCR 模型(通常参数量低于 20 亿)如 PaddleOCR-VL、DeepSeek-OCR 等报告了领先的文档解析结果。OCRVerse 等框架首次将字符级识别与代码级表示(HTML、LaTeX)统一在轻量级架构中,在 OmniDocBench v1.5 上取得 89.23 的总体分数。传统检测-识别-后处理流水线在受限的边缘和批量文本场景中仍有价值,但已不再定义复杂文档处理的最新水平。