OCR 的概念最早由德国科学家 Tausheck 于 1929 年提出。1966 年,IBM 公司的 Casey 和 Nagy 发表了第一篇关于汉字识别的论文,采用模板匹配法识别了 1000 个印刷体汉字。1974 年,Ray Kurzweil 开发出首个全字体 OCR 系统,能够识别几乎任何字体的文字。这一阶段的技术以模板匹配和手工特征设计为主,识别能力局限于特定字体和字符集。
20 世纪 90 年代,随着平台式扫描仪的普及和办公自动化的推进,OCR 技术进入商业化阶段。1989 年,Yann LeCun 在贝尔实验室创建了可识别手写邮政编码的卷积神经网络,准确率达 95% 左右,随后被美国邮政服务部署用于自动分拣。惠普公司于 1985~1994 年间开发了 Tesseract OCR 引擎,2005 年开源后由 Google 于 2006 年起持续维护至今,成为使用最广泛的开源 OCR 工具。
2012 年 AlexNet 在 ImageNet 竞赛中的突破性表现点燃了深度学习革命。2015 年,CRNN(卷积循环神经网络)架构正式发表,将 CNN 的图像特征提取能力与 RNN 的序列建模能力结合,主导 OCR 领域近十年。2017 年,EAST 和 CRAFT 等场景文本检测算法实现了任意形状文本的精确定位。2019 年,百度开源 PaddleOCR 工具包,成为自托管 OCR 的默认选择。2020~2022 年间,TrOCR(微软)和 Donut(NAVER)等基于 Transformer 的端到端模型证明纯注意力架构可匹配甚至超越 CRNN。
2023 年起,视觉语言模型(VLM)的兴起对 OCR 领域产生了颠覆性影响。GPT-4V 等通用多模态模型虽未专门针对 OCR 优化,却在复杂文档理解任务上超越了专用 OCR 系统。2024~2025 年,Mistral OCR、DeepSeek-OCR、PaddleOCR-VL 等专用文档解析模型相继推出,以远小于通用 VLM 的参数量实现了领先的文档解析性能。OCR 的定义正从"字符识别"扩展为"文档理解",传统检测-识别-后处理流水线在复杂文档场景中逐渐被端到端模型取代。