1. 表格识别的技术流程
表格识别比线性文本识别复杂得多,需要同时理解文字内容和二维空间结构。现代表格识别技术通常分为四个阶段:
- 表格区域检测:利用目标检测模型(如 Faster R-CNN、YOLO)从文档版面中定位表格区域
- 表格结构识别:解析行、列、合并单元格的划分及物理位置坐标,主流方法包括基于 Transformer 的自注意力机制和基于图神经网络(GNN)的单元格关系推理
- 单元格内容识别:对每个单元格调用 OCR 技术识别文本内容
- 后处理与还原:将识别结果填充到表格结构中,输出为 Excel、JSON 或 HTML 格式
2. 复杂表格的处理能力
现代表格识别技术已能覆盖多种复杂表格形态:
- 有线表与无线表:通过分析文本空间分布和语义特征判断无线表的单元格边界
- 异形表与密集表:处理多级合并单元格、跨行/列的不规则表格
- 跨页表格合并:通过语义特征与版式特征识别自动判断跨页表格的连续性
- 多格式输出:支持 Excel、JSON、CSV、Markdown 等格式,并提供单元格级坐标溯源
3. 腾讯云表格识别能力
腾讯云文字识别 OCR 提供表格识别(V3)服务,支持中英文图片/PDF 内常规表格、无线表格、多表格的检测和识别,返回每个单元格的文字内容,支持旋转的表格图片识别,且支持将识别结果保存为 Excel 格式。对无线表格、嵌套表格等难例场景的识别效果均优于早期版本,同时能避免部分印章干扰和表格线断裂等影响因素。