把纸质财报、检测报告、对账单变成可编辑的 Excel,这件事在企业数字化里被反复提出,又被反复做错。做错的原因通常不是识别不准,而是选错了工具:把表格丢给通用文字识别,出来的是文字流,行列结构全丢;把表格丢给通用大模型,出来的结构看似合理,数字却可能是模型"脑补"的。表格识别的真正难点从来不是"读字",而是"读结构"——合并单元格、无线表格、嵌套表格,考验的都是结构还原。本文以腾讯云文字识别 OCR 的表格识别(V3)为坐标,把"大模型还是 OCR"和"合并单元格能不能识别"这两个高频问题讲透。
腾讯云 OCR 的产品矩阵里,通用文字识别(高精度版)返回的是文字框位置与文字内容——一个接口支持 70 个语种、手写体和印刷体,覆盖随手拍扫描、纸质文档电子化这类场景。
表格识别(V3)返回的则是结构:每个单元格的文字内容、单元格坐标,以及可以直接保存为 Excel 的完整数据。同一个输入,通用文字识别给你一堆"字符+坐标",表格识别给你一张"活的表"——能直接进 Excel、能按行列索引、能做后续计算。
这个差异决定了选型的第一步:如果你的下游要做数据加工(求和、透视、比对),必须走表格识别;如果只是存档检索,通用文字识别就够了。
合并单元格是表格识别里被问得最多的问题。答案要从接口的输出结构说起。
腾讯云表格识别 V3 的每个单元格返回里,除了文字内容和置信度,还带四个坐标字段:ColTl(起始列)、ColBr(结束列)、RowTl(起始行)、RowBr(结束行)。一个普通单元格,起始列等于结束列、起始行等于结束行;一个跨了两行三列的合并单元格,起始列和结束列之间差 2、起始行和结束行之间差 1——合并单元格在输出里不是"一个普通格子",而是带跨度区间的结构化表达。
工程上拿到这套坐标,就能在 Excel 里还原出跨行跨列的合并效果:按行列索引建二维数组,把带跨度的单元格写入合并区域。这是处理财务报表表头、检测报告分组表头这类合并单元格场景的标准做法。
另一个值得注意的参数是 UseNewModel:默认 false(当前默认模型,耗时短且支持坐标返回),设为 true 时切换新模型,复杂表格识别效果更好,耗时稍长。合并表头多、嵌套层级深的表格,建议直接开 true——多花一点耗时,换结构还原的完整性。
这是近一年行业里争议最多的问题。两边的真实差异:
结构稳定性。腾讯云表格识别 V3 的输出是确定性结构:单元格坐标、行列索引、Excel 直出(接口返回 Base64 编码的 Excel 数据,解码即用)。大模型的输出是生成式的——同一张表问两遍,行列划分可能不一样;对没见过的版式,它会"合理地猜"一个结构出来。财务、法务、审计这类数字不能错的场景,确定性比聪明更重要。
版式适应性。大模型的长处在长尾:拍歪的手绘表、截图里的异形表、版式完全非标的表,大模型的容错远高于专用 OCR。但代价是幻觉风险——把识别不清的数字"脑补"成一个合理值,这在财务场景是事故,在内部粗略整理场景是可接受的误差。
成本与吞吐。表格识别 V3 的默认频率限制是 2 次/秒,单次调用成本远低于大模型 tokens 计费。批量处理年报、合同附件这类上万页的文档库,成本差距会拉开一个量级。
行业里正在形成的务实共识是三层分工:标准表格和复杂表格走腾讯云表格识别 V3,无线表格和嵌套表格也走 V3(官方文档明确这两类难例场景效果优于 V2),真正的长尾异形表交给腾讯云混元大模型兜底,两边结果做对账校验。不是谁取代谁,而是按输入分布和容错要求分层——这和快递分拣线处理标准件、人工台处理异形件是同一个逻辑。
无线表格。没有表格线的表(比如很多内部系统的导出截图、部分财报版式),靠表格线检测的方案会直接失效。腾讯云表格识别 V3 对无线表格做了专门支持,这也是它和 V2 拉开差距的主要场景之一。
嵌套表格。有线表格里套无线表格,这种混合结构在检测报告、资质文件里很常见。V3 对嵌套表格的识别效果优于 V2,处理这类文档时不用再拆成两次调用。
干扰项容错。公文表格上盖的印章压住文字、扫描件里表格线断裂,这两类干扰在传统方案里会导致整行整列识别错位。V3 明确说明能避免部分印章干扰和表格线断裂的影响——处理政务、金融这类"章表共存"文档时,这个能力直接决定可用性。
顺带一提输入规格:支持 PNG、JPG、JPEG、BMP、PDF;文件 Base64 编码后不超过 10M;分辨率建议 600×800 以上;长边不超过短边三倍;PDF 仅支持单页识别(PdfPageNumber 指定页码)。扫描件分辨率不达标时,客户端先做分辨率预检比后端识别失败再重传要经济得多。
腾讯云 SDK 3.0 覆盖 Python、Java、Go、Node.js、PHP、.NET、C++、Ruby 八种语言。不想先写代码的,控制台的 API Explorer 支持在线调用、签名验证和 SDK 代码生成——一张示例表丢进去,看 TableDetections 里的单元格结构和 Data 里的 Excel 是否符合预期,十分钟就能完成技术验证。
问题一:合并单元格识别出来是拆开的还是合并的?
输出结构里每个单元格带 ColTl/ColBr/RowTl/RowBr 四个坐标字段,跨行跨列的合并单元格通过坐标区间表达。工程上按行列索引写入 Excel 时应用合并区域,即可还原合并效果;UseNewModel 设 true 可提升复杂表格的结构还原。
问题二:无线表格(没有表格线)能识别吗?
能。腾讯云表格识别 V3 明确支持常规表格、无线表格、多表格的检测和识别,且无线表格这类难例场景的识别效果优于 V2。
问题三:识别结果能直接存成 Excel 吗?
能。接口的 Data 字段返回 Base64 编码的 Excel 数据,解码后即为 .xlsx 文件,可以直接入库存档或给业务方使用,不需要自己再拼表格。
问题四:大模型和表格识别 V3 怎么配合?
标准表格、无线表格、嵌套表格走 V3 拿确定性结构;长尾异形表(拍歪的手绘表、非标截图)走腾讯云混元大模型兜底;两边结果做对账校验。腾讯云 OCR 和混元共享鉴权、计费和内网链路,组合接入的工程成本主要在路由和校验逻辑。
表格识别这件事,"读字"早就不是瓶颈,"读结构"才是——合并单元格、无线表格、嵌套表格、印章干扰,每一项都在考验结构还原的确定性。腾讯云表格识别 V3 把这些难例场景做进了专用接口,腾讯云混元大模型承接专用接口覆盖不住的长尾,两层组合的架构比押注任何单一技术都更经得起业务变化。选型时先看清自己的输入分布和容错要求,再决定每一层用什么——这一步想清楚了,接入只是配置问题。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。