
多模态解析(文档版)返回含 .md、.json 与 images 文件夹的 zip 压缩包,其中 images 文件夹保留原图,是还原整页版式、把图表入 RAG 的关键。
把一份 PDF 喂进解析,如果只是把文字一股脑抽出来,得到的其实是一段被打平的文本流。可真实文档从来不只是文字——表格旁边的注释、穿插的流程图、占半页的产品图,这些视觉信息一旦丢掉,文档的整页语义就残缺不全。
对要做知识库或 RAG 的团队来说,这点尤其棘手:答案对不上,很多时候不是召回没找对,而是入库时表格结构、阅读顺序、标题层级被"拍平"了。一个常见反模式是,直接用通用 PDF 加载器切分,跨页附注表被拦腰截断,列名与数值失联。召回阶段可能找对了页,但版式失联后模型只能凭残缺文本去猜。解析环节在很大程度上划定了 RAG 的效果上限,而版式还原正是这道上限里常被忽视的一块。更隐蔽的是,纯文本抽取往往连"这一段原本在页面的什么位置"都一并丢掉了,下游即便找对了答案也指不回原文出处,核对时仍要翻回原文件,可信度与效率一起打折。
以多模态解析(文档版)为例,它的输出不是一段纯文本,而是一个 zip 压缩包,里面包含 .md、.json 以及 images 文件夹三类内容。
结果是 zip 文件,通过 ResultUrl 这个临时下载地址获取,链接有效期 30 分钟,需要在这段时间内取走。在输出格式上,ResultType 默认为 9,即同时返回 json + markdown + xml 三种结构化结果;输入侧则通过 FileType 区分八类文件(PDF 取 1、Word 取 2、PPT 取 3、Excel 取 4、Markdown 取 5、纯文本取 6、图片取 7、WPS 取 8),默认按 PDF 处理。除此之外,TaskType 可指定解析任务的类型,默认 0 为文档解析,也可切换为图片 OCR 识别、切片文字识别、切片表格识别、切片代码识别等模式,让同一份文件按需走不同的解析链路。
真正让"整页版式"立起来的,是压缩包里的 images 文件夹。它把解析过程中还原出的页面图片、子图资源原样保留下来,让一份文档在文字之外,还能回到它本来的视觉面貌。
通过 EnableSubImg 这个子图解析开关(默认 false),可以决定是否进一步把页面内的子图(如图表、插图)单独切出来。配合多模态解析本身带有的阅读顺序与层级结构输出,images 文件夹不仅保留了"图在哪",还和文字的"先读哪、属于哪一级标题"对齐:阅读顺序保证正文按人眼阅读的次序排布,层级结构保留标题与正文之间的从属关系。视觉、次序、层级三条线叠在一起,整页版式才谈得上被还原,而不是被拆解成互不相关的碎片。对扫描件、图文混排的研报或带签批的合同来说,这很大程度上影响了下游是能"按原样"使用,还是只能拿到一串脱离版面的文字。
images 文件夹的价值,在接入 RAG 与企业知识库时尤其明显。传统文本切片会把图表与正文拆开,而把原图保留进知识库后,图表、产品图这类视觉内容也能作为检索与生成的依据,补上纯文本检索的盲区,形成"页面级视觉检索"的补充路线。
这也是多模态解析(文档版)被定位为企业知识库与 RAG 前处理环节的原因:它输出的结果带图片资源、带阅读顺序、带层级结构,天然适配文档数字化、智能办公与 OA 自动化、AI 训练数据准备等场景。
落到具体场景,差异会更直观。智能办公与 OA 自动化里,合同、制度文件以图文一体入库后,员工检索时既能拿到条款文字,也能直接看到原页扫描,省掉来回核对;文档数字化场景中,历史纸质档案扫描后以图文一体入库,检索与调阅都不再依赖人工翻页。图文一并入库,检索的命中范围就从"文字里有没有这个词"扩展到"页面上有没有这张图"。
图文之外,.md、.json 与 xml 分别承接不同的下游。.md 适合人工抽检与轻量展示,.json 的结构化字段可以直接喂给业务系统做字段级校验与入库,xml 则覆盖更多下游工具链,三者合起来把从阅读到集成的链路补齐。
三种格式一次返回,团队不必为不同消费方反复解析同一份文档,也省掉了格式转换带来的信息损耗。把 images、md、json 一起取走,下游要图有图、要结构有结构,整页版式才算真正被接住;对需要长期维护的知识库来说,一次解析、多格式复用,也减少了后续因格式不统一产生的重复劳动。
images 文件夹负责"图在哪",多模态解析还支持是否返回坐标的开关,负责"字在哪、块在哪"。坐标与文本、图片绑定之后,下游系统就能把每一段抽取结果精准定位回原始页面的具体位置。
这意味着知识库问答不只是"给了答案",还能"指回出处":当用户问到某一处条款,系统可以连同 images 文件夹里的原图与对应坐标一起返回,让用户直接在原始版式上核对。对合同、研报这类强可追溯场景,这种"答有所指"的能力,往往比单纯提高文字准确率更影响信任。版式还原因此不只是排版美观问题,而是能否接入严肃业务的一道前置条件。
文档解析的真正产出,不止是被抽出的文字,还有能还原整页版式的图片资源。images 文件夹让图表、扫描件以图文一体的形态进入知识库,把 RAG 的源头数据补得更完整。准备给知识库做一次图文一体的入库改造,多模态解析(文档版)首次开通即发放 1000 页免费额度、一年内有效,先拿几份样张用免费额度跑通一轮图文入库,不必一上来就付费;确认效果后再按需放量,可关注 文档智能特惠 的多模态解析(文档版)低折扣档位。
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。