1. LlamaParse 文档解析服务
LlamaParse 是 LlamaIndex 提供的商业化文档解析服务,采用视觉语言模型(VLM)进行智能文档理解。与传统基于坐标的 OCR 不同,LlamaParse 将文档解析视为语义推理问题,能够理解文档层次结构和上下文。
2. 核心解析能力
- 布局感知解析:理解页面结构,保持多栏文本、页眉页脚、嵌套章节的正确阅读顺序。
- 表格提取:可靠检测并重建复杂表格,包括合并单元格和多层表头,输出为 Markdown 或 JSON 格式。
- 图表理解:将图表和图形转换为结构化数据,供下游管道使用。
- 手写文字识别:解析潦草的手写内容,提取结构并使其可用于 AI 工作流。
- 多模态支持:支持 130 多种文件格式,包括嵌入图片、复杂布局、多页表格等。
3. 输出格式
LlamaParse 支持多种输出格式:
- Markdown:保留文档结构的清洁文本,表格以 Markdown 表格形式输出。
- JSON:结构化数据提取,包含元素级元数据(页码、元素类型、坐标),支持审计追溯。
- HTML:适用于需要网页格式输出的场景。
4. 解析层级
LlamaParse 提供不同层级的解析服务:
- Fast 层级:基于规则的提取,适用于简单纯文本 PDF,成本最低。
- Standard 层级:布局检测 + OCR,适用于半结构化文档。
- Agentic 层级:使用视觉语言模型进行最高质量的解析,适用于复杂布局、图表、表格,准确率最高。
5. LiteParse 本地解析器
LlamaIndex 同时提供开源的 LiteParse 本地解析器,支持在本地快速处理 PDF、Office 文档和图片,无需云端服务或 LLM Token,适用于对数据隐私要求较高的场景。