LlamaIndex 支持处理文本、图像、表格等多种类型的数据。通过 MultiModalVectorStoreIndex,可以在同一索引中同时存储文本 Node 和图像 Node,实现跨模态检索。
图像通过 CLIP 风格的多模态嵌入模型转换为向量表示,与文本嵌入存储在同一向量空间或独立的图像向量存储中。查询时,系统可以同时检索相关的文本块和图像。
对于需要理解图像内容的场景,LlamaIndex 支持集成视觉语言模型(VLM),如 GPT-4V、Claude 3 等。这些模型能够理解图表、示意图、照片等视觉内容,并基于图像生成描述或回答问题。