将原始文档按设定的块大小切分为多个文本块,便于后续并行处理与精确定位,避免一次性分析整篇文档带来的开销。
这是 LightRAG 区别于朴素 RAG 的关键步骤。系统调用大语言模型,从每个文本块中识别出实体(如人名、机构、地点、事件、概念等)以及实体之间的关系,例如从"心脏病医生诊断心脏病"这类文本中抽取"心脏病医生"与"心脏病"两个实体及"诊断"关系。
在抽取的基础上,为每个实体节点和关系边生成键值对:键是用于高效召回的词语或短语,值是汇总相关片段的文本段落。随后对来自不同文本块的相同实体与关系进行去重合并,缩小图谱规模、降低后续图操作的开销。
将去重后的实体作为节点、关系作为边,组装成结构化的知识图谱,使原本分散在多份文档中的信息通过关联连接起来,为跨文档、多跳推理提供结构支撑。
对文本块、实体和关系分别进行向量化,写入向量数据库,为检索阶段的语义相似度匹配做好准备。