HippoRAG 采用"离线索引 + 在线检索"两阶段流水线。离线阶段,系统用大语言模型从语料中抽取开放信息三元组,构建无模式约束的知识图谱,并借助检索编码器为节点补充语义关联;在线阶段,系统从问题中提取实体,以这些实体为起点在知识图谱上运行个性化 PageRank 算法传播概率,一次性定位关联性最强的子图与文档,实现单步多跳检索。
HippoRAG 将人脑记忆系统的三类结构映射到检索流程中:
传统向量 RAG 对每篇文档独立编码,难以关联分散在不同文档中的信息;而 IRCoT 等多步检索方法虽能迭代整合,却需每步调用大模型,过程缓慢且成本高昂。HippoRAG 通过图结构的一次性概率传播完成多跳关联,在保持甚至提升准确率的同时,大幅降低在线检索的成本与延迟。