HippoRAG 是由俄亥俄州立大学 NLP 组(OSU-NLP-Group)于 2024 年提出的检索增强生成(RAG)框架,其论文《HippoRAG: Neurobiologically Inspired Long-Term Memory for Large Language Models》发表于 NeurIPS 2024。该框架受人类海马体记忆索引理论启发,将大语言模型、知识图谱与个性化 PageRank(Personalized PageRank, PPR)算法协同结合,模拟大脑新皮层与海马体在长期记忆中的不同角色,从而在单步检索中完成传统方法需要多轮迭代才能实现的多跳推理。后续迭代版本 HippoRAG 2 进一步引入段落节点与识别记忆机制,论文《From RAG to Memory: Non-Parametric Continual Learning for Large Language Models》发表于 ICML 2025。
HippoRAG 采用"离线索引 + 在线检索"两阶段流水线。离线阶段,系统用大语言模型从语料中抽取开放信息三元组,构建无模式约束的知识图谱,并借助检索编码器为节点补充语义关联;在线阶段,系统从问题中提取实体,以这些实体为起点在知识图谱上运行个性化 PageRank 算法传播概率,一次性定位关联性最强的子图与文档,实现单步多跳检索。
HippoRAG 将人脑记忆系统的三类结构映射到检索流程中:
传统向量 RAG 对每篇文档独立编码,难以关联分散在不同文档中的信息;而 IRCoT 等多步检索方法虽能迭代整合,却需每步调用大模型,过程缓慢且成本高昂。HippoRAG 通过图结构的一次性概率传播完成多跳关联,在保持甚至提升准确率的同时,大幅降低在线检索的成本与延迟。
HippoRAG 在离线索引阶段采用开放信息抽取(Open Information Extraction, OpenIE)技术,由大语言模型从每个文本段落中自动识别实体与关系,生成无预设模式(schema-free)约束的三元组,例如从"Alhandra 出生在 Vila Franca de Xira"中抽取"Alhandra → 出生在 → Vila Franca de Xira"。这种开放域抽取无需事先定义完整的本体模型,因此能灵活适应多样化的文档内容。
抽取得到的三元组构成知识图谱的结构:三元组的主语与宾语作为短语节点(Phrase Node),关系作为连接节点的边。这些节点与边共同形成一张无模式知识图谱,作为后续图检索的基础索引。
开放抽取的优势在于灵活性,能够覆盖开放域语料中难以穷举的关系类型;代价是抽取结果可能存在噪声或松散关联。这也是后续版本与相关改进工作引入更严格本体约束、以提升图谱质量的原因所在。
海马体索引理论认为,大脑新皮层负责存储具体的记忆内容,而海马体则存储指向这些内容的稀疏索引指针。HippoRAG 借鉴这一理论,将知识图谱视作"人工海马体索引"——图谱节点是指向原始文档的索引指针,而非文档内容本身。
在 HippoRAG 中,知识图谱保存的是实体之间的关联结构,原始文档段落则作为被指向的内容。检索时系统先在图谱上定位高相关节点,再将这些节点映射回其对应的原始文档片段,从而把"图上的关联"转化为"文本上的证据"。
为了让索引有效工作,HippoRAG 引入"节点特异性"权重,即一个节点出现所在段落数量的倒数,作用类似于图结构原生的逆文档频率(IDF)。出现频繁的高频实体(如"公司""国家")权重被压低,罕见实体权重被抬高,避免高频节点在概率传播中主导检索结果。消融实验显示,移除节点特异性会使 MuSiQue 的 Recall@2 从 40.9 下降到 37.6。
离线阶段的第一步,是用大语言模型对语料库逐段执行开放信息抽取,将非结构化文本转化为无模式知识图谱三元组,作为图谱的节点与边来源。
由于开放抽取得到的节点往往是表面表述不同的短语,系统进一步用检索编码器(如 ColBERTv2)计算节点间向量相似度,对语义相近但表述不同的节点添加"同义词边",将它们关联起来,从而增强图谱对语义变体的鲁棒性。
抽取与关联完成后,系统将所有三元组与同义词边合并为一张持久化的知识图谱,并为每个节点保存向量表示,供在线检索阶段直接调用。整个离线索引过程一次性完成,新知识可通过新增图谱边的方式持续整合,而无需重新训练大语言模型。
个性化 PageRank(Personalized PageRank, PPR)是 HippoRAG 在线检索的核心。算法以问题实体对应的图谱节点为起点,让"随机游走者"从这些起点出发沿图的边传播概率,访问概率越高的节点,说明它与查询的关联越紧密。
PPR 支持从多个查询实体节点同时启动传播,能够找到同时靠近多个查询线索的关键节点——即那些通过关系路径把分散查询线索连接起来的节点,这正是多跳检索得以在单步内完成的关键。
计算出节点重要性得分后,HippoRAG 将高得分节点映射回其所属的原始文档段落,按段落聚合 PPR 概率,输出最终排序的检索结果,供后续问答环节使用。
在线检索的第一步,是从用户问题中识别关键实体,并将这些实体链接到知识图谱中对应的节点,作为后续图传播的起点。
以查询实体节点为起点运行个性化 PageRank 算法,概率沿图谱的边扩散,逐步放大与查询强相关的节点的重要性得分。
根据 PPR 得分找到同时靠近多个查询线索的关键节点,再将这些节点映射回原始文档段落,输出排序后的检索结果,作为问答生成的上下文。
自然语言中同一概念常有多种表述,例如"斯坦福大学"与"Stanford"指代同一实体。若图谱仅按字面区分节点,这类语义等价但表述不同的概念会被割裂,导致关联推理中断。
HippoRAG 用检索编码器计算短语节点间的向量相似度,对相似度超过阈值的节点添加同义词边,将语义相近但表述不同的节点连接起来。这一步骤确保了图结构对语义变体的鲁棒性,使概率传播能够跨越不同表述命中同一概念。
多跳检索要求系统跨越多个中间实体才能从问题抵达答案,例如"某电影导演的出生地"需要先关联"导演"再关联"出生地"。传统向量检索只能匹配与问题字面相似的段落,难以完成这种路径式关联。
HippoRAG 借助个性化 PageRank 在知识图谱上的一次性概率传播完成多跳关联:概率沿关系边逐跳扩散,即使某篇文档不包含任何查询词,只要它通过中间实体链与查询线索强相连,也能被检索到。这使得原本需要多轮"检索—推理"迭代的问题,在单步图搜索中即可求解。
由于无需在每一步调用大语言模型进行迭代推理,单步 HippoRAG 在达到与 IRCoT 相当甚至更优准确率的同时,在线检索成本降低 10~30 倍,速度提升 6~13 倍。
标准 RAG 对每篇文档独立编码,如果回答某个问题所需的信息分散在多篇文章中、且这些段落之间不共享任何查询词,基于向量相似度的检索就无法将它们关联起来。
HippoRAG 通过开放抽取把分散在不同文档中的实体与关系汇入同一张知识图谱,图谱的边成为跨越文档边界的关联通道。当查询实体在图上启动概率传播时,信息便能沿关系路径跨文档流动,从而把原本孤立的段落串联成完整的推理链。
与纯向量相似度这种"黑盒"匹配不同,HippoRAG 的检索结果建立在知识图谱的显式关系路径之上。系统能够说明答案是通过哪些实体与关系边关联到的,而非仅给出一个相似度分数。
由于图谱节点最终映射回原始文档段落,检索到的每一条证据都可以回溯到具体的来源文本,便于人工核对与追溯,也降低了生成幻觉的风险。
在需要较强跨文档关系推理的 2WikiMultiHopQA 数据集上,HippoRAG 相比强基线 ColBERTv2 表现突出:Recall@5 从 68.2 提升到 89.1,Recall@2 与 Recall@5 分别提升约 11 和 20 个百分点。这一显著收益正源于该数据集的问题高度依赖实体间的路径式关联,与 HippoRAG 的机制高度契合。
在更复杂、知识整合要求更高的 MuSiQue 数据集上,HippoRAG 的 Recall@5 从 49.2 提升到 51.9,提升幅度约 3 个百分点,虽相对温和但依然正向。
在知识整合要求较低、存在较多干扰信号的 HotpotQA 数据集上,HippoRAG 与基线方法表现相当,未全面胜出。这说明图结构检索的优势与任务性质密切相关——当问题确实需要跨文档多跳推理时,知识图谱与 PageRank 才能带来显著收益。
单步 HippoRAG 在在线检索阶段无需多轮调用大语言模型,相比 IRCoT 这类迭代检索方法,成本降低 10~30 倍,速度提升 6~13 倍,同时保持相当甚至更优的问答准确率。
在离线索引环节,HippoRAG 的资源消耗也显著低于 GraphRAG、RAPTOR、LightRAG 等其他基于图的解决方案,使其在生产环境中更具可行性。
HippoRAG 最契合需要跨文档关联与多步推理的多跳问答场景,例如"某机构负责人的毕业院校所在国家"这类需串联多个事实的问题。
对于篇幅长、实体关系密集的语料(如文献综述、法律卷宗、企业知识库),HippoRAG 能够把分散的信息整合为连贯的整体,辅助读者形成对复杂上下文的整体理解。
由于新知识可通过新增图谱边的方式整合,而无需重训模型,HippoRAG 适用于需要频繁吸收新信息、又希望避免灾难性遗忘的持续学习型知识库。
Agent 需要在长期交互中持续积累并关联分散的经验,这正是 HippoRAG 的设计目标。它可作为 Agent 的非参数化长期记忆模块,把外部文档与交互经验组织为可关联、可检索的知识图谱。
与更新模型参数的参数化记忆不同,HippoRAG 采用非参数方式——新记忆通过向知识图谱添加节点与边来写入,既避免了灾难性遗忘,也无需承担高昂的重训成本,为 LLM 的持续学习提供了一条可行路径。
标准向量 RAG 将每篇文档独立编码为向量,检索时按与查询的向量相似度返回最相近的段落,本质是"匹配长得像的文本"。HippoRAG 则先把语料组织为知识图谱,检索时在图上做概率传播,本质是"寻找通过关系路径相连的文本"。
向量 RAG 在简单、单跳、字面匹配即可命中的事实性问题上依然高效;HippoRAG 的优势则集中在需要跨文档关联与多跳推理的复杂场景。二者并非替代关系,而是面向不同难度任务的互补选择。
HippoRAG、RAPTOR、LightRAG 与 GraphRAG 同属知识图谱增强的 RAG 方法,都试图通过引入图结构弥补纯向量检索在多跳推理与意义构建上的不足。
HippoRAG 的检索原语是实体节点上的个性化 PageRank 传播,而 GraphRAG 依赖社区摘要、RAPTOR 依赖层次化摘要树。不同的图构建与检索方式,决定了它们在不同任务上的表现差异。
在 2WikiMultiHopQA 等实体中心、强路径关联的数据集上,HippoRAG 的表现优于 RAPTOR 等基线;同时其离线索引的资源消耗显著低于 GraphRAG、RAPTOR、LightRAG 等同类图方案,在效率上具备优势。
HippoRAG 与 IRCoT 这类多步检索方法是互补关系。IRCoT 通过"检索—思维链推理"多轮迭代整合信息,准确率高但成本大;HippoRAG 单步即可完成多跳关联,二者可组合使用。
当把 HippoRAG 作为 IRCoT 的检索器时,性能在多个数据集上进一步提升:MuSiQue 的 Recall@5 改善约 4 个百分点,2WikiMultiHopQA 改善约 18 个百分点,HotpotQA 也有约 1 个百分点的额外提升。在 2WikiMultiHopQA 上,以 HippoRAG 为检索器的 IRCoT 问答 F1 达到 62.7,明显高于单独 IRCoT 的 45.1。
这种结合说明图检索与迭代推理可以协同增效——HippoRAG 提供高质量的多跳候选证据,IRCoT 在此基础上做多轮推理整合,共同覆盖更复杂、此前难以处理的推理场景。