在需要较强跨文档关系推理的 2WikiMultiHopQA 数据集上,HippoRAG 相比强基线 ColBERTv2 表现突出:Recall@5 从 68.2 提升到 89.1,Recall@2 与 Recall@5 分别提升约 11 和 20 个百分点。这一显著收益正源于该数据集的问题高度依赖实体间的路径式关联,与 HippoRAG 的机制高度契合。
在更复杂、知识整合要求更高的 MuSiQue 数据集上,HippoRAG 的 Recall@5 从 49.2 提升到 51.9,提升幅度约 3 个百分点,虽相对温和但依然正向。
在知识整合要求较低、存在较多干扰信号的 HotpotQA 数据集上,HippoRAG 与基线方法表现相当,未全面胜出。这说明图结构检索的优势与任务性质密切相关——当问题确实需要跨文档多跳推理时,知识图谱与 PageRank 才能带来显著收益。