检索增强生成(Retrieval-Augmented Generation, RAG)通过为大语言模型动态注入外部知识,让 AI 回答前先检索权威资料,如同将"闭卷考试"变成"开卷考试"。RAG 的工作流程分为三步:索引阶段将外部知识库切分并向量化存储;检索阶段将问题转换为向量并在库中搜索相关片段;生成阶段将检索到的知识与原始问题一起送入模型生成基于事实的答案。
多项研究和生产数据表明,RAG 可将幻觉率降低 40% 至 71%。LinkedIn 的 RAG 系统将每个问题的中位解决时间缩短了 28.6%。一家银行客服聊天机器人通过战略性 RAG 实施,响应准确率从 25% 提升至 89%。在生物医学问答场景中,RAG 系统的准确率达到 86%,而基础模型单独使用仅为 58%。
RAG 组件本身也可能引入幻觉,包括检索质量不佳、上下文溢出、重排序偏差等问题。2026 年提出的 Trivia++ 长上下文 RAG 基准显示,现有检测器在长上下文场景下性能显著下降,LLM-as-a-Judge 方法在该基准上 F1 值为 0.694。
2026 年业界涌现出多种高级 RAG 架构:自适应检索根据问题复杂度动态决定检索策略,准确率提升 40%;图检索增强(Graph RAG)支持多跳推理,基于 GraphRAG 的改进方案在多文档问答准确率上从 72% 提升至 91%;全局感知 RAG 为长文档生成高层摘要指导检索;实时流式 RAG 实现知识库秒级同步。