在 RAG 系统中,检索器组件可以通过蒸馏进行轻量化。使用大型稠密检索器作为教师,训练小型学生检索器模仿其向量表示。经过蒸馏的检索器可以在保持相近召回率的同时,大幅降低索引构建和查询的延迟。
RAG 系统中的生成器(大语言模型)是蒸馏的主要受益者。通过蒸馏将百亿元参数的生成器压缩至数十亿参数级别,可以在显著降低推理成本的同时保持高质量的答案生成能力。在知识库问答、文档摘要等场景中,蒸馏后的生成器结合检索到的上下文,仍能产生准确且连贯的回答。
更先进的方法是将检索器和生成器作为一个整体进行蒸馏。教师系统使用大规模检索器加超大生成器的组合,学生系统使用轻量化检索器加小型生成器。通过联合优化,学生系统学习整体的 RAG 行为模式。企业级平台如腾讯云 TI-ONE 正在逐步完善此类端到端蒸馏能力。