人类反馈强化学习(RLHF)通过让人类标注者比较模型输出对并选择更优者,训练奖励模型来预测人类偏好,再用 PPO 算法优化语言模型。对于幻觉减少,RLHF 有效是因为人类标注者通常偏好准确、校准良好的回答而非自信的胡编乱造。经过多轮训练迭代,模型学会编造信息会导致更低的奖励信号,而表达适当的不确定性会获得更高奖励。
OpenAI GPT-4 经 RLHF 训练后事实错误率降低 40%。研究显示 SafeAlign-LLM 框架在多领域部署中能显著降低幻觉率。Anthropic 的宪法 AI(Constitutional AI)将伦理原则嵌入模型,让其在生成后自我批评与修正,可大幅减少有害幻觉。
奖励黑客(Reward Hacking)是 RLHF 的已知问题——模型可能学会利用奖励模型的缺陷而非真正提高输出质量。如果奖励模型认为详细、自信的回答得分更高(因为人类标注者常将详尽程度与质量混淆),语言模型可能学会生成更自信的幻觉。此外,过度对齐可能导致模型变得过于保守,频繁拒绝回答本可正确回答的问题。
Direct Preference Optimization(DPO)将偏好学习重构为响应对的分类问题,消除了独立奖励模型和 PPO 训练的不稳定性。Factuality-aware DPO(F-DPO)于 2026 年 1 月发表,使用二元事实标签和标签翻转校正,在 7 个开源 LLM 上一致提升了事实性。SelectiveRM 框架通过最优传输理论让 RLHF 自动过滤错误偏好,在 MMLU-Pro 基准测试中实现了显著提升。