1. 去除在线强化学习动态
- DPO 将对齐转化为标准监督式损失,无需 PPO 的采样、价值网络与优势估计,避免了强化学习常见的训练不稳定与奖励黑客
2. 单阶段优化降低超参敏感性
- RLHF 需串联 SFT、奖励模型、强化学习三段训练,阶段间超参相互牵连;DPO 仅单阶段,消除了跨阶段依赖与由此带来的调参难度
3. 省去奖励模型的训练与推理
- DPO 不需要单独训练奖励模型,也不在训练中做奖励模型推理,节省了对应的计算与显存开销
- 但 DPO 仍需保留参考模型,训练时通常占用策略模型与参考模型两份权重;使用 LoRA 可显著降低此成本