GRPO(Group Relative Policy Optimization,组相对策略优化)是 DeepSeek 团队提出的强化学习算法,已成为反思式推理训练的主流方法。与传统 PPO 算法需要维护一个与策略模型同等规模的价值模型不同,GRPO 通过对同一问题采样一组输出,在组内计算相对优势,省去了价值模型的显存开销。
对于每个输入问题 q,GRPO 从旧策略中采样 G 个输出,利用这组输出的奖励均值和标准差构造优势函数,直接在组内进行相对比较。这种设计大幅降低了训练成本,使得大规模推理模型的强化学习训练变得可行。
DeepSeek-R1 证明了仅通过强化学习即可让模型自发涌现反思能力,无需任何人工标注的思维链数据。其训练路径为:
这一突破表明,只要给予足够的难题、可靠的评分标准和训练资源,模型能够通过自我探索学会复杂的反思推理能力。
反思式推理的强化学习训练通常采用两类奖励信号: