过程奖励模型(Process Reward Model, PRM)代表了一种从仅评估最终结果到逐步骤评分的范式转变。PRM 对推理链中的每个中间步骤分别打分,识别出"正确答案但错误推理路径"的情况——这类侥幸正确的结果在传统结果奖励模型下会被错误地强化。
在实际应用中,PRM 可以拒绝那些中间步骤得分过低的候选答案,即使其最终碰巧正确。这种机制确保了推理过程的可靠性,而不仅仅是结果的正确性。
ThinkPRM 提出了一种新的验证思路:让验证器本身也具备长思维链推理能力。传统的判别式 PRM 需要对每个步骤进行人工标注,成本极高。ThinkPRM 通过让验证器生成自己的验证推理链,仅需极少量标注数据即可超越判别式验证器和 LLM-as-a-Judge 方案。
这种"用推理来验证推理"的方法在 ProcessBench、MATH-500 等基准上取得了领先效果,且所需的训练数据量仅为传统方法的百分之一。
CRITIC 框架进一步指出,LLM 在自我验证事实性声明时存在固有局限——模型产生的幻觉往往对其自身也具有说服力。因此,高可信度的验证需要将批判步骤锚定到外部工具:
这种"外部锚定"策略是生产环境中提升反思可信度的关键手段。