普通大语言模型的推理方式类似于心理学中的 System 1(快思考):快速、直觉、单次前向传递即可生成响应。这种模式在事实召回和创意生成上表现出色,但在面对需要多步推理的问题时,容易在中间步骤产生累积性错误。
反思式推理引入了 System 2(慢思考)的特征:在输出最终答案之前,模型会进行大量的内部"密谋"——拆解问题、提出假设、自我检查,甚至在发现错误后实时推倒重来。这代表了从训练阶段算力分配到推理阶段算力分配的范式转移。
普通 LLM 一旦生成了错误内容,没有内在机制去发现和纠正它——错误会一直传播到最终输出,只能依靠用户发现后手动重试。反思式推理则将错误发现的责任从"用户侧"转移到了"Agent 侧",大幅降低了人工干预的频率。
传统模型的算力几乎全部投入在预训练阶段,推理时只是简单地执行一次前向传播。反思式推理模型则在推理阶段额外分配大量算力用于生成中间推理 token,通过"想得更多、想得更深"来提升准确性。在 AIME 2024 数学竞赛中,GPT-4o 得分约 12%,而引入推理时算力的 o1 模型得分约 74%,这一差距主要来自推理阶段的额外计算投入。