ReAct(Reasoning + Acting)框架的核心是"思考-行动-观察"的交替循环,让模型在推理过程中动态调用工具获取新信息。根据 ReAct 原论文(Yao et al., ICLR 2023)的实验数据,在 HotPotQA 多跳问答任务上,纯 ReAct 的精确匹配率为 27.4%,略低于纯 Chain-of-Thought 的 29.4%;但当 ReAct 与 CoT 自一致性方法互补结合时,精确匹配率可提升至 35.1%。这组数据揭示了一个重要事实:ReAct 的价值在于为推理引入外部信息源,但其本身并不具备自我纠错能力——这正是它的核心局限。如果第一次走错了方向,ReAct 会继续沿错误路径推进,无法回头审视并修正先前的推理偏差。
反思式推理在 ReAct 的基础上增加了"反思"和"改进"两个环节,形成了"思考-行动-观察-反思-改进"的完整闭环。模型不仅执行任务,还会深度复盘"为什么失败、哪里出错、如何改进",并根据反思结果调整后续策略。
两种框架各有最适合的应用场景:
在实践中,两者并非互斥——ReAct 提供了工具使用的骨架,反思机制提供了错误修正的能力,二者结合形成的 ReAct + Reflexion 架构被视为 2026 年生产级 Agent 的标准配置。
ReAct 的 Token 消耗约为基线的 1 至 3 倍,延迟增幅较低;而反思式推理由于涉及多轮迭代和策略改进,Token 消耗可达基线的 2 至 4 倍。选择哪种方案取决于具体任务对准确性和效率的优先级排序。