反思式推理的成本主要来源于额外的推理轮次。根据 2026 年的实测数据,不同推理模式的 Token 消耗倍数如下:
推理模式 | Token 消耗倍数 | 典型延迟增幅 |
|---|---|---|
单次生成(基线) | 1× | 基线 |
ReAct | 1–3× | 低至中等 |
反思式推理(Reflection) | 2–4× | 中等 |
评估器-优化器(Evaluator-Optimizer) | 2–3× | 中等 |
多智能体反思(MAR) | 3–10× | 高 |
Tree-of-Thoughts | 10–50× | 很高 |
反思式推理对延迟的影响体现在两个维度:
总体而言,反思式推理的端到端延迟通常是 ReAct 等单次执行模式的数倍。对于实时语音交互等延迟敏感场景(首字延迟需低于 150 毫秒),反思式推理通常不适用。
吴恩达在 2026 年提出的"轻量级反思"策略被业界广泛采纳:仅在关键决策点(如工具调用前、最终输出前)触发反思,而非每一步都执行。此外,还可以采用快速模型生成初稿加慢速强模型进行反思验证的异构方案,在保证质量的同时控制成本。