1. 常识推理效果
- 在 CommonsenseQA 数据集上,链式思维带来的提升相对有限(约 +5%),且对小规模模型可能无提升甚至有负效果
- 在 StrategyQA 等常识推理数据集上,链式思维有更明显的提升(约 +10%)
- 链式思维主要适用于需要明确推理步骤的任务,对纯常识判断类任务效果有限
2. 符号推理效果
- 显著提升:在数学符号运算、逻辑符号推理等任务上效果突出
- 在抛硬币、字母拼接等符号操作任务上,链式思维能促进长度泛化能力
- 在 AQuA 等问答式数学推理任务上,链式思维提升约 12%-14%
- 优势体现:符号的中间表示便于模型追踪和验证
3. 局限性
- 对高度抽象的符号操作(如高级数学证明)效果有限
- 依赖模型的基础符号理解能力
- 推理链条过长时可能出现符号混淆或累积错误
- 对部分常识推理任务(如纯判断类)效果不明显,甚至可能降低性能
4. 最佳实践
- 结合少样本提示提供符号操作示例
- 使用结构化格式呈现符号推理过程
- 对关键符号步骤进行显式标注