思维链提示强制模型分步推理,减少逻辑漏洞。MIT 研究发现最优性能出现在模型生成 3 至 7 个 distinct 推理步骤时。微软研究院报告显示,7B 参数模型使用 Logic-RL 变体在 AIME 数学竞赛题上准确率提升 125%。但较小模型(低于 7B 参数)往往难以有效运用 CoT。
通过多次独立采样生成不同推理路径,选取出现频率最高的答案。这种方法在数学问题上带来 18% 的提升,在文字应用题上提升 11%。代价是延迟增加——使用 5 条推理路径会使 API 调用耗时增加约 3.2 倍。
CoVe 是一种系统化方法:模型先起草初始回答,再规划验证问题来核查草稿,然后独立回答问题以避免偏见,最终生成经过验证的回答。实验表明 CoVe 将 F1 分数提升了 23%(从 0.39 到 0.48),优于 Zero-Shot、Few-Shot 和 Chain-of-Thought 方法。
要求模型为每个事实性声明提供来源引用,并将输出限制为预定义的 JSON Schema 或枚举选项。引用约束的优势不仅在于提高准确性,更在于让用户可以逐条审计答案。结构化输出则将模型的生成空间限制在有效选项范围内,从根本上缩小幻觉的空间。
对于事实性任务,将 temperature 设为 0 或接近 0 可显著降低幻觉风险。生产环境的推荐配置是:抽取/分类任务用 temperature=0,带引用的 RAG 回答用 temperature=0.2,头脑风暴类创意任务才使用 temperature=0.9 等高值。