一般来说,较大规模的模型在事实回忆任务上的幻觉率低于较小模型,尽管随着训练技术的改进这一差距正在收窄。更大模型拥有更多参数来编码训练数据中的事实信息,对罕见知识的记忆也更稳定。然而这种优势并非线性——模型规模翻倍并不等同于幻觉率减半。
反直觉的发现是,更强的推理模型在某些任务上反而幻觉更多。Vectara 排行榜数据显示,Claude Sonnet 4 幻觉率为 10.3%,GPT-5.2 为 10.8%,而 o3-pro 高达 23.3%,相比之下简单的 Gemini 2.5 Flash Lite 仅 3.3%,Qwen 3-8B 为 4.8%。任务是在给定源文档的情况下做摘要——更聪明的模型容易"想太多",从而引入原文中不存在的信息。
小于 7B 参数的模型在面对复杂推理任务时幻觉风险更高,尤其是在缺乏充分微调的情况下。这些小模型在训练数据中只出现过一次的罕见事实上特别脆弱——如果某个人的生日或冷门事件时间在训练数据中仅出现极少次数,模型很难稳定记住。
模型架构、训练数据质量、对齐方法等因素对幻觉的影响往往比单纯的参数量更重要。经过良好 RAG 增强的中等规模模型,其事实准确性可以超过未增强的超大模型。腾讯混元 Hy3 通过重建数据清洗与定向约束对齐,将整体幻觉率从 12.5% 降至 5.4%,这证明数据质量和训练策略的改进可以带来比单纯扩大规模更显著的收益。