大语言模型的核心工作原理是下一词元预测(Next-Token Prediction)。模型在海量文本上通过自监督学习,掌握的是词语、短语和句式之间的统计关联性,而不是真实世界的因果逻辑或事实知识。它从海量文本里学到"苹果"常常和"红""甜""脆"等词语一起出现,于是能流畅说出"红苹果口感甜脆"——它不是懂,只是说得像懂。当面对冷门、专业或训练数据稀缺的问题时,模型为了维持语言的流畅性和连贯性,会在概率分布中选择"看似最合理"的路径,即使这条路径是虚构的。
语言模型的设计初衷是在语言序列中做出好的概率预测,而非输出事实真相。用户希望得到准确信息,模型却只会产出"听起来对"的内容。2025 年 OpenAI 与佐治亚理工学院合作的研究从数学层面证明,语言模型的生成错误率至少是分类错误率的两倍——如果模型在判断答案是否正确时已有较高出错率,那么让它直接生成答案时,错误风险会进一步放大,这个底线即使训练数据完全正确也无法抹掉。
训练数据本身混有错误信息、过时说法和谣言。模型在吸收这些数据时,没有足够的能力把"对的"和"错的"剥离开,结果就把学到的偏见和虚假信息一并写进了回答。此外还存在恶意"数据投毒"行为——通过在网上系统性地投放大量虚假信息"喂"给大模型,进而操控大模型输出答案。
大模型被强制要求必须有回应,而训练过程的缺陷导致 AI 存在讨好用户的倾向。如果预设的问题是错的,AI 不会认为是用户出错,而是生成迎合用户需求的内容,并编造虚假的例证或看似科学的术语来支撑自己的假说。