互联网文本中混有大量未经核实的信息、过时内容和谣言。模型在训练过程中缺乏辨别真伪的内在能力,会将学到的偏见和虚假信息写入参数。如果把 AI 比作学生,数据污染就像给学生看了错误的教科书,自然会导致"胡说八道"。
通用领域数据占比过高会导致专业领域知识不足。在医疗问答任务中,若训练数据仅覆盖常见疾病,模型对罕见病就容易生成错误信息。领域覆盖不均还会导致模型在面对专业术语时更容易产生幻觉,因为它缺少足够的上下文来建立正确的概念关联。
训练数据中重复样本过多会导致模型过度记忆特定表述而非学习通用规律。大模型防过拟合的第一道防线是严格的去重——包括文档级、句子级甚至子串级的去重。重复数据还会加剧隐私泄露风险,因为模型可能一字不差地复述训练数据中的敏感信息。
大型模型训练消耗巨大计算资源,训练数据存在固定的"知识截止日期"。模型对截止日期之后的事件一无所知,当被问及最新发展时,要么承认不知道,要么基于旧知识进行推测——后者就是幻觉的高发场景。这也是 RAG 成为必要补充的根本原因之一。