业界已建立多个专门针对幻觉的评测基准。SuperCLUE 中文大模型测评基准将"幻觉控制"作为六大核心维度之一,对主流模型进行量化评分。国际上的 TruthfulQA、HaluEval、HalluLens 等基准也从不同角度衡量模型的事实准确性。Vectara 的幻觉排行榜测试了 70 多个模型在 summarization 任务中的表现,幻觉率分布在 1.8% 到 23% 以上。
2024 年发表于 Nature 的语义熵方法通过在语义层面而非词元序列层面计算不确定性来检测幻觉。该方法的核心思路是:同一个意思可以用多种方式表达,如果多次采样生成的回答在语义上高度一致,说明模型对该答案较为确定;反之则可能存在幻觉风险。
通过多次独立采样生成不同回答,然后比较各回答之间的一致性程度。如果多次生成的答案差异很大,说明模型对该问题缺乏稳定认知,幻觉风险较高。这种方法无需访问模型内部参数,属于黑盒检测方案。
Expected Calibration Error(预期校准误差)已成为严肃评估中与准确率并列报告的核心指标。一个幻觉率 5% 但能恰当表达"我不确定"的模型,远比幻觉率 3% 却在每次回答中都同样自信的模型更有实用价值。