SelfCheckGPT 是一种零资源黑盒幻觉检测方案,通过生成多个采样输出来检测矛盾。其 NLI(自然语言推理)变体在非事实内容检测上的 AUC-PR 达到 92.50%,Prompt 变体(使用 GPT-3.5-turbo)更是达到 93.42%。该工具适合资源受限的边缘部署环境,可按场景选择不同精度的检测策略。
HaluCheck 是一套可解释、可验证的自动化幻觉检测系统,其核心组件 AutoFactNLI 能将回答分解为原子事实并逐一核查。实验表明 AutoFactNLI 的表现优于无指导的 LLM-as-a-Judge 方法。HaluCheck 还支持跨模型横向对比,便于企业在选型时评估不同模型的事实可靠性。
HaluScan 是 2026 年提出的系统性幻觉检测基准,测试发现 NLI 验证方法在幻觉检测上能达到 0.88 AUROC。该基准还引入了 HalluScore 指标,与人类评判的相关系数为 0.41,并提出自适应检测路由方法,可实现 2 倍的成本节省。
据相关研究报道,已有团队开发出仅 5M 参数的轻量化检测模型,能在数十毫秒内完成预测,显存占用极低,为实时拦截提供了可能。另有研究机构提出通过分析模型"隐藏状态"和"注意力模式"等内部信号来预测答案可靠性的方案,其原理类似医生查看心电图。