← 最新论文
🤖 AI

HalluTracer: Hallucination Detection via Depth-Averaging Truth Signals

HalluTracer 是一个白盒幻觉检测框架,它通过对所有 Transformer 层进行简单的深度平均来聚合真实性信号,从而提高了准确性,进而克服了现有方法依赖于孤立层或组件所导致的信息丢失问题。

原作者: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihao Guo, Zonghan Wu, Huan Huo, DaYong Ye, Junwei Zhang, Weiran Yao, Zhiwei Liu, Qingsong Wen, Yilei Shao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大语言模型是许多现代人工智能工具背后的引擎,它们能够以类人的流畅度编写流利的文本、回答复杂的问题并解决问题。然而,这些系统存在一个持久的缺陷:它们有时会生成自信但事实错误的陈述,这种失败被称为“幻觉”。这不仅仅是输出中的一个小故障,而是一个根本性的可靠性风险,尤其是在医疗或法律等高风险领域使用这些模型时。多年来,研究人员一直怀疑,即使模型在撒谎,其内部机制也掌握着真相。模型的“大脑”(可以说)编码了一个信号,在最终的文字出现在屏幕之前,就已经能够区分事实与虚构。挑战在于如何学习如何读取那个信号,而不至于迷失在模型庞大且复杂的架构噪声之中。

一组研究人员现在开发了一种名为 HalluTracer 的新方法来解决这个问题。他们并没有试图在模型内部寻找一个单一的“真相开关”,也没有仅仅观察其处理过程中的某一部分,而是决定倾听模型正在进行的整个“自我对话”。当大语言模型处理提示词时,它会将信息通过一系列堆叠的层进行传递,逐步完善其理解。研究人员发现,在每一个这样的层级中,模型都会产生一个微弱的信号,指示即将出现的答案是可能真实的还是虚假的。就单个而言,这些信号是微弱且充满噪声的,就像试图在拥挤的房间里听清一声低语。但研究人员发现,这些低语并非随机的;它们足够一致,以至于如果你将所有的低语结合在一起倾听,信息就会变得清晰。

他们发现的核心在于关于这些层级如何运作的几何学见解。他们发现,每一层检查真相的方式都与前一层略有不同,仿佛每一层都在从略微不同的角度观察问题。由于这些角度如此不同,一层中的误差或噪声不会与下一层相匹配。这至关重要。当研究人员对所有层的信号进行平均时,随机噪声相互抵消了,而一致的真相信号却变得更加强烈。这有点像用颤抖的手拍照:单张快照可能会模糊,但如果你从略微不同的位置拍摄许多张快照并将它们融合在一起,最终的图像就会变得锐利而清晰。通过简单地对所有层的真相信号进行平均,他们的系统就能以卓越的准确度检测出幻觉,其表现通常优于那些试图挑选出观察“最佳”单层的研究方法。

为了测试这个想法,该团队将 HalluTracer 应用于六个不同的语言模型和五个旨在捕捉事实错误的基准测试。结果是一致且强力的。该新方法在各种情况下都比以往的技术更好地检测出了幻觉,根据任务难度的不同,性能提升了 1% 到 14%。在涉及多步推理的特别复杂的任务中,这种提升更为显著,新系统在旧方法难以应对的任务中达到了近乎完美的检测得分。研究人员还证明,这种成功并非源于对观察模型特定部分的幸运选择。他们表明,信号分布得如此均匀,以至于观察模型的哪个特定内部组件并不重要;力量完全来自于整合模型整个深度的信息这一行为。

这项工作改变了我们看待检测人工智能谎言的方式。此前,研究重点在于寻找读取模型思想的完美时刻或完美层级。HalluTracer 表明,真相并非隐藏在某个单一地点,而是编织在整个过程中。通过将模型的内部状态视为一段旅程而非一张快照,研究人员将一个困难的选择问题转化为了一个简单的平均问题。该方法轻量且快速,能够在模型完成生成答案之前就标记出潜在的幻觉。这意味着在未来,人工智能系统可以配备一个实时的安全监控器,通过倾听模型的内部推理过程,在虚假陈述到达用户之前将其拦截,从而使这些强大的工具在现实世界中变得更加可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →