← 最新论文
💬 NLP

Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models

本文介绍了 SinkProbe,一种最先进的幻觉检测方法,它利用注意力汇聚(attention sinks)——即积累了不成比例注意力的标记——作为指示计算从基于输入的转向由先验主导的内部信号,同时还揭示了有效的检测依赖于具有大值向量范数的汇聚,并将以往的方法通过这一机制在数学上进行了统一。

原作者: Jakub Binkowski, Kamil Adamczewski, Tomasz Kajdanowicz

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jakub Binkowski, Kamil Adamczewski, Tomasz Kajdanowicz

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在读一个由一个极其自信、速度极快的机器人编写的故事。这个机器人读过几乎所有被写出来的书,可以回答从古代历史到量子物理学的一切问题。但有时,当机器人卡壳或不知道答案时,它不会说“我不知道”,而是会用一种流畅、圆滑的声音继续说话,编造出听起来完美无缺但完全是虚构的事实。在计算机科学领域,这被称为“幻觉”(hallucination)。这是一个重大问题,因为如果我们信任这些机器人在医疗建议或法律决策等重要任务中,它们的自信谎言可能会导致严重的麻烦。

为了理解如何捕捉这些谎言,我们首先需要窥探机器人的大脑内部。像这样的现代机器人使用一种名为“Transformer”的系统,它通过关注句子中不同部分来确定接下来的内容。把这想象成一群侦探(称为“注意力头”,attention heads)正在观察犯罪现场(句子)。通常,他们会专注于最重要的线索。然而,研究人员最近发现了一些奇怪的现象:有时,这些侦探会对一些特定的、枯燥的线索产生痴迷——比如句子的第一个词或一个空格——从而忽略了其余的证据。他们称这种痴迷为“注意力汇点”(attention sinks)。这就像侦探们正死死盯着一个尘埃团,却因此错过了真正的凶器。

这篇题为《注意力汇点作为大型语言模型幻觉检测的内部信号》(Attention Sinks as Internal Signals for Hallucination Detection in Large Language Models)的论文提出了一个简单而精妙的问题:我们能否利用这些奇怪的“注意力汇点”来抓捕机器人的谎言?作者 Jakub Binkowski 及其团队提出了一种名为 SinkProbe 的新方法。他们认为,当机器人开始产生幻觉时,其内部的注意力系统会“堵塞”或“坍缩”到这些不重要的标记(tokens)上,从而失去与真实事实的联系。通过测量机器人向这些“汇点”倾注了多少注意力,我们可以预测机器人是否即将开始胡编乱造。

侦探的新工具:SinkProbe

作者并不仅仅是在猜测;他们构建了一个工具来测试这个想法。他们观察了几种流行的语言大模型(LLM),如 Llama 和 Mistral 在回答各种棘手数据集(包括数学问题和常识问答)时的注意力图。

以下是他们的方法是如何运作的,使用一个简单的类比:想象机器人的大脑是一条繁忙的高速公路,有很多车道(层/layers)和许多车辆(标记/tokens)。通常,车辆会分散开来,观察道路的不同部分。但当机器人即将产生幻觉时,交通就会发生拥堵。一些特定的车辆(“汇点”)会陷入大规模的交通堵塞,几乎所有的其他车辆都会开始盯着它们,而不是前方的道路。

作者开发了一个名为 Sink Score(汇点分数)的指标,用来精确测量这些特定位置发生了多大的交通拥堵。他们发现,当机器人撒谎时,这些汇点分数会激增。但有一个转折:并非所有的交通拥堵都是平等的。作者发现,对于捕捉谎言真正起作用的“汇点”,不仅要获得大量的注意力,还要承载沉重的负载(一个巨大的“值向量/value vector”)。这就像是发现一场交通拥堵中,被困住的车辆还带着沉重的板条箱;那时你就知道信息的流动出了严重的问题。

他们的发现(以及没能发现的)

结果非常令人期待。当他们训练一个简单的计算机程序(逻辑回归分类器)来观察这些汇点分数时,该程序变得非常擅长识别幻觉。事实上,在他们运行的大多数测试中,他们的这种新方法 SinkProbe 的表现优于其他试图通过不同方式观察注意力模式来检测谎言的现有方法。

例如,在一个名为 GSM8K(包含数学问题)的数据集上,SinkProbe 达到了 0.845 的分数,击败了此前表现最好的方法(得分为 0.835)。在旨在诱导模型撒谎的 TruthfulQA 数据集上,SinkProbe 得分为 0.785,再次名列前茅。作者指出,这种方法在不同规模的模型上都表现良好,从较小的 30 亿参数模型到较大的 120 亿参数模型均适用。

然而,论文谨慎地表示,他们并没有声称已经“解决”了幻觉问题。他们明确指出,该方法需要访问模型的内部注意力权重,这意味着它仅适用于你可以看到大脑布线的开源模型,而不适用于封闭、保密的模型。他们还澄清说,虽然他们发现了注意力汇点与幻觉之间的强有力联系,但并未证明这些汇点导致了谎言。这就像看到汽车引擎过热时发生了车祸;热量是一个明显的故障信号,但热量本身可能并不是导致车祸的原因。

为什么这很重要

这项工作的精妙之处在于它统一了几个不同的观点。作者展示了人们尝试过的其他方法——比如观察注意力图的“形状”,或者比较对问题与对答案的注意力分配——实际上都是在以不同的方式观察同一个“汇点”现象。这就像意识到三个不同的人其实都在通过触摸大象的腿、耳朵和尾巴来描述大象;他们都在感受同一个动物,只是角度不同。

通过聚焦于这些“注意力汇点”,作者提供了一种更简单、更直接的方式来倾听机器人的内心想法。他们发现,机器人的“谎言”通常由一种特定的内部交通拥堵信号所指示,即大脑停止处理新信息,转而开始回收旧的、不重要的信号。虽然这并不能修复机器人撒谎的倾向,但它为我们提供了一个非常有效的警报系统,让我们知道机器人何时开始陷入幻想。

简而言之,这篇论文表明,如果你想知道一个超级智能的 AI 是否在说实话,你不应该只听它说了什么。你还应该观察它在看哪里。如果它正死死盯着错误的东西,那它很可能是在胡编乱造。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →