Detecting Hallucinations in Large Language Models via Internal Attention Divergence Signals
本文提出了一种轻量级、单次通过的方法,用于检测大语言模型的幻觉,该方法利用注意力矩阵中的 Kullback-Leibler 散度作为不确定性的可解释预测信号,在无需重复采样或外部模型的情况下,其性能与现有方法具有竞争力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是用通俗语言和日常类比对这篇论文的解读。
问题:自信的“说谎者”
想象你正在向一位非常聪明、博览群书的朋友寻求建议。有时,他们会给出完美的答案。但其他时候,他们会自信地编造一个听起来很棒却完全虚假的故事。这就是人工智能中的幻觉。
棘手之处在于,人工智能并不知道自己在撒谎。它犯错时的自信程度与正确时毫无二致。通常,要识破谎言,你得把同一个问题问人工智能十遍,看看它是否给出不同的答案(就像让证人多次复述故事一样)。但这需要耗费大量的时间和计算能力。
解决方案:倾听“内心独白”
这篇论文提出了一种新的、超快速的方法来识破这些谎言。作者不是等人工智能回答完后再去检查,而是观察它在思考过程中的内部“脑电波”。
在人工智能模型中,有一种机制叫做注意力(Attention)。你可以把注意力想象成一束聚光灯。当人工智能回答问题时,这束聚光灯会照亮其记忆中的不同单词,以决定哪些词对下一个要写的词最重要。
- 当人工智能知道答案时: 聚光灯聚焦且稳定。它会明亮地照亮它所需的具体事实(如人名或日期)。
- 当人工智能在猜测或撒谎时: 聚光灯变得摇晃、分散,或漫无目的地游移。人工智能不知道要看哪里,因此将注意力分散到各处。
“聚光灯测试”(方法)
作者设计了一个简单的数学测试,用来衡量这束聚光灯有多“摇晃”。
- 均匀基线: 想象一个有 100 个人的房间。如果你完全不确定该和谁说话,你可能会平等地看向每个人。这是一种“均匀”分布(每个人分得 1/100 的注意力)。这代表了最大不确定性。
- 测量: 作者测量了人工智能实际的聚光灯与这种“分散”基线之间的差异。他们称之为KL 散度(KL Divergence)。
- 高散度: 聚光灯非常聚焦(强烈地照亮少数几个特定的词)。这通常意味着人工智能很自信且很可能正确。
- 低散度: 聚光灯分散(平等地看向每个人)。这意味着人工智能感到困惑或正在猜测。
等等,论文说的不是相反的吗?
实际上,论文发现了一个细微差别:当人工智能产生幻觉时,它往往试图在它不了解的话题上强行给出一个自信的答案。在这些情况下,注意力模式会奇怪地集中在错误的事物上,或者数学计算显示出一种特定的“散度”信号来标记错误。本质上,数学检测到了人工智能内部的“焦点”与真实、有依据的答案模式不匹配。
“轻量级侦探”
作者不仅观察了聚光灯,还构建了一个微小、简单的检测器(一个“逻辑回归探针”)来读取这些信号。
- 无需重复提问: 这种方法只需要人工智能回答一次。
- 无需额外模型: 它不需要第二个人工智能来检查第一个。
- 快速: 它在一个单次过程中完成,就像读一句话并瞬间判断它是否“不对劲”一样。
他们的发现
研究人员在不同类型的问题(事实、数学、推理)和不同的人工智能模型上测试了这种方法。以下是他们的发现:
- “中间大脑”是关键: 告诉我们答案真假的那些信号,主要存在于人工智能大脑的中间层。开头和结尾的层对于这项特定任务帮助较小。
- 事实是触发器: 当人工智能谈论事实——特别是人名、日期和数字时,“摇晃的聚光灯”信号最强。如果人工智能只是在闲聊“的”或“和”(停用词),信号是微弱的。但当它试图命名一个人或一年时,如果它不确定,信号就会尖叫。
- 这是一项团队工作: 信号并非来自单个“测谎”神经元。它是人工智能许多不同部分协同工作的合唱。如果你移除其中一部分,系统仍然有效;但如果你移除整个中间部分,检测器就会失明。
结论
这篇论文表明,我们可以通过倾听人工智能内部的“聚光灯”来捕捉其幻觉,而不仅仅是评判其最终的话语。这就像检查学生是在真正思考答案还是在猜测,方法是观察他们的眼睛在哪里游移,而不是等待看他们是否答对题目。
这种方法快速、廉价,并且适用于多种类型的问题,提供了一种“白盒”窗口来洞察人工智能的自信程度,而无需多次运行它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。