← 最新论文
💬 NLP

Hallucination Detection in LLMs with Topological Divergence on Attention Graphs

本文介绍了TOHA,一种基于拓扑结构的检索增强生成系统幻觉检测器,它通过测量提示词与响应注意力图之间的拓扑发散度来识别事实性错误输出,并以最少的数据和计算资源实现了最先进的性能。

原作者: Alexandra Bazarova, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Andrei Volodichev, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Baran
发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexandra Bazarova, Aleksandr Yugay, Andrey Shulga, Alina Ermilova, Andrei Volodichev, Konstantin Polev, Julia Belikova, Rauf Parchiev, Dmitry Simakov, Maxim Savchenko, Andrey Savchenko, Serguei Barannikov, Alexey Zaytsev

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个大语言模型(LLM)是一位才华横溢但有时过于自信的故事讲述者。当你向它提问时,它并非仅仅用文字“思考”;它会审视一个巨大而不可见的网络,这个网络连接着它曾见过的每一个词以及它即将说出的每一个词。这个网络被称为注意力图

这篇论文介绍了一种名为TOHA(基于拓扑的幻觉检测器)的新工具,用于在该故事讲述者开始编造内容(产生幻觉)时将其识破。以下是其工作原理的简明解释:

1. 故事讲述者的网络(注意力图)

将 LLM 的注意力图想象成一张城市地图。

  • 提示(你的问题): 这些是地图左侧的建筑物。
  • 响应(答案): 这些是在地图右侧正在建造的新建筑物。
  • 连线: 连接建筑物的线条展示了模型在撰写某个词时“关注”另一个词的程度。如果模型在陈述事实,新建筑物(答案)应与旧建筑物(你问题中的事实)紧密相连。

2. “幻觉”问题

当模型产生幻觉时,它开始构建那些与原始城市连接不佳的新结构。这就像模型正在画一座桥,连接到你问题中根本不存在的建筑物。

  • 真实的答案: 新建筑物通过坚固、短小的桥梁与旧建筑物相连。
  • 幻觉的答案: 新建筑物悬浮在空中,或者通过非常长、脆弱甚至不存在的桥梁相连。

3. TOHA 侦探(拓扑发散)

TOHA 是一位测量这些连接形状的侦探。它使用一个名为“拓扑发散”的数学概念。

  • 类比: 想象你有一堆石头(你问题中的词),你正试图在它们旁边建造一堆新石头(答案)。
    • 如果你是在进行忠实的复制,你会用短绳子将新石头系在旧石头上。所需的绳子总长度很短。
    • 如果你是在编造内容,你的新石头会相距甚远或悬浮在空中。要将它们连接到旧石堆,你需要非常长、昂贵且不必要的绳子。
  • 评分: TOHA 计算这些“绳子”的总长度(在数学上,即最小生成森林的长度)。
    • 绳子总长度短 = 答案基于事实(低幻觉得分)。
    • 绳子总长度长 = 答案偏离了事实(高幻觉得分)。

4. “特殊眼睛”(幻觉感知头)

LLM 拥有许多“头”(大脑中观察文本的不同部分)。论文发现,并非所有的头在识破谎言方面都同样出色。

  • 有些头像复印机。如果它们感到困惑,往往会看向句子的第一个词。
  • 研究人员发现,特定的“头”在模型撒谎时,无论话题如何,始终表现出很长的绳子长度(高发散度)。
  • TOHA 并不检查整个大脑;它只询问这几只“特殊眼睛”的意见。如果它们说:“嘿,这些连接太长了”,TOHA 就会将其标记为幻觉。

5. 为何这很重要

  • 无需额外训练: 与其他需要成千上万个“谎言”示例来学习如何识破它们的方法不同,TOHA 是“免训练”的。它只需实时观察连接的数学特性。
  • 超快速: 其他方法通常要求模型讲述故事 10 次或 20 次,以查看答案是否一致(就像要求证人重复他们的故事)。TOHA 只需查看故事一次。它的速度比这些较慢的方法快高达 70 倍。
  • 普适性强: 研究人员在不同模型(如 Llama 和 Mistral)和不同任务(回答问题、新闻摘要)上测试了它。即使模型谈论完全不同的主题,它也能保持一致的良好表现。

总结

TOHA 就像 AI 故事的质量控制检查员。它不是通过阅读故事来核查事实,而是查看蓝图(注意力图)。如果蓝图显示故事的新部分悬浮在原始事实的远处,TOHA 就会拉响红旗。它这样做既快速、经济,又无需背诵一本谎言词典。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →