Same Attention, Different Truths: Put Logit-Lens over Visual Attention to Detect and Mitigate LVLM Object Hallucination
本文揭示了大型视觉语言模型(LVLM)的对象幻觉并非源于视觉注意力的薄弱,而是源于注意力语义的不对齐,并据此提出了一种无需训练的框架,该框架利用 Logit-Lens 一致性检查来区分视觉不确定性与上下文先验,从而通过应用针对性的掩码或增强解码来有效地检测并缓解幻觉。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在和一个超级聪明的机器人朋友聊天,它见过数百万张图片,读过数十亿本书。你给它看一张阳光明媚的公园照片,它开始描述这个场景。但有时,这个机器人会变得有点过于“放飞自我”。它可能会自信满满地告诉你,树木上方漂浮着一个“巨大的红气球”,尽管照片里那个位置空空如也。这被称为“幻觉”(hallucination),是构建这些人工智能系统的科学家们面临的一个大难题。如果机器人看到不存在的东西,我们就无法在重要任务中信任它。
长期以来,研究人员一直认为问题在于机器人“看”得不够仔细。他们认为 AI 产生幻觉是因为它的视线在游离,所以他们试图强迫它更多地关注图像。但如果机器人其实是在“看”呢?如果它正盯着那个假气球应该在的位置死死盯着,只是误解了它所看到的东西呢?这篇题为《同样的注意力,不同的真相》(Same Attention, Different Truths)的论文,正是深入探讨了这个谜团。它使用了一种被称为“Logit Lens”的巧妙技巧(把它想象成机器人的大脑 X 光机)来窥视 AI 在说话时的内心世界。其目标是弄清楚为什么机器人会对所见之物撒谎,以便我们能教它说真话,而无需从头开始重新训练它。
谜团:盯着看,却看错了
作者首先测试了一个流行的观点:即 AI 的幻觉发生是因为模型没有给予足够的注意力。他们观察了 AI 描述图片的过程,追踪了它的“目光”(注意力)究竟落在了哪里。他们发现了一些令人惊讶的结果:AI 对真实物体(如椅子)的注意力,与对虚假物体(如并不存在的碗)的注意力竟然是一样多的。
这就像一个侦探正全神贯注地盯着一面白墙,坚信那里隐藏着秘密信息。侦探并不是在忽视那面墙;他正盯着它看呢!问题不在于看没看,而在于他看到了什么。论文称之为“同样的注意力,不同的真相”。AI 正在投入精力,但它所看到的与它所说的之间的联系断裂了。
X 光机:读取 AI 的思想
为了理解到底发生了什么,研究人员使用了一个名为 Logit Lens 的工具。把 AI 的大脑想象成一个多层的蛋糕。当 AI 处理图像时,信息会在这些层之间传递。Logit Lens 让研究人员可以窥视不同层级中的“夹心”,并询问:“如果我们现在停止 AI 的处理,它会说出哪个词?”
通过这种方式,他们发现了一个明显的区别:
- 真实物体: 当 AI 看着一把真实的椅子时,它大脑中的“夹心”正确地将图像解码为“椅子”。视觉证据与单词是匹配的。
- 虚假物体: 当 AI 盯着一片模糊的地面,并决定称其为“碗”时,Logit Lens 显示,它的脑子其实并没有看到一个碗。视觉证据是混乱且不确定的,但 AI 却坚持要说出“碗”。
两种类型的“骗子”
论文发现,AI 撒谎的原因有两种截然不同的原因,就像两种完全不同的考试学生一样。
1. “视力模糊”型骗子(视觉不确定性)
有时,图像本身就很令人困惑。也许那里有一个黑乎乎、模糊的形状,看起来有点像个碗。AI 盯着这个模糊的点,感到困惑,然后猜道:“我打赌那是碗!”
- 解决方法: 研究人员发现,如果他们简单地遮盖(掩蔽)掉这个模糊、令人困惑的点,AI 就不再撒谎了。它意识到:“噢,我看不清那里,所以我不会瞎猜。”这被称为 高注意力区域掩蔽(HARM)。这就像告诉侦探:“别盯着那面模糊的墙了,去看那扇清晰的窗户吧。”
2. “白日梦”型骗子(上下文先验)
还有时候,图像很清晰,但 AI 太容易受到它“预期看到什么”的影响了。想象一下,AI 正在描述一个厨房。即使图片里并没有微波炉,AI 也可能会说:“那里有一个微波炉”,因为在它的训练数据中,厨房通常都有微波炉。它太习惯于“微波炉”这个概念了,以至于凭空想象出了一个。
- 反转: 如果你遮住 AI 正在看的那个部分,它并不会停止撒谎!它只会转移视线到另一个地方,然后继续说“微波炉”。AI 正在遵循一个剧本:“在说‘微波炉’之前,我必须盯着某个东西看。”
- 解决方法: 对于这类情况,研究人员使用了名为 视觉证据增强解码(VEED) 的方法。他们强迫 AI 更多地关注它已经发现的 实际 视觉证据(在这种情况下,证据并未显示有微波炉),并利用这些证据来覆盖掉它的白日梦。这就像提醒侦探:“再检查一下你的笔记;笔记上说这里没有微波炉,所以别再瞎猜了。”
解决方案:侦探的工具箱
基于这些发现,作者构建了一个简单的、“无需训练”的工具包。这意味着他们不需要从头开始重新教 AI,而只是在 AI 给出最终答案之前增加了一个智能检查步骤。
- 体检: 在 AI 生成句子的过程中,系统使用 Logit Lens 进行检查:“这张图片真的支持这个词吗?”如果答案是否定的,系统就会将该词标记为幻觉。
- 诊断: 然后它会判断 AI 为什么要撒谎。是因为图像太模糊(类型 1),还是因为 AI 在做白日梦(类型 2)?
- 治疗:
- 如果是 类型 1,它会掩蔽掉模糊的部分,并要求 AI 再试一次。
- 如果是 类型 2,它会增强真实视觉信号的强度,从而淹没掉白日梦。
结果
团队在多个不同的 AI 模型上测试了这种方法,发现它效果极佳。它减少了 AI 虚构假物体的数量,比他们测试过的任何其他方法都要出色,同时又不会让 AI 忘记提到真实的物体。
简而言之,这篇论文表明,AI 幻觉不仅仅是因为机器人看得不够仔细。有时,它确实盯着问题看,但误解了一个模糊的线索;有时,它只是太急于遵循一个它听过的故事。通过理解这两种不同的“谎言”,研究人员找到了捕捉并修复它们的方法,让我们的机器人朋友变得更诚实,也更可靠。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。