Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
本文提出了显著性驱动的感知重对齐(Saliency-Driven Perceptual Realignment, SDPR),这是一个无需训练的框架,通过重新分配非语义标记的注意力、将 KV 缓存特征对齐以防止空间失真,并应用对比解码来抵消语言先验,从而在无需额外训练或显著运行时开销的情况下,减轻大型视觉语言模型中的幻觉问题,并实现卓越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在快速发展的人工智能领域,新一代系统已经涌现,它们能够同时进行视觉观察与语言表达。这些大型视觉语言模型充当着数字观察者的角色,能够观察一张照片并描述其中正在发生的事情,或者回答有关场景的问题。它们学会了将视觉世界与人类语言相连接,在像素与文字之间架起了一座桥梁。然而,尽管这些系统具有生成流畅且通常合乎逻辑的句子的惊人能力,它们却面临着一个持续存在且令人沮丧的缺陷:它们经常撒谎。它们可能会自信地描述一个人拿着红气球,而图像显示的其实是一个蓝色的风筝,或者凭空捏造出根本不存在的细节。这种产生错误信息的倾向(被称为“幻觉”)源于模型过度依赖其曾经阅读过的内容,而非它此时此刻实际看到的画面。当视觉证据不清晰或复杂时,系统往往会根据其内部的语言模式进行猜测,从而产生听起来正确但事实错误的答案。这种不可靠性阻碍了这些强大的工具在对准确性要求极高的现实场景中获得信任。
西安电子科技大学和清华大学的研究人员已经确定了这种视觉混乱的根源,并开发出一种方法来帮助这些模型在回答之前“看清”。他们的研究表明,问题不仅在于知识的匮取得,更在于模型在思考的瞬间如何处理和记忆它所看到的内容。团队发现,当模型分析图像时,它的注意力经常被不重要的背景细节劫持,导致它忽略了图像中最关键的部分。此外,当模型开始逐字生成回答时,它对视觉场景的记忆会发生退化,变得扭曲且与当前提出的问题脱节。为了解决这个问题,研究人员引入了一个名为“显著性驱动感知重对齐”(Saliency-Driven Perceptual Realignment)的无需训练的框架。这种方法不需要从头开始重新训练庞大的 AI 模型;相反,它在思考过程中充当引导者,温和地纠正模型的焦点和记忆,以确保其始终立足于图像的视觉现实。
纠正过程的第一步解决了模型初次观察图像的时刻。研究人员发现,模型的内部注意力机制经常卡在“汇聚标记”(sink tokens)上,这些本质上是无意义的背景元素,却意外地吸引了过多的关注。想象一下一个人试图在嘈ory的房间里听一场对话;如果他们的注意力被嘈杂且无关的噪音劫持,他们就会错过重要的词汇。同样,模型会让这些背景干扰淹没显著的视觉线索,例如人的脸部或特定的物体。新方法能检测到这种劫持行为发生,并重新分配模型的注意力,将焦点从噪声中拉回并转向图像中有意义的部分。通过这样做,模型找回了此前被忽略的被抑制的视觉证据,使其在开口说话之前就能更准确地观察场景。
一旦模型有了更清晰的视野,第二个挑战便随着它开始生成答案而出现。模型会存储图像的记忆,以便在编写每个新词时进行参考。然而,研究人员观察到,这种记忆会随着时间的推移而变得扭曲。由于模型按照特定的顺序处理图像和问题,视觉细节的记忆会与其在序列中的位置挂钩,而非与其对问题的实际重要性挂钩。这就像模型忘记了某个特定物体很重要,因为它是在序列早期被看到的,而后期一些不重要的细节却在它的记忆中变得过于突出。为了抵消这一现象,新框架重新对齐了这种内部记忆。它注入了一个信号,强调哪些图像部分实际上与当前问题相关,确保模型的记忆在整个生成过程中始终聚焦于正确的视觉证据,而不是漂移向无关的细节。
最后,即使拥有清晰的视野和良好的记忆,模型仍然面临着依赖其既有语言习惯的诱惑。有时,模型根据图片知道答案应该是“是”,但其内部语言模式强烈暗示为“否”,因为那是其训练数据中的常见短语。为了防止这种情况,研究人员增加了一个最终检查,将基于视觉的预测与基于其自身语言习惯构建的参考进行对比。如果两者不一致,系统会主动抑制基于语言的猜测,并强制模型坚持视觉证据。这种对比过程确保了最终答案是由图像中实际存在的内容驱动的,而不是由模型预期的内容驱动。
应用这一三部分策略的结果是显著的。在针对各种不同的大型视觉语言模型进行测试时,该方法一致地减少了幻觉的数量并提高了回答的准确性。在衡量模型正确识别物体的特定测试中,新方法实现了高达近七个百分点的提升;而在衡量幻觉细节频率的测试中,它将错误率降低了三分之一以上。至关重要的是,所有这些成果都是在无需昂贵的重新训练或额外数据的情况下实现的,仅仅是通过调整模型在工作时如何分配注意力和记忆信息。通过系统地解决从最初的一瞥到最终句子的视觉意识退化问题,这项研究提供了一种稳健的方法,使这些强大的 AI 系统更加可靠,确保它们能如实描述所见。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。