← 最新论文
💻 computer science

Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation

该论文提出了 GIFT,一种视线转移引导的跨模态融合方法,通过基于正向注意力变化动态增强对显著视觉区域和用户查询的注意力,从而减轻视觉注意力汇聚并提升性能,且具有较低的计算开销,以此缓解视觉语言模型的幻觉问题。

原作者: Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

发布于 2026-06-01
📖 1 分钟阅读☕ 轻松阅读

原作者: Zheng Qi, Chao Shang, Evangelia Spiliopoulou, Nikolaos Pappas

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是对论文 "Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation"(简称 GIFT)的解释,采用了通俗易懂的语言和富有创意的类比。

问题所在:“白日梦” AI

想象你有一个非常聪明、博学多才的助手,但他特别喜欢讲故事。你给他看一张猫坐在垫子上的照片,并问他:“这只猫在做什么?”

因为这位助手读过数百万本关于猫的书,他可能会自信满满地说:“这只猫正在追逐一只红色的老鼠!”尽管照片里根本没有老鼠。这就是他在产生幻觉(Hallucinating)。他过度依赖于他“认为”应该存在的东西(他的“先验知识”),而不是仔细观察实际存在的视觉输入。

目前的方法试图通过告诉 AI “看仔细点!”来修复这个问题。但该论文指出这些方法有两个缺陷:

  1. 他们看错了地方: 有时 AI 会被背景噪声(比如模糊的墙壁)分散注意力,而不是盯着猫看。这被称为**“视觉注意力汇聚”(Visual Attention Sink)**。这就像一个学生盯着教科书上的一个污点,而不是在看数学题。
  2. 他们忘了问题: 如果你只是告诉 AI “看这张图片!”,而不提醒他们“要看什么”,他们可能会感到困惑。他们需要在观察图像与理解你的具体问题之间取得平衡。

解决方案:GIFT(“视线转移”追踪器)

作者提出了一种名为 GIFT(Gaze Shift-Guided Cross-modal Fusion Enhancement,视线转移引导的跨模态融合增强)的新方法。

要理解 GIFT,请想象一名人类侦探在阅读证人陈述的同时,正在观察犯罪现场的照片。

  • 旧方法(静态视线): 侦探对整张照片拍个快照,然后取其注意力的平均值。他可能会因为照片角落里的一把随机椅子而分心,仅仅因为它位于照片中央。
  • GIFT 的方式(视线转移): 侦探逐字逐句地阅读证人陈述。
    • 当听到**“红色”*这个词时,他的眼睛会跳跃*(转移)到那个红色的消防栓上。
    • 当听到**“狗”*这个词时,他的眼睛会跳跃*到狗身上。
    • 当听到无关紧要的词(如“的”或“和”)时,他的眼睛几乎不动。

GIFT 为 AI 做了同样的事情。它观察 AI 的“眼睛”(注意力)在阅读用户问题时是如何移动的。它忽略那些 AI 视线保持稳定或漫无目的漂移的部分。它只关注那些当特定单词触发了对图像新部分的关注时,AI 视线发生正向转移的时刻。

它是如何工作的(三个步骤)

1. 映射“视线转移”(预计算)
在 AI 开始生成答案之前,GIFT 会进行一次快速模拟。它会问:“当 AI 在你的问题中读到‘摩托车’这个词时,它的眼睛会跳向图像的哪个部分?”
它会创建一个显著性图(Saliency Map)(即热力图)。

  • 神奇之处: 因为它只追踪变化(转移),所以它自然地忽略了“视觉注意力汇聚”(背景噪声)。如果 AI 在阅读问题时视线没有移动到某个位置,那么那个位置就不会出现在热力图上。这就像是通过过滤掉收音机里的静电噪音来清晰地听音乐。

2. 引导答案生成(解码)
现在,AI 开始生成答案。GIFT 使用那张热力图来引导这个过程:

  • 增强视觉信息: 如果热力图显示“摩托车很重要”,GIFT 就会调高 AI 对图像中摩托车部分的注意力“音量”。
  • 增强问题信息: 至关重要的是,Gлот GIFT 也会调高问题本身的“音量”。它确保 AI 不会因为过于痴迷于图像而忘记了你问了什么。它让对话保持平衡。

3. 结果
现在的 AI 就像一名既能完美聚焦于相关线索,又能牢记确切问题的侦探。它极少会凭空捏造一个并不存在的“红色老鼠”。

结果:更快、更聪明

论文在多个 AI 模型(如 LLaVA 和 Qwen)上测试了该方法,发现:

  • 减少幻觉: AI 编造虚假物体的次数减少了。在某些测试中,准确率提升了超过 20%
  • 保持智能: 它并没有丧失推理能力或回答一般性问题的能力。它并没有变成一个“笨拙”的图像识别器;它只是变成了一个更诚实的识别器。
  • 速度快: 它几乎没有减慢 AI 的速度。与那些可能慢 10 倍的其他方法相比,它仅增加了约 13% 的生成时间,效率非常高。

总结类比

把 AI 想象成博物馆里的导游

  • 问题: 导游知道太多的历史知识,以至于当你询问一幅画作时,他们开始背诵他们以为你想问的另一幅画的细节,或者编造关于画框的细节。
  • 旧的修复方法: “看那幅画!”(但导游却一直盯着地板或天花板看)。
  • GIFT 的修复方法: 导游戴上了一副特殊的眼镜。当你提到“蓝色花瓶”时,眼镜会瞬间高亮显示他们视野中的蓝色花瓶,并调暗周围房间的亮度。同时,眼镜还会提醒导游:“别忘了,客人问的是蓝色花瓶,不是红色的那个。”

通过追踪导游的注意力在听到你的话语时究竟往哪里移动,GIFT 确保他们描述的是眼前真实存在的东西,而不是信口开河。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →