← 最新论文
💻 computer science

Tell Model Where to Look: Mitigating Hallucinations in MLLMs by Vision-Guided Attention

该论文提出了一种名为“视觉引导注意力(VGA)”的免训练方法,通过利用视觉令牌的语义内容构建精确的视觉定位并动态引导模型关注相关区域,从而在几乎不增加延迟的情况下显著提升了多模态大语言模型的幻觉抑制能力。

原作者: Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

发布于 2026-03-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Jianfei Zhao, Feng Zhang, Xin Sun, Chong Feng, Zhixing Tan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文提出了一种名为 VGA (Vision-Guided Attention,视觉引导注意力) 的新方法,旨在解决多模态大语言模型(MLLMs)中一个令人头疼的问题:“幻觉”

简单来说,就是让 AI 看图说话时,不再“瞎编乱造”,而是真正“看图说话”。

我们可以用几个生动的比喻来理解这篇论文的核心思想:

1. 核心问题:AI 是个“心不在焉”的画家

想象一下,你给一个画家(AI)看一张照片,让他描述照片里有什么。

  • 现状:这个画家其实看得挺清楚,照片里的细节他都“看”到了(提取了视觉特征)。但是,当他开始动笔(生成文字)时,他的注意力经常飘忽不定。他可能盯着照片的一角发呆,或者把背景里的树误认为是前景的猫。
  • 结果:他画出来的东西(生成的文字)经常和照片对不上号,比如照片里明明没有杯子,他却说“桌上有个红色的杯子”。这就是幻觉

以前的方法就像是在强迫画家“多背几本画册”或者“重新培训他”,这既费时又费力。而这篇论文的方法,是教画家在画画时“知道该往哪里看”

2. 核心发现:AI 其实心里“有数” (VSC)

研究人员发现了一个有趣的现象:虽然 AI 在说话时容易走神,但在它“思考”的底层逻辑里,其实已经精准地知道照片里哪些部分重要。

  • 比喻:这就好比一个学生考试,虽然他在写答案时可能写错了,但他脑子里的“草稿纸”上其实已经算出了正确答案。
  • 技术术语:作者把这个能力称为 VSC (视觉语义置信度)。AI 在生成每一个字之前,其实已经通过一种内部机制,给照片里的每个像素点打上了“重要性标签”。比如,看到“杯子”这个词,AI 心里其实已经知道照片里哪个区域是杯子,哪个区域是背景。

3. 解决方案:给 AI 戴上一副“智能眼镜” (VGA)

既然 AI 心里知道哪里重要,那为什么它还会看错呢?因为它的“注意力机制”(也就是它看图的焦点)没有跟这个“心里知道”的信息对齐。

VGA 方法就是给 AI 戴上一副“智能眼镜”:

  1. 第一步:先“摸底”
    在 AI 开始说话之前,先利用它自己脑子里的“草稿纸”(VSC),快速扫描一遍照片,找出哪里是重点(比如:这里有只猫,那里有棵树)。
  2. 第二步:强行“聚焦”
    利用刚才找到的重点,强行调整 AI 的视线。如果 AI 想盯着背景看,这副眼镜就会把它的眼球强行拉回到那只猫身上。
  3. 第三步:动态“更新” (针对描述长图)
    如果是让 AI 描述整张图(比如写一段长故事),这副眼镜还会动态工作
    • 比喻:当 AI 已经描述了“猫”之后,眼镜就会自动把“猫”的区域变暗(抑制),强迫 AI 把目光移向还没描述的“树”或“房子”。这样 AI 就不会反复念叨“猫”,也不会漏掉其他东西。

4. 为什么这个方法很厉害?

  • 不用重新训练 (Training-Free)
    以前的方法可能需要给 AI 重新上课(重新训练),就像给画家报个昂贵的培训班。而 VGA 不需要,它就像给画家递了一张“重点提示卡”,即插即用
  • 速度极快 (Single Forward Pass)
    很多方法需要 AI 把图看两遍(一遍找重点,一遍说话),这很慢。VGA 只需要看一遍,在看的瞬间就把重点找出来并调整视线,几乎没有延迟
  • 兼容性强
    它不破坏 AI 原本的计算方式,甚至能配合目前最快的计算技术(FlashAttention)一起工作。

5. 实验效果:真的管用吗?

作者在多个测试集上做了实验:

  • 在“找茬”测试中 (POPE):AI 以前经常把没有的东西说有,现在准确率大幅提升。
  • 在“看图说话”测试中 (CHAIR/AMBER):AI 编造细节的情况大幅减少,描述更加准确、全面。

总结

这篇论文的核心思想就是:不要试图改变 AI 的“大脑”(重新训练),而是优化它的“眼睛”(注意力机制)。

通过利用 AI 自身已经具备的“潜意识”(VSC),引导它把目光聚焦在真正重要的地方,并动态调整关注点,从而让 AI 从“瞎编乱造”变成“实事求是”。这就像给一个有点走神的学生戴上了一副智能眼镜,让他能真正看清黑板上的内容,从而考出好成绩。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →