← 最新论文
💻 computer science

Direct Visual Grounding by Directing Attention of Visual Tokens

本文提出了一种新颖的 KL 注意力损失(KLAL),该损失直接监督视觉标记对相关语言标记的注意力,从而通过解决标准下文标记预测所提供的注意力信号不足的问题,提升视觉定位任务的性能。

原作者: Parsa Esmaeilkhani, Longin Jan Latecki

发布于 2026-08-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Parsa Esmaeilkhani, Longin Jan Latecki

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个这样的世界:计算机可以观察一张图片并对其进行描述,就像你我通过手机聊天讨论照片一样。这就是**视觉-语言模型(Vision-Language Models, VLMs)**的领域——这是人工智能的一个分支,试图弥合相机所见与人类所言之间的鸿沟。可以将这些模型想象成超级聪明的翻译官,它们接收一张图像,将其分解为被称为“视觉标记(visual tokens)”的微小数字拼图碎片,并将它们与文字混合在一起,以回答诸如“这只猫是什么颜色的?”或“那里有几个苹果?”之类的问题。

长期以来,科学家们一直认为这些模型在这方面已经做得非常出色了。但有一个挥之不去的谜团:有时,即使答案是正确的,计算机似乎也完全忽略了图片。这就像一个正在参加考试的学生,在读完题目后,瞥了一眼图表,然后完全根据记忆中的教科书内容来作答,完全忘记了去看眼前的具体线条和形状。研究人员面临的核心问题是:为什么在给出最终答案时,计算机的“大脑”停止关注视觉线索了? 本论文深入探讨了这一问题,试图弄清楚我们是否可以教会这些 AI 模型在说话时真正地“注视”图像中正确的部位。


问题所在:机器中的“幽灵”

来认识一下视觉-语言模型。你可以把它看作一个读过百万本书、看过百万张照片的、非常爱聊天的机器人。当你针对一张图像提问时,它会将图像分解成一个由微小方块组成的网格(视觉标记),并将它们与你输入的文字混合在一起。

诡异之处在于:论文发现,在思考的最后时刻,也就是机器人准备打出答案之前,它往往会停止观察图片。这就像一位厨师,桌上摆满了所有的食材,但在装盘的时候,却决定忽略食物,仅仅根据记忆中的食谱来猜测味道。研究人员发现,计算机对图像中最重要部分(例如两条线的交点或某个特定物体)的“注意力”几乎为零。就好像视觉线索成了幽灵——它们存在于系统中,但对于负责写出答案的那部分大脑来说却是不可见的。

论文指出,这些模型的标准训练方式(称为“下一标记预测/Next-Token Prediction”)就像是一位只看最终作文成绩、却从不检查学生是否真的看了参考图片的老师。计算机学会了如何正确猜测下一个词,但它并没有学会为什么这个词是正确的,也没有学会是图像中的哪一部分使其变得正确。

解决方案:注意力的“激光笔”

为了解决这个问题,作者提出了一种巧妙的新型训练技巧,称为 KL 注意力损失(KL Attention Loss, KLAL)

想象一下你正在教一只狗去捡球。在旧的方法中,当它把球叼回来时,你只会说“好狗!”,但狗可能只是在随机乱跑时碰巧抓住了球。而在本文提出的新方法中,你使用了一个激光笔。每当狗看向球时,你就用光点照向它,并说:“没错!看那里!”

在计算机世界里,“激光笔”是一个特殊的数学信号,它强制模型将注意力集中在对答案至关重要的图像像素上。

  • 如果问题是“这些线交叉了几次?”,激光笔就会照在两条线相交的确切位置。
  • 如果问题是“这个节点是否与那个节点相连?”,激光笔就会追踪连接它们的线条路径。

如果模型看向了别处,它就会受到惩罚(通过损失函数)。这就像是在告诉机器人:“你不能仅仅靠猜,你必须证明你在看图片的正确位置。”

研究发现:从猜测到观察

研究人员在一些需要精确视觉推理的棘手任务上测试了这个想法,例如计算两条弯曲线条交叉了几次,或者追踪复杂图表中的路径以观察两点是否相连。他们甚至设计了一个名为“线条追踪(Line Tracing)”的新游戏,要求计算机穿过一个由点组成的迷宫。

以下是当他们开启“激光笔”(KLAL)时发生的情况:

  1. 更好的答案: 模型的表现有了显著提升。例如,在“线条交点(Line Intersection)”任务中,通过加入这种新的训练方法,一个模型的准确率从约 47% 提升到了 70% 以上。在“指向(Pointing)”任务(即模型必须准确说明某个物体所在位置)中,提升幅度巨大,从接近随机猜测提升到了近一半的正确率。
  2. 更强的专注力: 最令人兴奋的部分不仅是分数,还有模型的“思考方式”。当研究人员观察模型的“注意力图”(显示计算机正在看哪里)时,他们看到了剧烈的变化。在采用新训练法之前,模型在观察图像的随机部分;而在训练之后,模型的注意力紧紧锁定在交点或特定物体上,就像人类观察那样。
  3. 更强的记忆力: 论文还发现,这种训练不仅改变了模型的观察位置,还实际上增强了它对图像的内部记忆。重要图像部分的数字“权重”变得更重、更清晰,这意味着模型真正更好地“理解”了视觉数据,而不仅仅是理解了文字。

结论

论文表明,这些 AI 模型有时在简单视觉任务上失败的原因,并不是因为它们不够聪明,而是因为没有被教会如何正确地“观察”。通过在训练期间添加直接的“激光笔”信号,研究人员迫使模型将其语言直接与所代表的像素联系起来。

结果显示,这种方法适用于各种类型的模型,从开源模型到一些最大的商业 AI 系统。即使是最先进的商业模型,在应用此方法之前,在处理这些特定的几何任务时也表现挣扎。作者总结道,如果我们希望 AI 真正理解世界,我们不能只让它去猜,我们必须教会它关注正确的事物,就像老师引导学生的眼睛看向图表的正确部分一样。

简而言之,论文证明了,当你强迫 AI 在开口说话前先观察证据时,它就不再是胡编乱造,而是开始真正地观察。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →