Where Does Vision Meet Language? Understanding and Refining Visual Fusion in MLLMs via Contrastive Attention
本文通过系统的逐层分析,研究了多模态大语言模型中视觉-文本融合的内部机制,揭示了融合发生在具有独特“回顾”现象的特定层,并利用这些见解提出了一个无需训练的对比注意力框架,以增强多模态推理性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个计算机可以同时看图并阅读的世界。这些被称为多模态大语言模型(MLLMs)。把它们想象成超级聪明的学生,他们不仅读遍了图书馆里的每一本书,还拥有一双能观察图片的眼睛。但这里有一个谜题:当这些学生看着一张照片并读到一个关于它的问题时,他们是如何在脑海中将图片与文字融合在一起的呢?他们是同时观察整张图片吗?还是先读文字然后再瞥一眼图片?或者做了别的什么?
长期以来,我们知道这些模型能给出很棒的答案,但我们并不清楚它们在“大脑”(由计算机代码层组成)内部究竟是如何运作的。这就像是在没有看到魔术表演过程的情况下,只看着魔术师从帽子里变出一只兔子。理解这个过程至关重要,因为如果我们不知道它们是如何工作的,我们就无法在它们分心或编造事实时修复它们。这篇论文就像是一个侦探故事,作者们试图窥视魔术师的帽子,看看那只兔子是如何逐层出现的。
侦探工作:窥视模型的“大脑”
论文的作者决定通过一场与计算机大脑的“捉迷藏”游戏,来找出魔术发生的位置。他们选取了几种不同的多模态大语言模型,并开始逐层关闭它们大脑的一部分,以观察会发生什么。想象一下工厂的流水线,机器人正在组装一个玩具。如果你在第3步停止机器人,玩具就会散架;如果你在第20步停止,也许玩具已经完成了。通过在不同层级对视觉信息进行“掩码”(或关闭)处理,研究人员可以准确观察到计算机在何时停止观察图片并开始仅依赖文本。
重大发现:它并非平滑的过渡
他们最令人惊讶的发现是,计算机并不会从头到尾均匀地混合图片和文字。这不像把牛奶倒入咖啡中那样缓慢融合。相反,这种混合发生在流水线上特定的、关键的“工作站”上。
- 关键区域: 他们发现,对于大多数模型来说,真正的混合发生在早期到中间的层级(大约在第18到20层)。如果你在这一区域之前切断图片信息,计算机就会忘记关于图像的一切并导致测试失败。
- “复习”现象: 这里有个有趣的地方。在某些模型(如 LLaVA-1.5 和 LLaVA-Next)中,在计算机认为自己完成混合后,它竟然突然又回头看了一眼图片!作者称之为“复习”阶段。这就像一个学生写完试卷,放下笔,然后突然想起:“等等,我需要再检查一下图表!”然后才交卷。
问题所在:计算机被分心了
在调查过程中,作者注意到一个奇怪的故障。即使计算机正在观察图像的正确部分(比如飞机上的标志),它也在盯着图片中完全没用的部分(比如天空或飞机的尾部)看。他们称之为“高注意力噪声”。
想象一下,你正在尝试阅读一个写着“LAPE”的飞机标志。你的眼睛应该聚焦在字母上。但这个计算机却一直被飞机背后的云朵吸引,给云朵的关注度竟然和字母一样高。这种情况从一开始就存在,并且一直持续下去,让模型感到困惑。
解决方案:无需重新训练的“荧光笔”
为了解决这种分心问题,作者发明了一个聪明的技巧,不需要重新教导计算机(这既昂贵又缓慢)。他们称之为对比注意力(Contrastive Attention)。
其工作原理如下,使用一个简单的比喻:
- “之前”快照: 他们拍摄一张计算机在过程早期(即刚开始观察图像时)所看内容的“照片”。在这个阶段,计算机在看所有东西,包括那些令人分心的云朵。
- “之后”快照: 他们拍摄一张计算机在过程最后阶段(即准备好回答问题时)所看内容的“照片”。在这个阶段,它应该在看那些字母。
- 差异: 他们用“之后”的照片减去“之前”的照片。
- 如果计算机在两张照片中都在看云朵,那么云朵就会抵消掉(因为注意力没有变化)。
- 如果计算机在“之后”的照片中开始看字母,但在“之前”的照片中忽略了它们,那么字母就会鲜明地凸显出来!
这种差异创造了一个“荧光笔”,展示了计算机因为这个问题而学会去关注哪些部分。作者随后利用这个“荧光笔”切掉图像中令人分心的部分,并将只有重要的、被高亮的部分重新喂回给计算机进行第二次尝试。
结果
当他们测试这种新方法时,计算机的表现变得更好。它们不需要重新训练,只需要一点点小小的引导来忽略噪声。
- 在 GQA 数据集上,他们的方法将分数从 66.03 提升到了 69.40。
- 在 VQAv2 上,从 74.06 提升到了 77.59。
- 在 TextVQA 上,从 57.21 跳升到了 59.86。
这些数字表明,通过简单地帮助计算机专注于正确的事物并忽略“噪声”(即分心的云朵),它可以更好地理解世界。作者认为,这种方法之所以有效,是因为它捕捉到了计算机注意力从“观察一切”转向“观察重点”的那一瞬间。
他们排除了什么
作者还明确指出,这不仅仅是关于选择一个随机层级来观察。他们测试了在没有规则的情况下选择过程末尾或开端的层级,发现效果并不理想。那个“甜点位(sweet spot)”专门位于视觉和文本信息刚刚开始混合但尚未完全定型的层级。他们还展示了这并非一次性的修复;它适用于许多不同类型的模型和许多不同种类的问题。
简而言之,这篇论文告诉我们,这些超级聪明的计算机拥有一个特定的“混合区”,在那里它们结合视觉和听觉(视觉与文本),而且它们有时会被背景噪声干扰。通过使用一个简单的数学技巧来突出注意力的变化,我们可以帮助它们忽略噪声并给出更好的答案,而无需花费数年时间去教它们新的课程。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。