Seeing is Understanding: Unlocking Causal Attention into Modality-Mutual Attention for Multimodal LLMs
本文提出了模态互注意力(MMA),这是一种无需参数的架构改进,用于替换多模态大语言模型中的因果注意力机制,使图像标记能够关注文本标记,从而解决视觉 - 语言不对齐问题,并在 12 项基准测试中实现最先进性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是论文《看见即理解:将因果注意力解锁为模态互注意力以赋能多模态大语言模型》的通俗解释,辅以日常类比。
问题:AI 大脑中的“单行道”
想象一个多模态大语言模型(MLLM)是一位非常聪明的助手,既能看图又能读文。目前,大多数这类助手被构建得像一条单行道。
当你让助手回答关于照片的问题时,标准流程是:
- 照片首先展示。
- 问题随后读取。
- 答案最后生成。
该论文指出了这种设置的一个主要缺陷:由于 AI 的“大脑”(特别是其注意力机制)的设计方式,照片只能看到在它之前出现的内容。既然照片排在第一位,它就无法回看后面的“问题”。这就像一名保安只被允许查看进入大楼的人,却被禁止查看墙上写着“禁止入内”的标牌。
由于 AI 的“照片”部分无法读取“问题”部分,它经常猜错。例如,它可能在图片中看到一辆车,就说“那是一辆红色的法拉利”,即使用户问的是“那是一辆红色的法拉利吗?”,而车实际上是蓝色的。AI 会产生幻觉(编造内容),因为大脑中的图像部分对文本中的具体指令是“视而不见”的。
旧方案:倒车行驶
在这篇论文之前,研究人员尝试通过两种不同的方式训练 AI 来修复这个问题:
- 标准方式:先展示照片,再展示问题。
- 反向方式:先展示问题,再展示照片。
这就像教司机先练习向前开,再练习倒车,以确保他们理解路况。虽然这有所帮助,但代价高昂且缓慢。这基本上使训练 AI 所需的时间和金钱翻了一倍。
新方案:“双行道”(MMA)
作者提出了一种巧妙而简单的修复方案,称为模态互注意力(MMA)。
与其让 AI 倒车,他们只是解锁了 AI 大脑中的交通灯。
- 旧方式(因果注意力):“图像”令牌就像坐在前排的学生。它只能看到老师的黑板(前面的令牌)。它不能转身去看后排学生(“文本”令牌)在写什么。
- 新方式(MMA):作者改变了规则,允许前排学生转身阅读后排学生在写的内容。
通过解锁这条特定路径,AI 的“图像”部分现在可以读取“问题”部分。它在尝试描述图片之前,就能确切地看到你问的是什么。
为何这很重要
- 无额外成本:他们没有给 AI 添加新部件或使其变大。他们只是改变了一个小设置(即阻挡信息的“掩码”)。这就像重新布置房间里的家具,而不是建造一栋新房子。
- 更高的准确性:因为图像现在可以“看到”问题,AI 不再靠猜测。在他们的测试中,AI 在回答关于特定物体的问题、计数以及理解空间关系(例如“猫是在左边还是右边?”)方面变得更好。
- 减少幻觉:AI 编造不存在细节的错误减少了。
结果
研究人员在 12 项涉及图像和文本的不同测试中测试了这种新的“双行道”设计。他们使用了三种不同类型的 AI 大脑(骨干网络)来证明其具有普遍适用性。
- 结果:新方法击败了旧的标准方法,甚至击败了其他复杂的、最先进的方法。
- 提升:平均而言,在所有测试中,AI 在理解图像和文本方面的表现提高了约6.2%。
- 效率:这是在未增加任何额外“脑力”(参数)或不需要双倍训练时间的情况下实现的。
总结类比
把旧的 AI 想象成一位蒙着眼的艺术家,有人递给他一张照片,然后让他画出来。艺术家在画画时看不到照片;他必须先记住它。如果你随后低声给出具体指令(“画红色的车,不要画蓝色的”),艺术家听不到,因为他们已经在画画了。
新的 AI(MMA)就像一位摘下眼罩的艺术家,可以在聆听你指令的同时看着照片。他们可以实时调整画作,以完全符合你的要求,从而得到一幅准确得多的图画。
该论文得出结论:通过简单地允许 AI 的图像部分“看见”文本部分,我们可以显著提高这些模型理解世界的能力,同时无需增加其复杂性或训练成本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。