Large Vision-Language Models Get Lost in Attention
本文提出了一种统一的信息论与几何框架,以揭示大视觉语言模型中的注意力机制在功能上存在冗余且常被错误分配,因为用预定义值替换学习到的注意力权重即可产生相当甚至更优的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,将大型视觉 - 语言模型(LVLM)比作一位极其精明的艺术画廊策展人,他正试图向访客描述一幅画作。这位策展人有两位主要助手在后台协助他准备描述:
- “重组者”(注意力机制): 这位助手审视画作的所有不同部分以及访客的问题,然后打乱笔记,以找出此刻最重要的部分。
- “发明者”(前馈神经网络 FFN): 这位助手接过那些被打乱的笔记,实际撰写出新的想法,为描述增添全新的词汇和概念。
该论文指出,长期以来,人们一直认为“重组者”在承担繁重的工作,不断扫描画作以寻找最关键的细节。然而,该论文的作者构建了一套新的眼镜(数学框架)来精确观察这些助手在做什么,结果发现了一个令人惊讶的事实:“重组者”实际上在混乱中迷失了方向。
以下是他们研究发现的简要分析,使用了简单的类比:
1. 两位助手的工作截然不同
研究人员发现,这两位助手在做完全不同的事情,几乎像是在说不同的语言:
- “重组者”(注意力机制)是一个“洗牌者”: 它的主要工作是将桌上已有的信息进行混合。它改变了信息的组织方式(重新配置),但很少添加任何全新的内容。这就像一位 DJ 播放同一份歌单;顺序变了,但歌曲本身是一样的。
- “发明者”(FFN)是一个“创造者”: 这位助手才是真正将新想法带到桌面上的人。它扩展了对话的“子空间”,增加了新的语义方向。这就像一位作家真正构思出了新的情节。
2. “在注意力中迷失”的问题
该论文的大标题是:这些模型**“在注意力中迷失了方向”**。
想象一下,“重组者”助手正试图指出画作中最重要的部分(比如田野里的一头牛),以帮助策展人回答问题。研究人员发现,这位助手经常分心。它没有专注于那头牛,而是花费大量精力去整理关于随机背景细节的笔记,或者只是在原地打转。
他们通过观察助手实际向系统中注入了多少“新信息”来衡量这一点。他们发现,“洗牌”往往是冗余的——就像反复重新排列同一副扑克牌,却从未抽出一张新牌。
3. “随机噪声”实验(铁证)
为了证明“重组者”在浪费时间,研究人员尝试了一个疯狂的实验:他们用随机噪声替换了“重组者”的精细计算。
他们没有让助手观察画作并决定关注什么,而是让它随机选择一个模式(就像旧电视上的雪花噪点)或预设规则。
结果如何? 模型并没有崩溃。事实上,在许多测试中,模型的表现与使用其自身“智能”注意力分数时一样好,有时甚至更好。
这就像告诉一位厨师:“停止品尝汤来决定加什么香料;只需随机撒盐。”令人惊讶的是,汤的味道依然很棒。这表明,模型为了“关注”而进行的复杂且昂贵的数学运算在很大程度上是不必要的。模型过度思考了“洗牌”过程,而“发明者”助手实际上一直在承担繁重的工作。
总结
该论文得出结论:当前的 AI 模型效率低下。它们将巨大的计算能力耗费在一个“重组者”助手身上,而这位助手往往只是在原地打转或迷失在细节中,而“发明者”助手才是真正驱动智能的核心。
通过认识到这一点,作者建议,我们可以通过简化模型“关注”的方式,来构建更快、更便宜的 AI 模型,因为它们并不需要如此花哨就能完成任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。