Mechanistic Insights into Functional Sparsity in Multimodal LLMs via CoRe Heads
本文揭示了多模态大语言模型依赖于功能稀疏性,即被称为 CoRe heads 的专门注意力头对于提取查询相关的视觉特征至关重要,这一点通过其在消融实验中对性能的显著影响以及在加速推理方面的潜力得到了证实。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心理念:在人群中寻找“特工”
想象一下,多模态大语言模型(MLLM)就像一个庞大且繁忙的新闻编辑部。这个编辑部有成千上万名记者(被称为注意力头/attention heads)同时在工作。他们的任务是阅读一个复杂的故事(文本提示词),并观察一个混乱的场景(图像或视频),从而回答一个特定的问题。
通常,我们认为所有这些记者都在平等地协作,扫描整个房间来寻找答案。但本论文发现了一个令人惊讶的事实:大多数记者其实只是在漫无目的地闲逛,或者盯着背景噪音发呆。
相反,有一个由大约 5% 的记者组成的精锐小队,他们充当了“特工”的角色。这些特工是唯一真正知道该看向哪里以找到特定答案的人。作者将他们称为 CoRe Heads(上下文感知检索头)。
侦查工作:他们是如何找到这些特工的
为了证明这一点,研究人员发明了一种衡量注意力的新方法,称为 RAM(检索注意力质量/Retrieval Attention Mass)。
- 类比: 想象你正在一个繁忙的停车场里寻找一辆特定的红色汽车。
- “差劲”的记者(底层注意力头): 他们看着天空、地面、路过的行人以及树木。除了那辆车以外,他们被一切事物都分散了注意力。
- “CoRe”记者: 他们忽略了天空和行人。他们的目光直接锁定在那辆红色汽车上。
研究人员测量了每个“记者”对正确物体(那辆红车)与错误事物投入了多少注意力。他们发现,CoRe Heads 始终直接指向答案,而其他记者则仅仅是“噪声”。
“如果……会怎样”实验:移除这些特工
为了测试这些“特工”是否真的必不可少,研究人员进行了一项危险的实验:他们把这些特工关掉了。
- 结果: 当他们让那前 5% 最优秀的记者(CoRe Heads)保持沉默时,整个新闻编辑部陷入了瘫痪。模型的回答能力大幅下降。这就像是从迷宫中带走了唯一知道出口的人,然后要求剩下的群众来引导你。
- 对比: 当他们关闭那些“分心”的记者(底层 95%)时,模型几乎可以完美地继续运行。这证明了那些“噪声”记者是冗余的,但“特工”是不可或缺的。
“瓶颈”的发现
论文还注意到,随着模型规模的扩大(从小型到大型),出现了一种模式。
- 小型模型: 特工们散落在新闻编辑部的各处,显得有些杂乱。
- 大型模型: 随着模型规模的增长,特工们移动到了建筑中后段的一个特定、紧密的集群中。他们形成了一个瓶颈。模型意识到:“嘿,我们不需要每个人都去观察;我们只需要这个特定房间里的这支特定团队来承担重任。”
超能力:加速运行
由于研究人员证明了 95% 的记者只是在“填充空间”而非进行关键工作,他们尝试了一种新策略来提高模型的速度。
- 策略: 他们告诉那 95% 分心的记者:“你们不再需要观察整个房间了。只需看一眼你们正前方的区域即可。”与此同时,他们让那 5% 的特工继续观察整个房间。
- 结果: 这使得模型变得更快(最高达 2 倍速),且没有损失准确性。这就像是告诉人群不要再对着整个房间大喊大叫,而是只向邻居低声耳语,同时只让少数专家在大声播报重要新闻。信息依然能传达,但混乱(以及所需的时间)消失了。
总结
这篇论文揭示了多模态 AI 模型实际上并没有动用其全部脑力来寻找答案。它们依赖于一个微小的、专门的小队(CoRe Heads)来完成寻找视觉线索的真正工作,而网络中的其余部分仅仅是在维持运转。通过识别并保护这支精锐小队,同时简化其余部分的任务,我们可以让这些 AI 模型变得更加快速且高效。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。