← 最新论文
💬 NLP

Dissecting Multimodal In-Context Learning: Modality Asymmetries and Circuit Dynamics in modern Transformers

本文通过在合成任务上开展受控实验,研究了现代 Transformer 中多模态上下文学习的机制,揭示出旋转位置编码提高了上下文学习的数据复杂度阈值,而主导模态的高多样性则通过精细的归纳式电路,使得多模态上下文学习能够在次级模态中以出人意料的低复杂度涌现。

原作者: Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

发布于 2026-05-27
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiran Huang, Karsten Roth, Quentin Bouniot, Wenjia Xu, Zeynep Akata

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个正在学习解谜的巨型数字大脑(Transformer 模型)。通常,我们认为这些大脑是通过记忆事实并将其存储在“脑细胞”(参数)中来学习的。但这些模型拥有一种名为**上下文学习(ICL)**的超能力。这就像在你面前看几个示例,然后当场推导出规则,而无需事先学习。

本文研究了当大脑必须同时处理两种不同类型的信息(如文本和图像)时,这种超能力是如何运作的,以及随着大脑变大,其内部连接是如何变化的。

以下是他们发现的详细解析,使用了简单的类比:

1. “大脑”悖论

发现: 当你让单模态大脑(仅文本)变大时,它在使用“看示例”这一技巧方面实际上会变,而在单纯记忆事实方面会变
类比: 想象一个学生。如果他很渺小,他必须查看教科书中的示例来解决新的数学问题。但如果你给他一个巨大的事实图书馆去记忆(扩大规模),他就会停止查看示例,转而尝试回忆他记忆过的类似事实。图书馆越大,他越依赖记忆而非推理。
转折: 论文发现,现代的“旋转位置嵌入”(Rotary Position Embeddings,即 RoPE,一种大脑追踪顺序的特定方式)让这种情况变得更加困难。这就像给学生一张令人困惑的地图;他们难以找到正确的示例来模仿,因此更加依赖记忆。

2. “主修”与“辅修”学生(重大发现)

发现: 当教导大脑处理两种模式(例如:文本 + 图像)时,存在巨大的不平衡。如果大脑已经是文本(“主修”模式)的专家,它只需极少的练习就能学会处理图像(“辅修”模式)。
类比: 将大脑想象成一位花费多年完善复杂酱汁(文本)的大厨。现在,你要求他添加一种新食材,比如某种特定的香料(图像)。

  • 惊喜: 你不需要教大厨从头开始烹饪这种香料。因为他已经知道如何制作酱汁,他只需要一点点练习就能弄清楚如何将香料混合进去。
  • 不对称性: 如果你试图先教他香料(没有酱汁训练),他将需要海量的香料数据才能学会。但因为他已经掌握了酱汁,极少量的香料数据就足够了。“主修”模式构建了引擎;“辅修”模式只需要一把小钥匙来启动它。

3. 扩大规模有助于“双模态”大脑

发现: 与单模态大脑(变大损害“看示例”技能)不同,让“双模态”大脑变大总是有助于它更好地利用示例。
类比: 在单模态情况下,更大的大脑只是囤积了更多的事实。但在双模态情况下,额外的脑力并非用于记忆更多事实。相反,它被用来在新食材(图像)和主酱汁(文本)之间建立一座更好的“桥梁”。大脑越大,桥梁越好,利用示例也就越容易。

4. “翻译官”至关重要

发现: 为了让两种模式协同工作,你需要一个优秀的“翻译官”(编码器),将图像转换为文本大脑能理解的语言。
类比: 想象文本大脑说英语,而图像大脑说某种法语方言。如果你直接把法语单词扔给英语使用者,他们会感到困惑。你需要一个翻译官。

  • 如果翻译官很差(低质量编码器),即使示例完美无缺,英语使用者也无法理解示例。
  • 如果翻译官非常出色(高质量编码器),英语使用者就能瞬间理解示例并解决谜题。翻译官的质量预测了整个系统的表现。

5. 机器内部:“复制 - 粘贴”电路

发现: 论文深入观察了大脑的连线(电路),以了解它是如何学习的。他们发现了两条执行工作的特定“线路”(注意力头):

  1. “回看”线路: 查找列表中的前一项。
  2. “归纳”线路: 查找匹配的示例并复制其答案。
    类比:
  • 阶段 1(文本训练): 大脑学习构建这些线路。它学会了:“嘿,如果我看到一个模式,我应该回看示例并复制答案。”
  • 阶段 2(添加图像): 大脑不会构建新线路。它只是打磨现有的“归纳”线路。它变得更擅长将图像文本示例进行匹配。
  • 证据: 当研究人员“切断”这些特定线路(将其关闭)时,大脑失去了利用示例的能力,退化为随机猜测。这证明了这些线路是该技能的实际引擎。

6. 现实世界验证

发现: 他们在现实世界中使用的真实大型 AI 模型(Qwen2.5-VL)上测试了这些想法。
类比: 他们研究的不仅仅是一个玩具机器人,而是一台真正的工业机器人。他们发现,这台真正的机器人中也存在相同的“回看”和“归纳”线路。当他们关闭这些线路时,机器人失败了。当他们微调机器人时,这些特定线路变得更加敏锐,就像他们在小型玩具实验中发现的那样。

总结

论文揭示,多模态学习(文本 + 图像)是一个不对称的过程。你不需要从头开始教导大脑一切。如果你先教它一种语言,它就会构建一个“推理引擎”。添加第二种语言很容易,因为引擎已经存在;你只需要将新输入连接到旧引擎上。让大脑变大有助于这种连接,而整个过程依赖于特定的内部“复制 - 粘贴”线路,这些线路随着模型的学习得到 refinement(优化),而非重建。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →