← 最新论文
🤖 machine learning

Emergent Capabilities Arise Randomly from Learning Sparse Attention Patterns

本文表明,Transformer 模型中的涌现能力是在训练过程中由于任务相关稀疏注意力模式的突发学习而随机产生的,且较大的模型由于学习效率的提升而更早地获得这些模式。

原作者: Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

发布于 2026-06-25✓ Author reviewed
📖 1 分钟阅读☕ 轻松阅读

原作者: Vatsal Baherwani, Zixi Chen, Shikai Qiu, Andrew Gordon Wilson, Pavel Izmailov

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个巨大的、超级聪明的机器人阅读和写作。你预期它会逐渐进步,就像一个在学期中慢慢提高成绩的学生一样。但对于现代人工智能来说,发生了一些奇怪的事情:机器人突然“开窍了”。前一秒它还在任务上失败,下一秒它就完美地解决了问题。这被称为涌现能力(emergent capability)

这篇论文研究了为什么这些突然的突破会发生。作者认为,这并不是一个平滑、稳定的攀升过程。相反,它更像是机器人在黑暗的房间里寻找一个特定的、隐藏的开关。一旦它拨动了这个开关,一切都会瞬间改变。

以下是他们研究结果的拆解,使用了简单的类比:

1. “灯开关”时刻

把 AI 的大脑想象成一个装满了灯开关(这些被称为注意力头/attention heads)的大房间。大多数时候,机器人在黑暗中摸索。它不知道哪个开关控制着特定任务的灯光,比如“复制一个句子”或“弄清楚是谁给了谁一杯饮料”。

论文显示,这些能力的出现并不是缓慢发生的。它们是突然出现的。

  • 随机性: 如果你训练十个起点略有不同的相同机器人(使用不同的随机种子),有些可能在第 10 天找到正确的开关,有些可能在第 100 天,还有些可能永远找不到。
  • 巨大的飞跃: 一旦机器人找到了正确的开关,它的表现不会一点点提升,而是会飙升。这就像拨动了一个开关,瞬间打开了一盏泛光灯。

2. 秘密在于“注视”

机器人是如何知道该做什么的?它学会了注视正确的事物
在 AI 术语中,这被称为“学习一种注意力模式”。想象你在读一个故事并试图猜测下一个词。聪明的读者知道要回头看前一个句子。困惑的读者则会盯着随机的词看。

作者发现,“突然的突破”恰好发生在机器人学会盯着过去的正确单词来预测未来的那一刻。

  • 证据: 他们通过这种方式测试了机器人:拿出一个尚未学会该任务的机器人,然后手动强迫它的“眼睛”看向正确的单词(使用一种称为“修补/patching”的技术)。突然间,机器人就能完美解决任务,尽管它在自然状态下还没有“学会”它。这证明了学习如何注视正确的事物才是瓶颈。

3. “搜索”的难度

为什么寻找开关需要这么长时间?作者创建了两个“训练游戏”(合成任务)来测试这一点:

  • 稀疏地图游戏(The Sparse Map Game): 想象一个巨大的网格,只有一些特定的点是相连的。机器人必须弄清楚哪些点与哪些点相连。
  • 元胞自动机游戏(The Cellular Automata Game): 想象一排细胞,每个细胞的变化都取决于其相邻的细胞。

他们发现了让这种“搜索”变得极其困难的两个主要原因:

  1. 上下文长度(长长的走廊): 如果机器人必须穿过一条非常长的单词走廊去寻找线索,它就会迷失方向。上下文越长,寻找正确开关就越难。
  2. 稀疏性(大海捞针): 如果机器人必须忽略 99% 的信息,只专注于 1%(一个稀疏模式),它就会挣扎。这就像是在大草堆里寻找一根特定的针;如果草堆巨大而针很细小,机器人可能永远找不到。

4. 更多的眼睛有帮助,但规模很重要

论文还测试了如何帮助机器人更快地找到这些开关。

  • 更多的头(更多的眼睛): 给机器人更多的“注意力头”(更多对眼睛)会有所帮助。这就像是一个团队在房间里搜索,而不是只有一个人在搜索。眼睛越多,其中一个发现开关的机会就越高。
  • 大眼睛 vs 多眼睛: 有趣的是,让单个“眼睛”变大(增加容量)并没有像单纯增加“眼睛的数量”那样有效,只要这些眼睛足够完成工作即可。

5. 不同的工具应对不同的工作

最后,他们问道:“标准的机器人设计(Transformer)是最好的工具吗?”

  • 他们尝试了一种不同的设计,叫做 MLP-Mixer,它不使用标准的“向后看”机制。
  • 结果: 在“稀疏地图”游戏中(寻找特定的、稀疏的连接),MLP-Mixer 比标准机器人快了 10 倍。它几乎瞬间就找到了开关。
  • 然而,在“元细胞自动机”游戏中(需要按特定顺序观察邻居),标准的机器人仍然表现更好。

核心结论

论文得出结论:AI 突然变得聪明的“魔法”并不是真正的魔法。它是一个机械过程,模型在努力学习如何将注意力集中在那些正确的、通常是稀疏的信息碎片上。

  • 更大的模型能更快、更可靠地找到这些专注模式。
  • 更长的上下文会让寻找这些模式变得更加困难。
  • 架构上的改变(比如增加更多的“眼睛”或改变机器人混合信息的方式)可以显著加速这种搜索。

简而言之,涌现不是一条平滑的曲线;它是当机器人终于弄明白该看哪里时,产生的一系列突然的“啊哈!时刻(Aha! moments)”。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →