← 最新论文
🤖 machine learning

When Do Attention Circuits Form? Developmental Trajectories of Capability and Attention-Sink Emergence Across Three 1B-ClassArchitectures

本文追踪了三款 1B 级语言模型中注意力电路的发展轨迹,揭示了归纳电路(induction circuits)的形成与注意力汇点(attention sinks)是两个截然不同且在时间上分离的转变过程,而非单一事件,并且特定的电路能力可以在无需最终模型的情况下在训练早期被识别出来。

原作者: Yongzhong Xu

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yongzhong Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在观察一群由三名年轻学生(即 AI 模型)组成的群体,他们正在学习阅读和理解一座巨大的图书馆。这些学生的大小大致相同(拥有 10 亿个“脑细胞”),但他们有着不同的老师和不同的书籍。

研究人员想要回答一个简单的问题:这些学生究竟在什么时候学会了特定的技巧?

具体来说,他们寻找两件事:

  1. “模仿者”技巧: 学习识别像“A... B... A”这样的模式,并正确预测下一个词应该是“B”。(这被称为归纳电路,即 induction circuit)。
  2. “第一页”习惯: 无论句子关于什么,都学会始终关注句子的第一个词。(这被称为注意力汇点,即 attention sink)。

长期以来,科学家们认为这两件事是在同一时刻发生的,就像开关被打开一样。但这篇论文指出:不,事实并非如此。 它们发生的时间非常不同,而且发生的方式取决于学生的“大脑结构”以及他们正在阅读的内容。

以下是他们发现的过程,使用了简单的类比:

1. “禁区”(底层)

研究人员发现了一个永不打破的规则:大脑的前两层(第 0 层和第 1 层)永远不会学会“第一页”习惯。

  • 类比: 想象一条工厂流水线。前两个工作站只是接收原材料,它们还没有经过处理。你不能在第一个工作站就让一个“工厂经理”(注意力汇点)来做决策,因为那里还没有足够的信息。
  • 发现: 无论这些学生学习了多久,他们大脑的最底层永远不会发展出这种习惯。这是其架构的硬性规则,而不是由于他们未能学会。

2. “中间优先”的惊喜

你可能会认为“第一页”习惯会从底层开始,随着大脑变得更聪明而逐渐向上移动。研究人员发现事实恰恰相反。

  • 类比: 想象一栋建筑。你可能期望灯光从底层向上逐层点亮。然而,情况是建筑中间层的灯先亮了,然后这种习惯向外扩散。紧邻“禁区”之上的那些层,反而是最后学会这种习惯的。
  • 发现: “第一页”习惯首先在网络的中部结晶,而不是底部。

3. 两个不同的“开关”

这是最大的发现。研究人员追踪了“模仿者”技巧和“第一页”习惯分别出现的时间。

  • “模仿者”技巧(归纳): 这发生得非常早。在接受 DCLM 书籍训练的学生中,这种技巧在他们阅读了大约 200 亿到 230 亿个单词时就已经完全掌握了。这就像一个孩子学习系鞋带;学得很快,然后就完成了。
  • “第一页”习惯(注意力汇点): 这发生得要晚得多。在同样的这些学生中,直到他们阅读了 2600 亿到 4000 亿个单词后,这种习惯才真正显现。
  • 类比: 这就像学习骑自行车(技巧)发生在第一周,但学习在每次比赛前都要看一眼起跑线(习惯)却要等到第五年。它们是两个完全不同的事件,中间有着巨大的时间间隔。

4. 学习的形态取决于“学校”

研究人员测试了三个不同的学生:

  1. Pythia: 阅读“The Pile”书籍。
  2. OLMo: 阅读“DCLM”书籍。
  3. OLMoE: 阅读“DCLM”书籍,但拥有特殊的“混合专家”大脑(就像拥有 64 个不同的导师,但每次任务只使用其中的 8 个)。

他们发现,学习曲线的形态会根据学生的不同而改变:

  • 渐进式坡度: Pythia 和 OLMoE 学习“第一页”习惯的过程是缓慢且稳定的,就像水填满浴缸一样。
  • 剧烈跳跃: OLMo(阅读 DCLM 的标准密集型大脑)则是突然完成的。前一刻它几乎没有“第一页”习惯,而到了下一刻(在两个检查点之间),它从 7% 猛增到了 70%。这是一种突发的“相变”,就像冰突然变成水一样。

结论: 同样的一本书(DCLM)在不同的学生身上产生了慢速学习者和突然跳跃者的不同结果,仅仅是因为他们的脑架构不同。

5. 你不需要等到毕业

关于何时可以观察到这些技能,其中一个最实用的发现是:

  • 发现: 如果你想找出大脑的哪些部分在进行“模仿者”技巧,你不需要等到学生读完整个图书馆。
  • 类比: 想象你想知道一个学生是否擅长数学。你不需要等到他完成 4 年的学位。当他完成仅仅 1% 的课程时,你已经可以看到他最终将拥有的 67% 的数学技能了。
  • 结果: 研究人员可以使用仅处于训练阶段 1% 的学生来识别这些大脑电路。你不需要等到模型“完成”才能了解它的思维方式。

总结

这篇论文告诉我们,AI 学习的“神奇时刻”并不是一个单一的大事件。

  1. 时机: 大脑学习模仿模式(归达)的时间,远早于它学会痴迷于第一个词(注意力汇点)的时间。
  2. 位置: 对第一个词的痴迷始于大脑的中部,而非底部。
  3. 多样性: 取决于大脑的设计,这种痴迷可以缓慢出现,也可以突然爆发。
  4. 效率: 我们可以在训练非常早期就看到这些技能的形成,因此我们不需要等待 AI “完成”才能研究它的思考方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →