← 最新论文
🤖 machine learning

Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

本文提出了一个理论框架,证明了 Transformer 在广义归纳推理任务上的学习动力学被限制在一个低维不变流形上,从而能够表征上下文学习与权重内学习,基于初始化预测电路选择,并实现对已学习电路的自动检测。

原作者: Tiberiu Musat, Tiago Pimentel, Nicholas Zucchet, Thomas Hofmann

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiberiu Musat, Tiago Pimentel, Nicholas Zucchet, Thomas Hofmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,不要把 Transformer 语言模型看作一个拥有数百万个神经元随机放电的巨大、混乱的大脑,而要把它看作一个巨大的、高科技的舞池。多年来,科学家们一直在观察这些模型如何学习推理——比如发现如果故事中“Alan”后面跟着“Turing”,那么稍后“Alan”也应该再次跟着“Turing”——但他们无法解释这些舞者究竟是如何移动的。他们曾认为这种编舞过于复杂,难以绘制成图,是一个由数百万个参数组成的旋涡状混乱体。

这篇论文投下了一枚重磅炸弹:这个舞池一点也不混乱。

无形的舞台:IMIR

作者发现,当 Transformer 进行推理学习时,它并不会在数百万种可能的设置中漫无目的地游荡。相反,它会被困在一个微小的、隐形的、低维度的舞台上,这个舞台被称为归纳推理不变流形(Invariant Manifold of Inductive Reasoning, IMIR)

把模型的整个大脑想象成一个巨大的、三维的海洋。你会预期学习过程会在那个海洋中随处游动。但论文证明,对于一大类推理任务,模型实际上被限制在一个漂浮在海洋中的单一、扁平的二维平面上。无论模型如何训练,它都永远不会离开这张纸面。

这为什么重要?因为我们不再需要试图理解数百万个浮动的数字,而是可以用这张纸面上仅有的几个坐标来描述模型的整个推理能力。这就像是意识到虽然一辆汽车有数千个零件,但它在直道上的运动可以用仅仅两个数字来描述:速度和方向。

两名舞者:记忆 vs. 推理

在这个特殊的舞台上,模型必须在两种不同的解题方式之间做出选择:

  1. “权重内”舞者(记忆): 这个舞者只是死记硬背答案。如果提示词是“Alan”,它之所以记得“Turing”,是因为它以前见过一百万次。它很快,但它只适用于它见过的东西。
  2. “上下文内”舞者(推理): 这是“归纳头(induction head)”。它观察当前的文本,寻找模式(比如在之前的文本中,“Alan”曾出现在“Turing”之前),并即时推导出答案。这就是泛化的魔力。

论文显示,这两名舞者正在进行一场激烈的竞争。如果数据充满了常见的、重复的模式(比如一个“Alan”总是跟随“Turing”的故事),“记忆”舞者会轻易获胜并接管舞台。但如果数据很杂乱,包含罕见的词汇和变化的模式,那么“推理”舞者就必须挺身而出。作者从数学上证明,只有当“记忆”舞者被剥夺了容易获胜的机会时,“推理”舞者才会有机会起舞。

抽奖券:谁赢得了这场舞蹈?

这里是最酷的部分。论文研究了为什么有些模型学会了推理,而有些模型却没有,即使它们的初始规则相同。事实证明,这一切都取决于初始洗牌(initial shuffle)

想象你有一副扑克牌(模型的初始权重)。论文指出,在这副随机的牌中隐藏着一张“中奖票”——一个特定的、微小的子网络,它被完美地设定为可以学习该推理任务。但问题在于:你得到的是哪一张中奖票,完全取决于一开始牌是如何被洗的。

作者发现,这个“获胜”电路不仅仅关乎拥有大数值;它关乎不同潜在电路之间复杂的战斗。有时,一个本该失败的电路竟然赢了,是因为它与一个本该获胜的电路之间发生了奇特的相互作用。这就像一场音乐椅游戏,音乐停止时,坐下的并不是跑得最快的人,而是那个恰好站在正确位置上的人。

这排除了什么

这篇论文非常明确地说明了它不是在说什么:

  • 不是在说学习是随机的混沌。作者明确拒绝了“我们需要追踪数百万个参数才能理解学习”的观点。他们展示了学习被限制在一条可预测的、低维度的路径上。
  • 不是在说“记忆”是学习的唯一方式。事实上,他们证明了“推理”(归纳学习)是一种在特定数据条件下才会涌现的、独特的、必要的机制。
  • 不是在声称我们可以仅仅通过观察初始权重的大小来预测谁会赢得“电路之战”。论文明确指出,简单的预测器(比如“初始权重越大 = 获胜者”)无法解释他们观察到的复杂相变。

他们有多确定?

作者不仅仅是在猜测或进行一些模拟实验。他们已经从数学上证明了这个“不变流形”的存在,且适用于一类广义的任务。他们展示了如果模型起始于这张纸面上,梯度下降的法则(教导模型的数学规律)将保证它永远留在上面。

然而,他们也注意到,虽然他们证明了模型会留在这张纸面上,但他们尚未从数学上证明模型是否总是会被拉回到这张纸面上(尽管他们的实验表明确实如此)。他们还模拟了“记忆”电路与“推理”电路之间的竞争,以展示数据统计特性(如单词重复的频率)是如何改变天平的倾斜方向。

大局观

通过将这些推理电路的形成描述为在特定舞台上的低维舞蹈,作者为 Transformer 如何学习的“预测性理论”迈出了巨大的一步。他们将一个由数百万个数字组成的黑盒变成了一张清晰、可解释的地图。我们不再纠结于“这个模型在做什么?”,而是可以看着地图说:“啊,它目前正在‘归纳头’坐标上跳舞,并且因为它正处于与‘记忆’坐标的对抗中,由于数据过于重复,它正在输掉这场战斗。”

这不仅仅是一个理论;它是一个新的视角,让 AI 那些不可见的机制变得可见、可预测,并最终变得可以理解。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →