← 最新论文
🤖 machine learning

The Geometry of Grokking: Norm Minimization on the Zero-Loss Manifold

本文通过证明在学习率和权重衰减趋于极小的极限情况下,梯度下降会在零损失流形上最小化权重范数,从而解释了被称为“顿悟”(grokking)的延迟泛化现象,这一机制已通过推导出的后记忆动力学闭式表达式以及实验模拟得到了验证。

原作者: Tiberiu Musat

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Tiberiu Musat

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

核心谜题:什么是“顿悟”(Grokking)?

想象一下,你正在教一个机器人做数学题。你给它一个例子:1+1=21 + 1 = 2

  • 阶段 1(记忆): 机器人很快学会了只要看到“1+11 + 1”就回答“$2”。它记住了答案。但如果你问它一个新问题,比如”。它记住了答案。但如果你问它一个新问题,比如 2 + 2$,它就失败了。它只是在重复它听过的内容,像个鹦鹉一样。
  • 漫长的等待: 你继续训练这个机器人。很长一段时间内,似乎没有任何变化。它仍然只知道那一个例子。
  • 阶段 2(顿悟): 突然间,在经过数百或数千个额外的步骤后,机器人迎来了“灵光一现”的时刻。它理解了加法的规则。现在,它可以完美地解决 2+22+25+35+3 以及任何其他的加法问题。

这种奇特的延迟——即机器人在已经掌握训练数据很久之后,才从“记忆”转向“理解”的过程——被称为顿悟(Grokking)

论文的核心观点:“零损失”流形(The Zero-Loss Manifold)

本文作者试图解释为什么会发生这种情况。他们提出了一种观察机器人如何在漫长等待期进行学习的新方法。

把机器人的大脑想象成一个巨大的、多维的景观。

  • 目标: 机器人想要到达一个“误差”(它错得有多离谱)为零的山谷。
  • 零损失山谷: 一旦机器人记住了那个单一的例子(1+1=21+1=2),它就进入了一个非常特定的、平坦的山谷。在这个山谷里,机器人在训练数据上的错误率为零。
  • 问题所在: 这个山谷非常巨大。有数百万种不同的方式来排列机器人的内部旋钮(权重)以实现零误差。其中一些排列方式是“聪明的”(它们能推广到新的数学问题),而另一些则是“笨拙的”(它们只适用于那一个例子)。

秘密机制:范数最小化(Norm Minimization)

论文指出,一旦机器人进入这个“零损失山谷”,训练过程就会改变其目标。它不再试图降低误差(因为误差已经为零),而是开始尝试简化自身

类比:走钢丝的人
想象机器人是一个在一条很长、很弯曲的钢丝(零损失山谷)上行走的走钢丝者。

  1. 钢丝: 钢丝代表了所有可以让机器人得到正确答案的可能性。
  2. 推力: 训练过程包含一种“权重衰减”(Weight Decay,一种不断推动机器人使用更少能量的微小力量)。
  3. 结果: 因为机器人已经在钢丝上了(误差为零),它唯一能做的就是在钢丝上滑动。这种“节能”的力量会将它推向那段最短且最简单的钢丝。

作者通过数学证明,机器人本质上是在沿着这条钢丝滑动,寻找最简单的解决方案。最终,它找到了那条“最简单”的路径,而这条路径恰好就是理解加法通用规则的路径。这就是为什么泛化发生在记忆之后:机器人必须完成在钢丝上漫长而缓慢的滑动,才能找到那个简单的解。

“玩具模型”证明

为了证明这不仅仅是巧合,作者构建了一个微小的、简单的机器人(线性模型),它只有两个旋钮。

  • 他们针对 1+1=21+1=2 进行了训练。
  • 观察: 机器人很快找到了一个对训练数据有效但很奇怪的解(例如,使用一个巨大的正数和一个巨大的负数来相互抵消)。
  • 滑动: 然后,慢慢地,“权重衰减”将旋钮推向了一个更简单、更平衡的解(1 和 1)。
  • 结果: 一旦旋钮到达了这个简单、平衡的位置,机器人突然变得非常擅长解决任何加法问题,而不只是 1+11+1

“孤立”视角:聚焦于嵌入层(Embedding Layer)

论文还探讨了第二个问题:我们能否在不模拟整个系统的情况下,仅通过理解机器人的一部分大脑来理解它?

在模运算加法(类似时钟的数学,如 11+2=111 + 2 = 1)的具体案例中,之前的研究表明机器人将数字排列成一个圆圈

  • 类比: 想象机器人的第一层是一个制图师。它将数字放置在地图上。
  • 发现: 作者创建了一个数学捷径。他们证明了,如果你假设机器人的第二层始终“完美地适应”第一层,你就可以写出一个简单的公式,来预测制图师(第一层)会如何移动。
  • 模拟: 当他们在计算机上运行这个公式时,它完美地重现了“顿悟”效应。制图师缓慢地将数字从一个混乱的团块重新排列成一个完美的圆圈,随后机器人就开始理解数学了。

研究结论总结

  1. 顿悟是几何学问题: 学习的延迟不是一个漏洞,而是几何学的一个特性。机器人必须沿着一条“零误差”路径走很长一段距离,才能找到最简单的解。
  2. 权重衰减是引擎: 这种试图让机器人的数值变得更小的微小力量(权重衰减),正是推动它沿着这条路径前进的动力。如果没有它,机器人会永远卡在“记忆”阶段。
  3. 简化行之有效: 你可以通过观察复杂网络的一部分(嵌入层),并假设其余部分会立即做出调整,来预测该网络的学习过程。

本文并未声称的内容

  • 它并未声称这适用于每一种类型的 AI 或每一种类型的数据(它专注于特定的数学问题和简单的网络)。
  • 它目前并不建议将其用于构建更好的医疗 AI 或自动驾驶汽车。
  • 它并未声称已经解开了所有神经网络的奥秘,而仅限于这些特定设置下的“顿悟”现象。

简而言之,这篇论文告诉我们,顿悟就是机器人沿着一条笔直的线进行漫长而缓慢的行走,去寻找解决问题的最简单、最优雅的方式。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →