想象你正在观看一名学生参加一场极其困难的数学考试。起初,他们只是死记硬背答案(第一阶段)。接着,他们开始理解底层的模式,但仍感到困惑并频频出错(第二阶段)。突然,在某个特定时刻,他们迎来了“灵光一闪”的时刻:不再靠猜测,而是对从未见过的题目也能拿到满分。这种从死记硬背到真正理解的突然飞跃,被称为“顿悟”(Grokking)。
本文研究了这种“灵光一闪”的时刻如何在简单的计算机大脑(神经网络)内部发生、以及何时发生。研究人员正在验证一位名为 Tian 的科学家提出的特定理论:在学习过程中,如果计算机内部的“概念”(特征)过于相似,它们会相互排斥,从而迫使大脑高效地组织自身。
以下是他们研究发现的分解,使用简单的类比进行说明:
1. “排斥”规则(理论)
Tian 的理论指出,当计算机大脑中的两个内部概念变得过于相似时,一种数学力量会将它们推开。这就像两个同极相对的磁铁:它们会相互排斥。
- 他们测试了什么: 他们检查了这种“相互推开”的现象是否真的在真实训练中发生。
- 结果: 是的,它确实发生了。 无论计算机大脑使用的是“平滑”的激活函数(如平方函数,x2)还是“崎岖”的激活函数(如 ReLU),该机制都完美运作。
- 隐喻: 想象一个拥挤的舞池。如果两名舞者开始以完全相同的方式移动,就会触发一条规则,迫使他们移动到不同的位置。无论播放的是哪种音乐(激活函数),这条规则都适用。
2. “谱锁定”(可观测信号)
研究人员想知道:我们能否在计算机屏幕上看到一个特定的信号,告诉我们“灵光一闪”的时刻即将发生?
他们观察了“更新谱”——本质上,就是计算机的权重(它用来学习的旋钮)随时间变化的方式。他们正在寻找一种特定的模式:二阶锁定(Rank-2 Lock-in)。
- 类比: 想象计算机正在试图找到穿过迷宫的最佳路径。
- 灵光一闪之前: 计算机在原地打转,同时尝试 100 个不同的方向(混乱)。
- 锁定时刻: 突然,它意识到只需要两个特定的方向就能解决迷宫。所有其他方向都坍缩为噪声。计算机“锁定”到了仅这两个路径上。
- 结果: 这种“锁定”信号仅在计算机使用“平滑”激活函数(x2)时可见。
- 使用 x2 时:信号响亮且清晰。计算机将其众多方向坍缩为恰好两个。
- 使用 ReLU 时:信号消失了。计算机并没有锁定到两个方向;它保持分散状态,仅由一个主要方向主导。
3. 重大发现:“规则与结果”
这是本文最重要的部分。研究人员发现,机制(规则)与特征(可见结果)之间存在分裂。
- 机制(排斥): “相似的概念相互排斥”这一规则是普适的。它在两种类型的计算机大脑(x2 和 ReLU)中都会发生。
- 特征(锁定): 表明计算机“想通了”的可见信号(二阶锁定)是特定于 x2 大脑的。
隐喻:
想象两种不同类型的汽车(一辆拥有平滑引擎,一辆拥有崎岖引擎)正在爬坡。
- 规则: 两辆车都有一条规则:“如果车轮打滑,刹车必须启动。”这条规则对两辆车都适用。
- 特征: 然而,只有平滑的汽车在刹车启动时会发出独特的“咔哒”声。崎岖的汽车也会启动刹车,但它只发出“嗡嗡”声。
- 教训: 如果你只监听“咔哒”声,你可能会认为崎岖的汽车没有刹车。但它确实刹了!只是“声音”(谱特征)取决于引擎类型,尽管“刹车规则”(排斥)是相同的。
4. 给“驾驶员”的实用建议
本文还为试图实时检测这种“灵光一闪”时刻的人提供了一些建议:
- 窗口大小很重要: 要看到“咔哒”声(锁定),你必须在一个特定的时间窗口内(约 20 到 30 步)观察数据。如果你观察得太快(5 步),会得到误报。如果你观察得太慢,就会错过那个时刻。
- 时机: “咔哒”声发生在计算机开始获得完美考试成绩之前。它是一个可靠的早期预警系统,但仅适用于平滑(x2)类型的计算机。
- “慢速”模式: 如果你减慢学习过程(通过降低一个称为 η 的参数),“灵光一闪”的时刻会晚得多发生,但数学原理依然成立。“咔哒”声只是更微弱,出现的时间也更长。
总结
本文证明了 Tian 提出的“排斥”规则是真实的,并且在所有情况下都会发生。然而,我们用来检测它的具体视觉信号(“二阶锁定”)是一种光学的把戏,仅对某些类型的计算机大脑有效。如果你使用的是不同类型的“大脑”(如 ReLU),你必须寻找不同的信号,因为尽管底层逻辑相同,“锁定”发生的方式却不同。
技术摘要:特征排斥与谱锁定
问题陈述
“顿悟”(Grokking)是指神经网络在训练损失早已趋于平稳后,突然从记忆过渡到泛化的现象。该现象已通过多种视角得到解释,包括机制可解释性和隐式正则化。Tian [2025] 提供了一个原则性框架,将两层网络中的顿悟动力学分解为三个阶段,最终归结为“交互式特征学习”阶段(第三阶段)。在该阶段内,Tian 的定理 6提出了一个“排斥定理”:由于矩阵 B=(F~⊤F~+ηI)−1 的非对角结构,相似的隐藏特征会相互排斥。
然而,Tian 的框架留下了两个实证问题未获解答:
- 时机:这种排斥机制在训练过程中的哪个具体时间点开始变得可被实证观测?
- 可观测性:这种机制是否表现为一种可测量的、在线的签名,使得从业者无需昂贵的离线诊断即可计算相关量?
本文通过在 Tian 的精确模加(modular-addition)设置上测试定理 6 和一个候选谱可观测量,解决了上述问题。
方法论
本研究复现了 Tian [2025] 的模加设置(M=71个类别,K=2048个隐藏单元,训练比例 p≈0.40),使用带有权重衰减 η 的 Adam 优化器。作者在多个随机种子下采用了两种互补的测试:
定理 6 的直接验证:
- 作者利用 Woodbury 恒等式精确计算 B,以降低计算复杂度。
- 在确定性检查点,他们基于余弦相似度识别出前 200 对最相似的特征。
- 他们验证了符号规则:sgn(Bjℓ)=−sgn(f~j⊤Pη,−jℓf~ℓ),其中 P 是排除了第 j 列和第 ℓ 列的投影矩阵。
- 该验证在不同激活函数(σ(x)=x2 和 σ(x)=ReLU)下执行。
谱签名检测:
- 作者监控参数更新(ΔW)的滚动窗口 Gram 矩阵。
- 他们追踪特征值间隙比率 σ2/σ3(第二特征值与第三特征值的比率)。
- 一个基于斜率的检测器识别该比率进入持续上升时的“锁定”(lock-in)时刻,假设排斥作用将冗余特征整合为低秩结构(具体为秩 2)。
- 针对窗口大小(W)和权重衰减(η)进行了敏感性分析。
主要结果
1. 定理 6 的验证(激活函数通用性)
定理 6 的符号规则在不同激活函数下均实证成立,证实该机制是激活函数通用的。
- σ(x)=x2:前 200 对相似特征的实证符号匹配率从第 50 轮的 0.865 上升至第 300 轮紧密饱和的 0.985。在所有种子中,饱和(≥0.95)一致发生在第 175 轮。
- σ(x)=ReLU:符号规则同样成立,且饱和更快(第 500 轮达到 1.000)。
- 结论:由 F~⊤F~ 结构支配的排斥机制,无论激活函数是幂函数还是 ReLU,均有效运作。
2. 谱锁定(激活函数特异性)
虽然机制是通用的,但参数更新的谱签名是激活函数特异性的。
- σ(x)=x2(聚焦记忆):基于斜率的检测器在15/15个顿悟种子中于第 174 轮触发。在顿悟种子(中位数 ≈300)与控制种子(η=0,中位数 ≈1.31)之间,后期阶段的 σ2/σ3 比率存在巨大的幅度分离(229×)。谱结构坍缩为秩 2,表明特征整合到了两个持久方向上。
- σ(x)=ReLU(扩散记忆):检测器在0/15个顿悟种子中触发。幅度分离坍缩至 1.4×,且谱结构保持秩 1 主导(σ1≫σ2≈σ3)。
- 结论:秩 2 锁定签名仅在“聚焦记忆”机制(幂激活)中出现,此时特征坍缩至尖锐峰值。在“扩散记忆”机制(ReLU)中,特征保持分布状态,阻碍了 distinct 秩 2 谱签名的形成。
3. 方法学控制与扩展
- 窗口大小敏感性:检测器需要窗口大小 W∈{20,30}。较小的窗口(W≤10)会在控制条件下产生假阳性。
- η 扩展:在 η=10−5 下的扩展运行证实了 Tian 关于顿悟时间的 1/η 扩展预测(第 1527 轮发生顿悟)。然而,锁定幅度(σ2/σ3)显著降低(≈25 对比 ≈300),表明在该缓慢时间尺度下,秩 2 结构尚未完全发展。
- 水平度量检测器(ρtian):一个基于激活 Gram 非对角结构的更简单指标,能预测 σ=x2 的顿悟 onset 并具有正向提前量,但无法泛化到 ReLU 或不同的 (M,p) 配置,它标记的是特征动力学的启动而非成功的顿悟。
意义与主张
本文得出了一个关键的结构–机制区分:
- 机制(通用):Tian 的定理 6 通过特征 Gram F~⊤F~ 的性质支配 B 的非对角符号结构。该机制稳健且独立于具体的激活函数 σ。
- 签名(特异性):参数更新中可观测的谱签名取决于排斥作用如何转化为权重更新,这一过程由导数 σ′ 介导。
- 幂激活(σ=x2)产生聚焦特征,整合至两个方向,从而产生秩 2 谱锁定。
- ReLU 产生扩散特征,保持秩 1 主导,尽管存在底层排斥机制,但缺乏谱锁定签名。
作者将这种实证解离与 Tian 的定理 5 联系起来,该定理形式化地区分了聚焦记忆和扩散记忆机制。本文结论指出,虽然排斥机制在第三阶段是普遍的,但用于顿悟诊断的谱方法是依赖激活函数的。从业者不能假设单一的谱指标(如 σ2/σ3)能在所有激活函数下检测顿悟;诊断工具的选择必须与激活函数诱导的特定记忆机制相一致。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。