← 最新论文
🤖 machine learning

Spectral Flattening Is All Muon Needs: How Orthogonalization Controls Learning Rate and Convergence

本文通过证明 Muon 优化器的正交化机制实现了谱平坦化,将稳定性约束从最大梯度奇异值转移至平均梯度奇异值,并在 Kronecker 分解曲率模型下改善了有效收敛因子,从而为 Muon 优化器卓越的稳定性和收敛性提供了基于几何原理的解释。

原作者: Tien-Phat Nguyen, Truong Nguyen, Minh-Phuc Truong, Tuc Nguyen, James Bailey, Trung Le

发布于 2026-05-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Tien-Phat Nguyen, Truong Nguyen, Minh-Phuc Truong, Tuc Nguyen, James Bailey, Trung Le

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一块沉重且形状怪异的巨石推上山坡。这块巨石代表了训练计算机大脑(神经网络)时的“损失”(误差)。你的目标是尽快将巨石推至谷底(完美解)。

长期以来,实现这一目标的标准方法是SGD(随机梯度下降)。将 SGD 想象为一群推巨石的人。他们观察坡度,朝着看起来最陡峭的方向推。然而,这块巨石形状怪异:它有一侧极其光滑且陡峭,而另一侧则较为平缓。

旧方法(SGD)的问题:
由于巨石的一侧过于光滑,团队必须非常轻柔地推。如果推得太用力,他们就会失控地滑向错误的一侧,导致整个操作崩溃。这意味着他们必须采取微小而谨慎的步伐,使得旅程非常缓慢。

新英雄:Muon
这篇论文介绍了一种名为Muon的新方法。Muon 不仅仅是在推,它更像是一位神奇的机械师,在每次推动之前都能重塑巨石。

以下是 Muon 的工作原理,基于论文的核心概念:

1. 谱平坦化(Spectral Flattening): “整平”技巧

论文将 Muon 的制胜法宝称为**“谱平坦化”**。

  • 类比:想象巨石有一个“尖刺”侧(非常陡峭且危险的方向)和几个“平坦”侧。在数学术语中,这些被称为“奇异值”。尖刺侧是问题所在,因为它迫使团队走得很慢。
  • Muon 的做法:Muon 使用一种数学工具(牛顿 - 舒尔茨迭代)来“整平”那个尖刺侧。它并不改变团队需要前往的方向;它只是让陡峭的坡度变得不那么陡,让平缓的坡度变得稍微陡一些。它将一块参差不齐、凹凸不平的岩石变成了一颗光滑圆润的球体。
  • 结果:因为岩石现在变得圆润且平衡,团队可以推得更用力而不会打滑。他们可以迈出巨大的步伐(更大的学习率),而这些步伐若用旧方法会导致立即崩溃。

2. 为何更快:“平均”与“最坏”

论文证明了两点关于其为何有效的主要事实:

  • 速度限制

    • SGD受限于巨石最坏的部分(最陡峭的尖刺)。如果尖刺比其余部分陡峭 100 倍,团队必须以 1/100 的速度行走。
    • Muon受限于平均陡峭程度。通过整平尖刺,Muon 忽略了“最坏情况”,转而关注平均值。这使得团队能够以更接近其真实潜力的速度行走。
  • 收敛(到达底部)

    • 论文表明,Muon 不仅仅是迈更大的步子;它迈的是更好的步子。它充当了“预条件器”,这是一种 fancy 的说法,意指它调整地形,使每一步都能更高效地将巨石推向目标。
    • 即使你强迫旧团队(SGD)和新团队(Muon)以完全相同的速度行走,Muon 仍然能更快地到达谷底,因为它的路径更直接,且更少摇摆。

3. 实验:证明其有效性

作者在标准的计算机视觉任务(从 CIFAR-10 数据集中识别猫、狗等图像)上测试了这一点。

  • “跳水”测试:他们尝试以极高的速度推巨石。旧团队(SGD)立即从悬崖上跌落(发散),训练失败。新团队(Muon)则保持平稳行走并达到了目标。
  • “赛跑”测试:当他们强迫两个团队以相同的中等速度行走时,Muon 仍然赢得了比赛,比旧团队提前了几个“圈”(epoch)达到了高准确率分数。

4. 关于“归一化”的新见解

论文还发现了常用工具“批归一化”(Batch Normalization)为何有效的原因

  • 发现:作者意识到,批归一化之所以有效,是因为它自然地“整平”了输入数据,类似于 Muon 对巨石所做的操作。
  • 新想法:他们提出了一条设计这些工具的新规则:不仅要平衡数值,还要平衡数据的“形状”。如果你能确保输入数据没有某个“超级陡峭”的方向,你就可以用更大的步伐、更快地训练计算机大脑。他们测试了一种名为"FrobNorm"的新方法,该方法正是如此,结果发现它允许在极高的速度下进行训练,而其他方法在此速度下会失败。

总结

简而言之,Muon是一种更智能的 AI 训练方式。它在每一步之前,将问题中混乱、不平坦的地形“整平”。这防止了训练被困在陡峭、危险的山坡上,使 AI 能够学得更快、迈出更大的步伐,并比以前的方法更可靠地到达解决方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →