Delving into Muon and Beyond: Deep Analysis and Extensions
本文通过统一的光谱视角分析了 Muon 优化器,引入了一系列光谱变换和一种高效的耦合牛顿迭代法,旨在证明虽然 Muon 作为一种有效的光谱归一化方法发挥作用,但它并不始终优于 Adam,并且在应用于 RMS 归一化更新而非一阶矩更新时表现最为稳定。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个巨大的、复杂的机器人(神经网络)如何说人类语言。为此,你必须调整这个机器人大脑内部数百万个微小的旋钮(参数)。“优化器”(optimizer)就是那个决定在每节课后如何转动每个旋钮的老师。
长期以来,最好的老师一直是 Adam。Adam 很聪明:它会倾听机器人的错误,记住过去的错误(动量/momentum),并根据每个旋钮发出的声音大小单独调整音量(归一化/normalization)。这就像一位知道如何精准推动每一个特定按钮的老师。
最近,一位名为 Muon 的新老师变得非常受欢迎。Muon 与众不同。它不是单独调整旋钮,而是观察排列成网格状(矩阵)的一组旋钮,并强迫它们以一种完美平衡、“正交”(orthogonal)的方式移动。这就像一位舞蹈教练,要求一整排舞者以完美的同步动作起舞,而不在意任何单个舞者的动作是响亮还是微弱。
这篇论文在问:Muon 真的比 Adam 更好吗,还是它仅仅是另一种舞蹈风格?
核心思想:“谱系家族”(The Spectral Family)
作者意识到,Muon 不仅仅是一个偶然的技巧。他们发现它实际上是一个完整方法家族中的极端端点。想象一个滑块,它控制着你如何“压平”机器人大脑中不同方向的重要性:
- 滑块在 1.0 时(标准状态): 你不做任何特殊处理。这就像标准的 Adam 或动量法(Momentum)。你保留了每个方向原始的“响度”。
- 滑块在 0.5 或 0.25 时(中间地带): 你轻轻地平滑掉差异。大的误差会被稍微调低,小的误差会被稍微提升。
- 滑块在 0.0 时(Muon): 你将一切完全压平。你告诉机器人:“无论一个方向是巨大还是微小,都请将其视为同样重要。”这就是 Muon 的核心手段:正交化(Orthogonalization)。
为了测试这一点,作者构建了一个超快速的计算器(使用一种被称为“耦合牛顿-舒尔茨法/Coupled Newton-Schulz”的高明数学技巧),这让他们可以在不依赖大型计算机进行缓慢、不可能的数学运算的情况下,尝试这些不同的滑块设置。
实验:一场受控的竞赛
作者组织了一场非常公平的比赛。他们使用八种不同版本的老师训练了一个小型语言模型(“nanoGPT”)。
- 他们关闭了所有“作弊码”(例如其他论文在使用 Muon 时使用的特殊稳定器)。
- 他们确保每个老师获得的训练时间和资源都是相等的。
- 他们测试了两种类型的输入:一种是老师只观察原始动量(就像一个简单的推力)的情况;另一种是老师首先对噪声进行归一化(就像 Adam 所做的那样)的情况。
实验结果:他们的发现
1. Muon 是一个稳定器,而非超级优化器
当老师仅仅使用原始动量(“简单的推力”)时,Muon 表现得非常出色。它阻止了机器人变得疯狂或跌落悬崖。它让训练变得非常稳定。
- 类比: 如果你正试图用手平衡一把扫帚,Muon 就像一个坚固的夹具,能把扫帚固定得笔直。它防止了扫帚晃动,但它并不一定会帮你走得更快。
2. Adam 依然赢得了比赛
然而,当老师已经在进行智能的“降噪”工作(如 Adam 所做的那样)时,Muon 并没有胜出。事实上,标准的 Adam(或其变体)表现得同样好甚至更好。
- 类比: 如果你已经有一个高科技陀螺仪来保持扫帚稳固(Adam),那么再添加 Muon 的坚固夹具并不会让你走得更快。有时,它甚至会让你踉跄,因为它强迫你把微小的晃动视为巨大的跌落一样对待。
3. “压平”问题
作者发现,Muon 的主要技巧——将一切压平为相等——也有副作用。
- 优点: 它阻止了巨大的、危险的误差主导训练过程。
- 缺点: 它同时也阻止了微小但有用的信号被忽略。如果一个方向拥有微小但重要的信号,Muon 会将其与嘈杂且无用的方向同等对待。
- 类比: 想象一台收音机。Adam 会调低静电噪音并调高音乐声。而 Muon 会把每一个电台的音量旋钮都调到完全相同的水平。如果一个电台正在播放一首微弱但优美的歌曲,而另一个电台只是静电噪音,Muon 会让两者都一样响亮,从而让噪音淹没了那首优美的歌曲。
结论
论文得出结论:Muon 是一个强大的稳定工具,尤其是在你处于起步阶段或使用简单方法时。它像是一个安全网,防止训练崩溃。
然而,Muon 并不是一个可以取代 Adam 的万能灵药。当你已经在利用像 Adam 这样智能的优化器时,将一切压平(p=0)并不会让机器人学得更快。事实上,一种“中间地带”的方法(稍微压平频谱,如 p=1/4)有时比完全使用 Muon 效果更好。
简而言之: Muon 是一个很棒的安全带,但它不是更好的引擎。如果你已经拥有一个好的引擎(Adam),你不需要通过压平道路来让它跑得更快。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。