Approximate Muon with low-rank adapters
本文介绍了 sMuon,这是一种通过将目标函数线性化并利用最小二乘法求解来近似 Muon 优化器的有效方法,用于低秩参数高效微调,从而在先前与 LoRA 不兼容的 SFT 和 ReLoRA 预训练等场景中,实现 Muon 的性能优势。
原始论文根据 CC0 1.0(http://creativecommons.org/publicdomain/zero/1.0/)发布到公有领域。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图教一个巨大的、超级聪明的机器人一项新技能,比如写诗或解数学题。你不想从头开始重新训练机器人的整个大脑,因为那既费时又昂贵。相反,你想在它现有的脑部结构上附加一个轻量级的“训练模块”。这被称为参数高效微调(Parameter-Efficient Fine-Tuning,简称 PEFT)。你可以把它想象成给一个通用型机器人戴上一个专门的耳机,这个耳机教会它新技巧,而无需改变机器人的核心硬件。
构建这些耳机的一种流行方法叫做 LoRA(低秩自适应)。它就像是用两张薄薄的平整纸片构建耳机,当它们叠在一起时,就形成了新技能的形状。为了教机器人,我们需要一个优化器(optimizer)——一个数学教练,告诉耳机如何调整其形状以做得更好。最常见的教练是 AdamW,但现在有一个更新、更强大的教练叫做 Muon。Muon 因其在预训练(即从零开始教授机器人的第一课)阶段极其高效而闻名。它的工作原理是确保机器人大脑的更新是以一种完美平衡、“正交”的方式进行的,就像舞者完美地单脚旋转,而不会摇晃。
然而,这里有一个问题。当你尝试使用 Muon 来训练这个小巧的 LoRA 耳机时,数学逻辑会崩溃。Muon 想要平衡机器人大脑的整个层级,但 LoRA 耳机只是该层级中一个微小的、低秩的切片。这就像试图用指挥棒来指导整个管弦乐队中的一名小提琴手,并希望这种指导能对整个乐队都有意义;这种几何结构根本无法匹配。标准的权宜之计是忽略管弦乐队,只让小提琴手独自旋转,但这却错失了 Muon 的精髓。这篇论文提出了一个问题:我们能否找到一种方法,让 Muon 在不破坏数学逻辑或不降低速度的情况下,也能适用于这些小巧的耳机?
作者 Ben Anson、Conor Houghton 和 Edward Milsom 给出了肯定的回答。他们引入了一种名为 sMuon(小型 Muon)的新方法。他们没有试图强行实现不可能的任务,而是使用了一个巧妙的数学技巧:他们将问题“线性化”。想象一下,你正试图在走钢丝的同时撑着一把巨大且摇晃的雨伞。与其试图同时平衡整把雨伞,不如假装雨伞在瞬间只是一根直棍,计算出最完美的步伐,然后再进行调整。通过这样做,他们找到了更新 LoRA 耳机的最佳方式,这种方式近似于完美的 Muon 舞蹈。
论文发现,这种新的 sMuon 方法效果惊人地好。当他们在各种语言模型上进行测试时,sMuon 的表现通常优于标准的 AdamW 教练和其他尝试使用 Muon 的方法。特别是在使用已经通过 Muon 进行过预训练(称为 Moonlight)的机器人进行测试时,sMuon 在 11 项不同任务中中有 6 项取得了最高分。在一次预训练实验中,sMoun 在降低误差率方面与表现最好的方法(名为 Riemannian 的方法)并列第一,但其速度比对手快了约 30%。
至关重要的是,作者证明了他们的方法不仅是一个理论构想,而且非常实用。虽然其他先进方法需要沉重、缓慢的计算(例如拆解并重新组装复杂的矩阵),但 sMuon 几乎完全依赖于简单的矩阵乘法——这类数学运算正是现代计算机芯片所擅长的极速运算。这意味着 sMuon 足够快,可以用于实际训练而不会拖慢进度。论文指出,通过尊重整个层的几何结构,而不是将 LoRA 部分视为独立、无关的碎片,我们可以以极小的额外成本获得显著的性能提升。这提醒我们,有时教给巨型机器人新技巧的最佳方式,是给它一个微小的、聪明的且在数学上优雅的推动。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。