← 最新论文
🤖 machine learning

How Much Orthogonalization Does Muon Need?

本文表明,一种低成本的五步三次牛顿-舒尔茨(Newton–Schulz)正交化方案实现了与更昂贵的 Muon 变体相当的训练质量,这揭示了高极分解精度对于有效的神经网络训练而言并非严格必要。

原作者: Hua Huang

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Hua Huang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个庞大且复杂的机器人(神经网络)完成一项新任务。为了帮助它学习,你给了它一个“动量”更新——这是基于它过去的经验,给它一个它认为正确的方向上的推力。然而,有时这个推力会变得混乱或“扭曲”,就像一辆试图在湿滑路面上转弯的汽车,轮子在不同的方向上空转。

Muon 优化器是一个旨在解决这些混乱推力的工具。它接收那个扭曲的更新,并将其“拉直”,使机器人的移动更加高效。在数学上,这种拉直的过程被称为正交化(orthogonalization)。你可以把它想象成拿一张皱巴巴的纸去熨平它,让上面的线条变得完全笔直且相互垂直。

问题:这种“熨烫”需要达到多“完美”?

这篇论文提出了一个非常实际的问题:我们需要把这些更新熨烫得多么完美?

在数学世界中,存在着“完美”的熨平矩阵的方法(比如使用一种昂贵且耗时的顶级熨斗)。标准的 Muon 方法使用了一个复杂的五步过程(称为“五次方”方法)来使更新非常接近完美。这就像是使用一台专业的蒸汽熨斗:需要经过 15 次熨烫才能让纸张完全平整。

作者们想知道:我们真的需要它那么完美吗?或者我们是否可以用一种更快、更便宜的方法让机器人学得一样好?

解决方案:“三次方”捷径

作者们开发了一种新的、更简单的算法,称为 Cubic5

  • 旧方法 (Muon-Jordan): 使用一个复杂的五步公式,需要进行 15 次重型计算(矩阵乘法)来拉直更新。
  • 新方法 (Cubic5): 使用一个更简单的五步公式,仅需要 10 次重型计算

你可以这样理解:

  • 旧方法 就像雇佣一个 15 人的团队来仔细折叠一张地图。
  • 新方法 就像雇佣 10 个人,他们能同样好地折叠地图,但花费的时间更少。

他们通过意识到,对于 AI 训练而言,这个“推力”并不需要数学意义上的绝对完美。它只需要“足够好”,以保持机器人的有效学习。他们设定了一个“放宽的目标”:只要更新大致是笔直的,机器人就能学得很好。

他们的发现:“足够好”其实也非常棒

研究人员将他们新的 “Cubic5” 方法与旧的“完美”方法,甚至与一个理论上的“完美”方法(使用一种名为 SVD 的超精确数学工具)在不同的 AI 模型上进行了对比测试,涵盖了从小型模型(如 GPT-2)到拥有数十亿参数的大型模型。

以下是他们的发现:

  1. 训练质量相同: 无论他们使用的是昂贵的 15 步方法、新的 10 步方法,还是那个超精确的数学工具,AI 模型最终学到的程度几乎完全一样。最终的“得分”(验证损失)几乎是相同的。
  2. 步骤并不总是越多越好: 令他们惊讶的是,在“完美”方法中增加更多步骤并不总能让 AI 学得更好。有时,更简单的方法效果同样出色。
  3. “熨烫”不需要完美: 最重要的发现是,AI 并不在乎更新在数学上是否“完美”。它在乎的是更新是否“有用”。新的、更便宜的方法足以重新塑造更新,使其满足 AI 学习的需求,而不会在不必要的精度上浪费时间。

核心结论

论文得出结论:Muon 不需要被完美正交化也能表现出色。

新的 Cubic5 方法是一种“低成本”的替代方案。它节省了大约 三分之一的计算工作量(即拉直更新所需的重体力活),同时产生的效果与那些更昂贵的方法几乎没有区别。

用日常语言来说: 如果你在烤蛋糕,旧方法就像是用激光秤精确到微克地测量面粉。新方法则像是使用一个标准的量杯。论文证明了,对于这个特定的配方(训练 AI),标准量杯的效果与激光秤一样好,但它更快、也更容易使用。这使得 AI 可以在不牺牲最终结果质量的前提下,训练得更快。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →