← 最新论文
🤖 machine learning

Muown: Row-Norm Control for Muon Optimization

本文介绍了 Muown,一种即插即用的优化器,它通过显式控制行幅度向量来防止 Muon 中的谱范数漂移,从而提升训练稳定性、降低对权重衰减的敏感性,并在各种模型规模下实现更优的困惑度。

原作者: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Kai Lion, Florian Hübler, Bingcong Li, Antonio Orvieto, Niao He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个巨大的数字大脑(大型语言模型),让它写故事、解决数学问题或与你聊天。为此,这个大脑必须通过调整其电路内部数百万个微小的旋钮(权重)来学习。

很长一段时间以来,调整这些旋钮的最佳方法是一种名为 AdamW 的技术。最近,一种名为 Muon 的更快新方法出现了。这就像从自行车换成了跑车;它学得更快、更好。但有一个问题:这辆跑车有失控加速的倾向。

问题所在:“漂移”的引擎

该论文指出了 Muon 的一个具体问题。随着模型训练的进行,其内部连接的“大小”(具体而言,是权重矩阵中行的强度)开始不受控制地增长。

想象一下正在被充气的 balloon

  • Muon 非常擅长判断往哪个方向吹气球(方向)。
  • 然而,它不断泵入过多的空气,导致气球越变越大,直到可能爆裂(数值错误)或变得不稳定。
  • 标准的解决方法是用一根绳子系住气球,每当它变得太大时就拉紧(权重衰减)。但作者发现,这就像用大锤砸坚果:它拖慢了学习过程,因为它挤压了整个气球,包括那些原本正常的部分。

诊断:问题的两个部分

由 Kai Lion 领导的作者们决定深入气球内部,看看究竟是什么在增长。他们意识到,连接的“大小”由两个截然不同的部分组成:

  1. 幅度(Magnitude,即体积): 这行数字整体的大小。
  2. 相干性(Coherence,即形状): 该行内部数字彼此之间的排列方式。

他们发现,只有幅度(Magnitude)在失控漂移。形状(相干性)实际上表现完美,保持稳定。气球并没有改变形状,只是变大了。

解决方案:Muown(智能泵)

作者们创造了一种名为 Muown 的新优化器。

Muown 不再将整个连接视为一个巨大的整体,而是将工作分为两个独立的任务:

  1. 方向团队(Muon): 这个团队继续做 Muon 最擅长的事:确定更新权重的完美方向。他们保持这部分不变。
  2. 体积团队(新): 这是新的部分。他们提取“幅度”(体积),将其视为一个独立的显式变量。他们为这个体积设定了一套特殊的规则(一种特定的数学几何结构,称为 \ell_\infty),以防止其增长过快。

类比:
想象你正在驾驶一辆汽车,其中方向盘和油门踏板被卡在一起。如果你转动方向盘,油门踏板也会被推动,导致汽车失控加速。

  • Muon 就像那辆被卡住的汽车。
  • Muown 就像将方向盘与油门踏板解耦。你仍然可以完美地转向(使用 Muon 的逻辑),但现在你为油门踏板(幅度)配备了一个独立的、智能的巡航控制系统,它能在不拖慢速度的情况下,将速度精确保持在所需位置。

结果

该论文在从较小(1.24 亿参数)到非常大(27 亿参数)的模型上测试了这种方法。以下是他们的发现:

  • 更好的性能: Muown 始终产生比 Muon、AdamW 和其他竞争对手更好的结果(更低的“困惑度”,即衡量模型困惑程度的指标)。
  • 更具容错性: 使用 Muon 时,你必须非常小心地设置参数(学习率)。如果选错了,模型就会失败。Muown 则稳健得多;它在广泛设置下都能表现良好,就像一辆拥有更宽“最佳驾驶区间”的汽车。
  • 无额外成本: 通常,添加新的控制系统会拖慢汽车。但由于作者将这种新的“音量控制”直接集成到引擎现有的工作流程中,它几乎为训练过程增加了额外的时间。
  • 稳定性: “气球”不再漂移。谱范数(连接的大小)保持稳定,防止了原始 Muon 所遭受的数值错误。

总结

该论文认为,流行的 Muon 优化器中的不稳定性并非其方向定位能力的缺陷,而是缺乏对其更新“音量”的控制。通过将“音量”与“方向”分离,并使用不同的专用工具对它们进行控制,Muown 在无需像权重衰减那样生硬修复的情况下,保持了训练的快速与稳定。它是一个即插即用的替代方案,使训练过程更平滑、更快、更可靠。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →