← 最新论文
🤖 machine learning

Muonp^p: Muon with Fractional Spectral Powers

本文介绍了 Muonp^p,这是一种通过对梯度的奇异值应用分数谱幂,并利用高效的双变量递推关系来近似这些更新,从而在 Muon 与梯度下降之间进行插值的创新优化器,该优化器在微调十亿级参数模型时展示了提升的性能,同时保留了有价值的奇异谱信息。

原作者: Yihe Dong, Will Sawin

发布于 2026-06-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yihe Dong, Will Sawin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个巨大的、超级聪明的机器人(神经网络)如何说话、写代码或解决数学问题。为了教它,你必须展示示例并纠正它的错误。这个“优化器”(optimizer)就是老师用来决定在每次犯错后如何调整机器人大脑的方法。

问题所在:“全有或全无”型老师 (Muon)

最近,一种名为 Muon 的流行教学方法变得非常有名。它是这样工作的:

想象一下,机器人的错误来自于不同的“方向”或“频率”。有些方向非常响亮且明显(主导模式),而有些方向则是微弱的低语(小的奇异值)。

  • 旧型老师(比如标准的梯度下降法)会对响亮的纠正大声疾呼,却忽略那些微弱的声音。
  • Muon 决定做一个“平坦”的老师。它观察所有的方向,然后说:“让我们把它们都对待得完全一样!”它压平了每个纠正信号的音量,使得微弱的低语也能获得与响亮的呐喊同等的关注。

代价是: 虽然这在从零开始教机器人(预训练)时非常棒,但它丢弃了一个至关重要的信息:每个方向到底有多强。有时候,响亮的方向才是真正重要的,而压平它们就像仅仅为了听清一声低语就调低警报器的音量一样。

解决方案:“恰到好处”型老师 (Muonp)

这篇论文的作者引入了 Muonp。把 Muonp 想象成一个找到了“金发姑娘区”(指恰到好处的中间地带)的老师。

它不像 Muon 那样完全压平音量,也不像标准老师那样保留原始的响度,而是将音量调低了一点点。它使用了一个数学上的“调光开关”(由一个被称为 p 的数字表示),在给予微弱方向提升的同时,保留了一些原始响亮方向的力量。

  • 如果 p = 0: 就是原始的 Muon(完全压平)。
  • 如果 p = 1: 就是标准老师(没有任何改变)。
  • 如果 p 在两者之间(比如 1/3): 就是 Muonp。它保留了纠正信号的“形状”,但将其平滑化了。

难点所在:神奇的数学技巧

你可能会想:“好吧,只需把音量调低一点就行了。”但在巨型矩阵(机器人的大脑)的世界里,进行这种数学运算是非常困难的。通常,要改变这些方向的音量,你必须拆解大脑,测量每一个部分,然后再把它组装回去。这既慢又昂贵。

作者证明了你不能用一个简单的、单步的配方来完成这种“音量调节”。你需要一个更复杂的、两步走的配方,既要记住原始的大脑结构,又要调整音量。

他们发明了一种新的、快速的配方(使用所谓的“二元多项式递归”),这就像是一个神奇的捷径。它允许计算机仅使用标准的矩阵乘法来计算这些“经过调光的”纠正信号——而这些计算正是现有的快速计算芯片(GPU)所擅长的。这意味着 Muonp 和 Muon 一样快,但更聪明。

他们的发现:取决于工作内容

论文在十亿级规模的模型上测试了这个新老师,并发现了一个有趣的现象:

  1. 构建一个新大脑时(预训练):
    如果你是从零开始教一个机器人,那么“平坦”的老师(Muon)实际上更好。你希望平等地探索每一个可能的方向,以建立一个强大的基础。而 Muonp 因为保留了旧有的“响亮”方向,在这里的表现略逊一筹。

  2. 微调专家时(微调):
    如果你拿一个已经很聪明的机器人,并教它一项特定的新技能(比如编程或数学),Muonp 就是赢家。

    • 为什么? 到这个阶段,机器人已经掌握了基础知识。而“响亮”的方向正是完成新任务的关键。Muonp 在帮助微弱方向的同时,依然保持了对这些重要方向的关注。
    • 结果: 在数学推理、编程和语言理解等任务上,Muonp 让机器人的学习变得更聪明、更快、更准确,表现优于原有的 Muon 和标准老师。

“课程”理念

作者还尝试了一个聪明的技巧:他们在训练的大部分时间里使用“平坦”的老师(Muon),然后在最后几个步骤中切换到“调光”的老师(Muonp)。这效果惊人地好。这就像是用粗笔刷教学生基础知识,然后在最后的细节处理阶段换上一支精细的针管笔。

总结

Muonp 是流行优化器 Muon 的一个更聪明、更灵活的版本。它并不强制要求所有的学习方向都完全相等;相反,它温和地调整了它们的重要性。

  • 数学层面: 它使用了一个巧妙且快速的捷径,在不减慢计算机速度的情况下计算这些调整。
  • 结果: 它是微调大型 AI 模型的最佳工具,能比以往更好地帮助它们掌握编程和数学等特定技能。然而,对于从零开始训练,原始的“平坦”型 Muon 仍然是冠军。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →