← 最新论文
🤖 machine learning

Convergence Bound and Critical Batch Size of Muon Optimizer

本文为 Muon 优化器在各种设置下的理论收敛性证明提供了依据,证明了权重衰减可以在不需要有界梯度假设的情况下确保参数和梯度范数有界,并推导出了一个由超参数决定的关于控制其训练效率的关键批次大小的下界。

原作者: Naoki Sato, Hiroki Naganuma, Hideaki Iiduka

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Naoki Sato, Hiroki Naganuma, Hideaki Iiduka

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大且复杂的机器人(神经网络)如何识别照片中的猫或者编写故事。为了做到这一点,你需要一个“教练”(优化器)来告诉机器人如何调整其内部设置以变得更好。长期以来,标准的教练一直是 AdamW,它是一个非常可靠的训练员。但最近,一位名叫 Muon 的新教练出现了,它在实践中展现出了惊人的成果。

这篇论文就像一份侦探报告,试图解释为什么 Muon 如此出色,并为我们提供了一套最高效的使用规则手册。以下是其内容的简单拆解:

1. 核心思想:观察形状,而非仅仅是列表

大多数教练将机器人的大脑视为一个巨大的、杂乱无章的数字列表。它们观察误差并说:“把这个数字调高,把那个数字调低。”

Muon 则不同。它将机器人的大脑视为一组**形状(矩阵)**的集合。

  • 类比: 想象你正试图抚平一张揉皱的纸。
    • 旧教练 (AdamW): 它们试图通过随机推动纸上的单个点来使其平整。这行得通,但有点杂乱。
    • Muon: 它观察整张纸。它意识到这张纸具有特定的“褶皱”或结构。它不仅仅是在推动,而是执行了一种特殊的动作(称为正交化),沿着纸张自然的纹理将其抚平。它找到了最“干净”的移动方向,忽略了误差信号有多大或多嘈杂。

2. “稳定性”的秘密:刹车踏板

研究发现了一个使用 Muon 时的一个关键规则,即利用一个被称为权重衰减 (Weight Decay) 的功能(它充当了防止机器人变得过于狂野的刹车)。

  • 发现: 在你推挤机器人有多用力(学习率 Learning Rate)与你踩刹车有多重(权重衰减 Weight Decay)之间,存在着严格的关系。
  • 规则: 如果你推得太猛而刹车不够,机器人就会失控。论文从数学上证明了“推力”绝不能超过“刹车”的能力。具体来说,学习率必须小于 1 / 权重衰减
  • 结果: 当你遵循这一规则时,机器人的设置会保持在安全、可预测的范围内。它不会爆炸或变得疯狂。这是一个巨大的优势,因为这意味着你不需要假设误差是很小的;数学保证了机器人本身就能保持稳定。

3. “甜点级”批大小(关键批大小)

在训练这些机器人时,你可以一次只给它们看一张照片,或者一次给它们一堆照片(一个批次/Batch)。

  • 问题: 如果你展示的照片太少,机器人学习得很慢。如果你展示的照片太多,计算机虽然在处理这一堆照片,但机器人的学习速度并不会因此大幅提升。存在一个“金发姑娘”点(既不过头也不不足),在那里你可以用最少的计算工作获得最多的学习效果。这被称为关键批大小 (Critical Batch Size)

  • Muon 的秘诀: 论文推导出了针对 Muon 的这个“金发姑娘”点的公式。

    • 动量因子 (Momentum Factor): Muon 使用了一种“动量”设置(就像一个沉重的飞轮,让机器人在同一方向上持续运动)。论文发现,如果你调高动量(让飞轮变得更重),“金发姑娘”批大小就会变。你可以使用更小的批次,且依然保持高效。
    • 刹车因子 (Brake Factor): 如果你使用更强的刹车(权重衰减),“金发姑娘”批大小就会变。你需要一次向机器人展示更多的照片才能获得最佳效率。

4. 为什么这很重要(“秩”的优势)

论文解释了 Muon 之所以高效,是因为它理解机器人的大脑其实并没有看起来那么复杂。

  • 类比: 想象一个 100x100 的灯阵(10,000 盏灯)。大多数时候,实际上只有少数灯光模式在亮起。其余的都只是噪声。
  • Muon 的优势: Muon 意识到“真实”的信息是低秩的(简单的模式)。它忽略了噪声。因此,它不需要庞大的批次大小就能找准方向。与其他方法相比,它可以利用较小的批次进行有效学习,从而节省时间和能源。

研究总结

  1. 它有效: 论文证明了 Muon 在四种不同的设置下(有/无动量,有/无权重衰减)都能实现收敛(成功学习)。
  2. 它稳定: 使用带有正确学习率的权重衰减,可以保证机器人不会失控,即使在不假设误差很小的情况下也是如此。
  3. 它高效: 论文给出了寻找完美批大小的公式。
    • 高动量 = 你可以使用更小的批次。
    • 高权重衰减 = 你应该使用更大的批次。
  4. 现实检验: 作者在图像识别(猫/狗)和语言模型(文本生成)上进行了测试。实验证实了数学与现实相符:特别是在根据他们的新规则调整批大小时,Muon 比旧的标准方法 AdamW 更快、更高效。

简而言之,这篇论文将一个在实践中表现良好的“黑盒”优化器拆解开来,解释了其内部机制,证明了它的安全性,并准确地告诉你在如何调整它以获得最大速度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →