When to use what Schatten- norm in deep learning?
本文通过证明虽然像 Muon 这样具有 Schatten- 特性的方法在高维设置下表现出色,但在如 Chinchilla 缩放等低维机制中,较小的 Schatten- 几何结构实际上才是最优的,从而解决了关于 Schatten- 范数优化器的矛盾观察结果,这一发现得到了针对 的新型噪声鲁棒加速结果的支持,该结果同时也解释了 Muon 对预热阶段的需求缺失及其对大批次的偏好。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
核心问题:我们应该使用哪把“尺子”?
想象你正在试图寻找一个广阔、多雾的山谷中的最低点(这代表着正在学习的 AI 模型)。为了做到这一点,你需要一把“尺子”来测量地面的陡峭程度,并决定下一步往哪个方向走。
在深度学习的世界里,有不同类型的尺子,被称为 Schatten-p 范数 (Schatten-p norms)。
- Schatten-2 (欧几里得/Euclidean): 这是我们通常使用的标准直线尺(例如名为 Adam 的优化器)。
- Schatten-∞ (即 “Muon” 尺): 这是一把特殊的、刚性的尺子,它只关心景观中最陡峭的那一个悬崖。最近,一种使用这种尺子的名为 Muon 的方法变得非常流行,因为它在某些测试中表现得极其迅速。
- Schatten-p (“金发姑娘/适中” 尺): 这些是介于两者之间的尺子,它们测量坡度的方式既不会太软,也不会太硬。
争议点:
人们一直在争论哪把尺子最好。
- 有人说:“Muon (Schatten-∞) 太棒了!它是最快的!”
- 也有人说:“不,Muon 被高估了。当我们使用海量数据进行训练时,标准方法效果更好。”
论文的答案:
作者 Thomas Pethick 表示:“你们都对,但你们观察的是不同规模的山谷。”
最好的尺子完全取决于问题的规模相对于你拥有的数据量的大小。
两个阶段:小水池 vs 大海洋
论文将世界分为两个主要场景:
1. “低维”阶段 (The Low-Dimensional Regime,即“小水池”)
- 定义: 当你的模型相对较小,或者训练过程较短时(例如论文中提到的小型游戏“速通”测试),这种情况就会发生。你进行的步数(数据)远大于模型的复杂度。
- 类比: 想象你正走在一个光线充足的小花园里。你可以看到整条路径。
- 最佳尺子: 在这种情况下,Schatten-∞ 尺 (Muon) 其实并不是最好的。令人惊讶的是,使用一个更小的 p 尺(更接近标准的欧几里得尺)速度会更快。
- 原因: 因为在小花园里,你不需要过度专注于那一个最陡峭的悬崖。你需要一种更平滑、更平衡的方法来快速加速。论文证明,在这里使用“更软”的尺子可以为你带来加速效果。
2. “高维”阶段 (The High-Dimensional Regime,即“大海洋”)
- 定义: 这是用于大型 AI 模型(如 LLM)的大规模训练过程,此时模型极其复杂,数据也极其庞大。
- 类比: 想象你在一个拥有数千个岛屿的巨大、黑暗的海洋中航行。你无法看到完整的地图。
- 最佳尺子: 在这里,Schatten-∞ 尺 (Muon) 表现出色。它旨在处理这些大规模、复杂景观中特有的“粗糙感”。
- 关键点: 要让 Muon 在这个大海洋中发挥作用,你需要一个巨大的 Batch Size(批大小)(即同时观察海洋中非常宽阔的一片区域)。如果你尝试在这一阶段使用较小的 Batch Size 来使用 Muon,它就会失效。
“Batch Size” 的秘密
论文的一个核心发现是关于 Batch Size(AI 在采取下一步之前观察了多少个样本)的问题。
- 规则: 论文推导出了一个数学规则,表明当你改变尺子(从 到 )时,理想的 Batch Size 也必须随之改变。
- 隐喻: 把尺子想象成一艘船。
- 小船 (标准尺) 可以由较少的船员(小 Batch Size)来驾驶。
- 巨型豪华邮轮 (Muon/Schatten-∞) 需要庞大的船员团队(巨大的 Batch Size)才能保持稳定并快速移动。如果你试图仅用两个人来驾驶一艘豪华邮轮,它只会原地打转。
- 洞察: 这解释了为什么 Muon 在“速通”(人们在小模型上使用大规模 Batch)中表现出色,但在某些大规模基准测试中却表现挣扎(因为 Batch Size 没有针对特定的几何结构进行足够的规模化提升)。
为什么我们需要“预热 (Warmups)”?
你可能听说过某些 AI 训练器需要“预热”(即先慢后快地开始)。
- 论文的发现: Schatten-∞ 尺 (Muon) 非常鲁棒,以至于它不需要预热。它可以立即以全速启动。
- 对比: 如果你在低维阶段使用较小的 尺,你确实会从预热阶段中受益,以带动加速过程。
与 “Chinchilla” 的联系
论文将此与 AI 领域著名的 Chinchilla 缩放法则 (Chinchilla scaling) 联系起来,该法则指出:“随着数据的增加,你应该让模型变得更大。”
- 转折点: 论文认为,即使遵循 Chinchilla 缩放法则,我们往往仍然处于**“低维阶段”**(即那个“小花园”)。
- 结果: 因为我们经常处于这个“小花园”阶段,使用标准的 Muon (Schatten-∞) 实际上可能不如使用有限 范数优化器(如 HTMuon 或 Soft-Muon)高效。这解释了为什么使用更“软”尺子的新方法在一些大规模测试中开始超越 Muon。
总结:如何选择你的尺子
论文最后给出了一个简单的指南:
如果你处于“低维”阶段(模型较小,或者数据量相对于模型大小非常巨大):
- 不要自动使用极端的 Schatten-∞ (Muon)。
- 应该考虑使用有限的 Schatten- 范数(一种“更软”的尺子)。它加速更快,且能更好地处理噪声。
- 注意: 你甚至可以在训练过程中更换尺子!可以先用“硬”尺子开始,稍后再切换到“更软”的尺子。
如果你处于“高维”阶段(复杂度极高):
- Schatten-∞ (Muon) 很可能是正确的选择,但是你必须使用非常大的 Batch Size 才能让它奏效。
底线: 没有单一的“最佳”优化器。最好的工具取决于问题的规模以及你拥有的数据量。社区中的困惑在于,人们在没有意识到自己在处于不同“阶段”的情况下,就在不同的阶段测试这些工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。