← 最新论文
🤖 machine learning

Fantastic Pretraining Optimizers and Where to Find Them II: Hyperball Optimization

该论文介绍了 Hyperball,一种简单的优化器封装器,它通过将权重矩阵及其更新的 Frobenius 范数固定为常数值,从而解决了 Muon 等基于矩阵的优化器的性能扩展限制问题,并与标准的解耦权重衰减相比,在大型语言模型上实现了显著的等效 Token 加速和改进的学习率迁移。

原作者: Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

发布于 2026-06-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Kaiyue Wen, Xingyu Dang, Kaifeng Lyu, Tengyu Ma, Percy Liang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图教一个巨大且复杂的机器人(大型语言模型)说人类语言。为了做到这一点,你使用了一个“老师”(优化器),它通过根据机器人的错误一步步调整机器人的内部设置(权重)。

长期以来,最好的老师是 AdamW。最近,一种被称为 Muon 的更快的老师被发现了。Muon 就像是一辆跑车,而 AdamW 则是轿车;它通常能让机器人学习得更快。

然而,这篇论文的作者发现了一个问题:随着比赛变得越来越长,跑车的速度会变慢。 当我们把机器人做得更大、给它更多的数据去学习时,Muon 相比于 AdamW 的领先优势从巨大的 30% 缩减到了微小的 10%。

作者们问道:我们能否让跑车在比赛规模变得巨大时依然保持高速?

他们的答案是一个名为 Hyperball 的新工具。

问题所在:“软”刹车

在标准的训练方法中,老师使用了一种技术叫做“权重衰减”(weight decay)。你可以把它想象成一个软性的、隐形的刹车,每一步都会轻轻地将机器人的设置向零的方向挤压。

  • 目标: 这个刹车旨在防止机器人的设置变得过于狂野。
  • 问题: 随着机器人变得越来越大,这个软性刹车变得难以预测。它不仅控制着设置的大小,还意外地改变了机器人学习新方向的速度。这就像是在驾驶一辆汽车时,刹车一直在不断改变踩下的力度,使得驾驶起来既难保持高速又难以走直线。

解决方案:“Hyperball”

Hyperball 是一个包裹在任何老师(如 Muon 或 Adam)之外的“外壳”,它改变了游戏的规则。它不再使用软性刹车,而是将机器人的设置放入一个巨大的、刚性的、隐形的球体(即“Hyperball”)之中。

以下是它的工作原理,使用一个简单的类比:

  1. 球体: 想象机器人的设置是漂浮在一个巨大沙滩球表面上的一个点。这个沙滩球的大小是固定的。这个点可以在表面上任何地方移动,但它不能靠近或远离球心。它与球心的距离始终保持完全相同。
  2. 步骤: 当老师想要做出某种改变时,它会告诉机器人:“朝这个方向移动。”
  3. 反弹: 机器人朝着那个方向迈出一步。如果这一步会将它推离沙滩球的表面,Hyperball 会瞬间将其弹回表面,使它与球心的距离保持恒定。

为什么这更好

通过强制设置保持在球体表面,Hyperball 将两个之前混淆在一起的东西分离开来:

  • 大小: 设置的大小现在是固定且恒定的(就像沙滩球的半径)。
  • 方向: 机器人可以完全专注于转向的方向

论文认为,传统的“软刹车”(权重衰减)实际上是在间接地尝试做这件事,但过程非常混乱。Hyperball 则是直接去做这件事。

结果

作者在参数量高达 12 亿(这是一个非常大的规模)的模型上测试了它:

  • 速度: 使用 Muon 配合 Hyperball,机器人的学习速度比标准方法快了 20–30%。这是一个巨大的进步,尤其是相比于旧的 Muon 方法,后者在这个规模下仅有约 10% 的增益。
  • 稳定性: 调节不同模型规模的学习率变得更加容易。使用旧方法时,改变模型规模需要重新调整整个设置;而有了 Hyperball,同样的设置可以很好地适用于不同的规模,就像一把万能钥匙。

背后的理论

论文解释说,对于这类 AI 模型,设置所指向的方向才是学习的关键,而不是它们距离零的距离

  • 旧方法: 老师使用一个软性刹车来试图让距离保持在恰当的位置,希望这能让学习速度保持一致。
  • Hyperball 方法: 老师直接将距离锁定在从开始就设定好的完美固定大小。这让老师能够纯粹地专注于引导机器人转向正确的方向。

总结

Hyperball 是一个简单的技巧,它强制 AI 的内部设置保持固定的尺寸,就像一个在球面上移动的点。这消除了传统“刹车”方法带来的混乱,使得像 Muon 这样先进的优化器即使在 AI 模型规模变得极其庞大时,也能保持高效和快速。它将一个混乱、间接的过程变成了一个清晰、直接的过程。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →