← 最新论文
🤖 machine learning

Optimistic Dual Averaging Unifies Modern Optimizers

本文介绍了 SODA,它是乐观对偶平均的一种推广,将 Muon 和 Lion 等现代优化器统一于单一框架之下,并提供一个实用的包装器,可自动消除权重衰减调参的需求,同时在各种训练规模下持续提升性能。

原作者: Thomas Pethick, Wanyun Xie, Roman Machacek, Volkan Cevher

发布于 2026-05-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Thomas Pethick, Wanyun Xie, Roman Machacek, Volkan Cevher

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试教一个庞大而复杂的机器人(即深度学习模型)如何行走。该机器人通过迈步来学习,但有时会绊倒、跨步过大,或被嘈杂的指令搞得晕头转向。为了帮助它更快、更稳定地学习,工程师们会使用“优化器”——这些是决定每一步应有多大、朝哪个方向走的数学配方。

在过去十年里,研究人员发明了许多新颖的配方(如 Adam、Lion、Muon 和 NAdam)。每种配方都有其独门秘方,但它们似乎都因不同原因而表现良好。问题在于,调整这些配方就像在没有食谱的情况下试图烤出一个完美的蛋糕:你必须为每一个新的模型规模和训练时长,猜测合适的“权重衰减”(一个防止机器人行为失控的旋钮)的数值。

本文介绍了SODA(随机乐观对偶平均)。请将 SODA 视为一种通用烘焙封装器,而非一种新的蛋糕配方;你可以将它套用在任何现有配方之上,使其自动表现更佳。

以下是其工作原理的分解,辅以简单类比:

1. “乐观”的前瞻

大多数优化器就像只盯着正前方道路的司机。他们看到颠簸,做出反应并转向。
SODA则像一位会略微向前看的司机。它利用一种称为“乐观”的技术,在到达之前预测道路将要呈现的状态。

  • 类比:想象你正走在走廊里。标准优化器会等到你撞上墙才转向。而“乐观”优化器会提前看到墙,稍微前倾,并在你撞上之前转向。这防止了机器人左右摇摆,使其移动更平滑、更迅速。

2. “对偶平均”的记忆

优化器还需要记住过去。它们是记住曾经迈出的每一步,还是只记住最后一步?
SODA使用一种称为“对偶平均”的方法。它不仅仅对当前步骤做出反应,而是保持对其所感受到的所有“推力”(梯度)的累积平均值。

  • 类比:想象一位徒步者试图在雾蒙蒙的山谷中找到最低点。
    • 标准优化器:“我感觉左边有下坡,所以我向左走一步。”
    • SODA:“十步之前我感觉左边有坡,五步之前感觉右边有坡,而此刻又感觉左边有坡。如果我将所有这些‘感觉’取平均,真正的路径实际上是略微偏左前方。”
      通过对时间上的“感觉”(梯度)进行平均,SODA 过滤掉了噪声,更可靠地找到了真正的路径。

3. “魔法封装器”(无需再调整)

AI 工程师最大的头疼问题是权重衰减。这是一个设置,像一条“牵引绳”一样,防止机器人的步伐变得过于狂野。

  • 旧方法:你必须猜测完美的牵引绳长度。如果机器人很小,你需要短绳;如果机器人巨大,你需要长绳。如果你训练时间很长,还需要再次调整牵引绳长度。这是一场持续的猜测游戏。
  • SODA 方法:作者发现,如果你用 SODA 封装任何优化器(如 Adam 或 Muon),你就不再需要猜测牵引绳长度了
    • SODA 根据一条简单规则自动调整牵引绳:1 除以目前已采取的步数
    • 类比:想象一条随着你行走距离增加而自动缩短的牵引绳。你无需握住牵引绳;牵引绳确切地知道在第 1 步、第 100 步或第 10,000 步时应该有多紧。

4. 他们证明了什么?

该论文声称,SODA 将许多现代最佳优化器(如 Muon、Lion 和 NAdam)统一在一个单一的数学框架之下。它表明,这些不同的“花哨”方法实际上只是同一“乐观平均”思想的特殊版本。

结果

  • 性能提升:当作者用 SODA 封装流行优化器时,模型学习得更快,并达到了更低的误差率。
  • 无需额外工作:他们无需调整任何新旋钮。只需应用该封装器即可。
  • 超越最佳:在他们的测试中,SODA 甚至击败了原始优化器的“最佳调优”版本。原始优化器需要人类仔细调整权重衰减才能获得良好结果;而 SODA 自动完成这一过程,且做得更好。

总结

SODA想象成一种“智能自动驾驶仪”,你可以将其安装在任何现有的汽车引擎(优化器)上。

  1. 向前看(乐观)以避免颠簸。
  2. 记住旅程(平均)以保持航向。
  3. 它根据你已行进的距离自动调整刹车(权重衰减),因此你无需猜测该用多大力度刹车。

该论文得出结论,这种简单、自动的调整使大型 AI 模型的训练更加稳定、快速,且更少依赖人类的猜测。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →