← 最新论文
💻 computer science

AMUSE: Anytime Muon with Stable Gradient Evaluation

本文介绍了 AMUSE,一种新的优化器,它将 Muon 的快速批量进展与免调度平均相结合,以稳定训练并消除对学习率调度表的依赖,从而在视觉和语言任务中实现卓越性能。

原作者: Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

发布于 2026-05-22
📖 1 分钟阅读☕ 轻松阅读

原作者: Jueun Kim, Baekrok Shin, Jihun Yun, Beomhan Baek, Minhak Song, Chulhee Yun

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是论文《AMUSE:具有稳定梯度评估的任意时刻 Muon》的通俗解释,辅以生动的类比。

宏观图景:训练 AI 如同登山

想象你正在教一台计算机(神经网络)学习一项技能,比如识别猫咪或撰写故事。为此,计算机必须“下山”,穿越一座巨大而复杂、充满误差的山脉,以抵达谷底(即完美解)。

这座山的形状十分棘手,并非平滑的斜坡。

  • 河流:存在一个宽阔、平坦且平缓的谷底,你可以在这里快速行走并取得巨大进展。真正的学习就发生在这里。
  • 山谷壁:在谷底两侧,地面极其陡峭且崎岖。如果你向山壁迈出太远,就会剧烈地来回反弹,浪费能量却寸步难行。

现有方法的问题

长期以来,攀登这座山的标准方法(使用名为 AdamW 的优化器)就像是一位依赖严格地图的徒步者。地图精确地告诉他们该走多快、何时减速。如果徒步者无视地图,就会迷路。

最近,出现了两种新的徒步策略:

  1. 无调度(Schedule-Free, SF):这就像一位不需要地图的徒步者。他们只需持续前行,但偶尔会回顾来路,以确保自己保持在平坦的谷底。他们非常稳定,但有时起步稍慢。
  2. Muon:这是一位全新、超快的徒步者。他们有一个特殊技巧:能“拉直”步伐,避免被困在陡峭的山壁上。他们在河流中冲刺的速度极快。然而,由于他们速度太快且过于激进,有时会撞向山谷壁,导致身体摇晃并失去稳定性。

解决方案:AMUSE

这篇论文的作者意识到,Muon 速度快但不稳,而无调度(Schedule-Free)稳定但有时缓慢。他们希望结合两者的优点。

他们创造了 AMUSE(具有稳定梯度评估的任意时刻 Muon)。

类比:具备“智能插值”能力的徒步者

想象你正驾驶汽车沿着蜿蜒的道路(河流)行驶。

  • Muon 就像以 100 英里/小时的速度驾驶跑车。你到达得很快,但如果遇到颠簸(陡峭的山壁),可能会失控。
  • 无调度(Schedule-Free) 就像以 40 英里/小时的速度驾驶重型卡车。你非常稳定,但到达目的地需要很长时间。

AMUSE 则像一位根据时间调整驾驶风格的智能司机:

  1. 旅程初期(开始阶段):司机处于跑车模式。他们像 Muon 一样快速行驶,以迅速起步并覆盖路程。他们愿意承担一些风险以加快速度。
  2. 旅程后期(结束阶段):随着接近目的地,司机逐渐切换到“卡车模式”。他们开始更多地关注迄今为止走过的平均路径,平滑转弯。这阻止了他们撞向山壁,并确保他们始终完美地保持在平坦的河床之上。

AMUSE 的工作原理(技术魔法)

论文使用“时变系数”(一种随时间变化的旋钮的 fancy 说法)来解释这一点。

  • 旋钮(βt\beta_t:在开始时,旋钮设定为聚焦于“快速”路径。随着训练继续,旋钮缓慢转动,聚焦于“稳定”路径。
  • 结果:AMUSE 在开始时拥有 Muon 的速度,在结束时拥有无调度(Schedule-Free)的稳定性。它不需要预先编写的地图(学习率调度)来告知何时减速;它能自行判断。

论文发现

作者在许多不同的“山脉”(任务)上测试了这种新方法:

  • 图像识别:教计算机识别图片(如猫、狗或手写数字)。
  • 大型语言模型:训练 AI 撰写和理解文本(如聊天机器人背后的模型)。

结果:

  • 更快:AMUSE 达到了与其他方法相同的高质量结果,但所需步数更少。例如,在大型语言模型任务上,它比次优方法快 1.5 倍 到达终点。
  • 稳定:它不像 Muon 有时那样摇晃或崩溃。
  • 任意时刻(Anytime):你可以在任何时刻停止训练,模型都会处于良好状态。你不必等待特定的“训练结束”时刻才能获得好结果。

总结

这篇论文介绍了 AMUSE,一种用于训练 AI 的新工具。它通过借用 无调度(Schedule-Free) 优化的稳定性技巧,解决了快速但不稳的 Muon 优化器的不稳定性问题。

这就像一位知道何时冲刺、何时稳步行走的徒步者,确保他们能更快抵达山底,而不会从侧面跌落。论文声称,该方法在图像和文本任务上均优于当前的标准方法,且无需复杂的调度管理。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →