← 最新论文
🤖 machine learning

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

该论文介绍了 DMuon,这是一个 Muon 优化器的开源分布式实现,它能够无缝集成到现有的训练流水线中,从而大幅降低优化器步进延迟并达到接近 AdamW 的效率,进而实现基于矩阵正交化的优化在大型基础模型中的规模化应用。

原作者: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

发布于 2026-06-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在训练一个巨大的机器人大脑(大型语言模型或具身智能)来学习。为了教它,你需要一个“优化器”——一个观察机器人的错误并调整其内部连接(权重)以使其变得更聪明的教练。

多年来,标准的教练一直是 AdamW。它就像一支由成千上万名微型工人组成的团队,每人负责修理机器人上的一个微小螺丝。它快速且高效,但它把每一个螺丝都视为独立的个体。

最近,人们发现了一个更聪明的教练,名叫 Muon。Muon 不再是一个个修理螺丝,而是观察整个机器人的“面板”(完整的数据矩阵)并同时调整它们。这种“团体治疗”的方法让机器人学习得更快,性能也更高。然而,它有一个代价:在分布式系统(由许多计算机组成的集群)上运行起来非常缓慢。

问题:“全员会议”瓶颈
在分布式训练设置中,机器人的大脑被拆分到了许多台计算机(GPU)上。

  • AdamW 就像一个远程团队:计算机 A 修理它的螺丝,计算机 B 修理它的螺丝,它们之间不需要进行太多交流。
  • Muon 就像一个委员会:为了修理一个面板,每台计算机都必须先看到整个面板。

在一种朴素的实现方式中,每一台计算机都必须停止手头的工作,下载来自所有人的完整数据,执行复杂的数学运算,然后将结果传回。这就像是在举行一场大规模会议,每个人都要在做任何决定之前先读完一份 1000 页的报告。这耗时太长了,以至于“会议”(优化步骤)所花费的时间比实际工作(学习步骤)还要长!事实上,论文指出这可能会导致 2 倍于 学习本身的时间成本!

解决方案:DMuon(分布式 Muon)
X Square 机器人团队 开发了 DMuon,这是一个让 Muon 运行速度几乎接近 AdamW 的新系统。他们通过改变团队的工作方式,而不是改变教练的数学原理,解决了这个瓶颈。

他们通过以下三个主要技巧解决了瓶颈:

1. “指定专家”策略(以所有者为中心的执行)

DMuon 不再让每个人都尝试修理每个面板,而是为每个面板分配 一台特定的计算机 作为“所有者”(Owner)。

  • 之前: 所有人聚集数据,所有人进行计算,所有人都在浪费时间。
  • 现在: 只有“所有者”计算机负责收集数据并进行繁重的数学运算。其他计算机则处于等待状态或进行其他工作。
  • 类比: 想象一个建筑工地。与其让每个工人尝试建造整栋房子,不如指派一名专家负责屋顶,另一名专家负责管道。其他人不去尝试建造屋顶,他们只是向专家递送所需的工具。这避免了重复劳动。

2. “传送带”系统(通信重叠)

当“所有者”正在进行数学运算时,其他计算机并不是闲置的。DMuon 创建了一个流水线:

  • 前向传播(Forward Pass): 当机器人在“思考”(处理数据)时,系统会在后台悄悄地将下一组工具发送给专家。
  • 反向传播(Backward Pass): 当机器人在“从错误中学习”时,系统已经在为专家收集下一批数据了。
  • 类比: 这就像餐厅的厨房。厨师(所有者)正在切菜。与其等待厨师切完菜再让服务员送下一份订单,不如在厨师切菜的同时,服务员就把下一个订单送过来。等待的时间被隐藏在了切菜的时间里。

3. “智能装配线”(批处理与调优)

Muon 进行的数学运算非常复杂。有时处理的部件很大(如一面巨大的墙),有时又很小(如一块小瓷砖)。

  • 问题: 如果你试图用一台巨大的机器去处理一块微小的瓷砖,机器就会处于闲置状态。如果你处理的是一面巨大的墙,则会耗费很长时间。
  • 解决方法: DMuon 将许多微小的瓷砖组合成一个单一的“批次”(Batch),使机器保持忙碌。它还使用了一个“调优器”,能够自动找到处理每种特定形状瓷砖的最快方式。
  • 类比: DMuon 不会为了一个信封就派一辆快递车,而是等待攒够一整车的信封后再统一发送。它还会根据目的地是城市还是农场,来改变卡车的路线。

结果

该论文在真实世界的模型上测试了 DMuon,包括一个机器人训练模型(Wall-OSS)和一个语言模型(Qwen2.5)。

  • 速度: DMuon 使“优化步骤”(即会议)比旧的朴素方式快了 6 到 163 倍
  • 效率: 现在训练一个步骤的总时间仅比标准的 AdamW 方法慢 2%
  • 结论: DMuon 让团队能够在不支付巨大时间惩罚的情况下,使用更优越的“团体治疗”式学习风格。它将一个缓慢、笨拙的过程变成了一个流畅、高效的过程,使其能够用于大规模 AI 模型的生产环境。

简而言之,DMuon 是一个交通控制系统,它让最聪明的教练(Muon)能够在计算机高速公路上运行而不会造成交通拥堵,终于使这种方式在训练下一代 AI 时变得切实可行。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →