← 最新の論文
🤖 machine learning

DMuon: Efficient Distributed Muon Training with Near-Adam Overhead

本論文は、既存の学習パイプラインにシームレスに統合され、オプティマイザーステップのレイテンシを劇的に削減しつつAdamWに近い効率性を実現することで、大規模な基盤モデルにおける行列直交化に基づく最適化のスケール可能な利用を可能にする、Muonオプティマイザのオープンソースの分散実装であるDMuonを導入するものである。

原著者: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

公開日 2026-06-26
📖 1 分で読めます☕ さくっと読める

原著者: Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang, Shalfun Li, Ryan Yu, Lucy Liang, Hang Su, Roy Gan, Hao Wang, Qian Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なロボットの脳(大規模言語モデルや、身体性AI)を訓練している場面を想像してください。それを教えるためには、「オプティマイザー(最適化アルゴリズム)」、つまりロボットのミスを見て、その内部の接続(重み)を調整し、より賢くするための「コーチ」が必要です。

長年、標準的なコーチは AdamW でした。これは、何千人もの小さな作業員が、一度に一つの小さなネジを直していくようなものです。高速で効率的ですが、それぞれのネジを独立して扱います。

最近、Muon という、よりスマートな新しいコーチが発見されました。Muonは、ネジを一つずつ直す代わりに、ロボットの「パネル全体(データ行列)」を見て、それらをまとめて調整します。この「グループセラピー」的なアプローチにより、ロボットはより速く学習し、より高いパフォーマンスに到達できます。しかし、一つ問題があります。Muonは、分散システム(多くのコンピュータが連携して働くクラスター)上で実行すると、非常に動作が遅くなるのです。

問題:「全員参加」のミーティングによるボトルネック
分散型トレーニングの設定では、ロボットの脳は多くのコンピュータ(GPU)に分割されています。

  • AdamW は、リモートチームのように機能します。コンピュータAは自分のネジを直し、コンピュータBは自分のネジを直します。彼らは互いに多くを話す必要はありません。
  • Muon は、委員会のように機能します。パネルを修正するために、すべてのコンピュータがまずパネルの「全体」を見る必要があります。

素朴な実装におけるMuonでは、すべてのコンピュータが一旦作業を停止し、全員から全データをダウンロードし、複雑な計算を行い、その結果を送り戻さなければなりません。これは、膨大な1,000ページのレポートを全員が読み終えるまで、決定を下すことができない大規模な会議を開催するようなものです。これでは時間がかかりすぎ、ミーティング(オプティマイザー・ステップ)が実際の作業(学習ステップ)よりも長くなってしまいます。実際、論文では、これが学習自体の2倍以上の時間をコストとして支払わせると指摘されています!

解決策:DMuon (Distributed Muon)
X Square Robot Team は、MuonをAdamW並みに高速に動作させるための新しいシステム、DMuon を構築しました。彼らは、コーチの数学的な仕組みを変えるのではなく、「チームの働き方」を変えることでこれを解決しました。

彼らが以下の3つのトリックを用いて、このボトルネックをどのように解決したのかを説明します。

1. 「指定されたエキスパート」戦略(オーナー中心の実行)

全員がすべてのパネルを直そうとするのではなく、DMuonは各パネルに対して特定のコンピュータを「オーナー(所有者)」として割り当てます。

  • 以前: 全員がデータを集め、全員が計算を行い、全員が時間を無駄にしていた。
  • 現在: 「オーナー」となるコンピュータだけがデータを集め、重い計算を行います。他のコンピュータは、待機するか、あるいは別の作業を行います。
  • たとえ: 建設現場を想像してください。すべての作業員が家全体を建てようとするのではなく、屋根の専門家、配管の専門家というように役割が決まっています。他の作業員は屋根を作ろうとはせず、専門家に必要な道具を手渡すだけです。これにより、同じ作業を二度繰り返す無駄を防いでいます。

2. 「コンベアベルト」システム(通信のオーバーラップ)

「オーナー」が計算を行っている間、他のコンピュータはただ座って待っているわけではありません。DMuonはパイプラインを作成します。

  • フォワードパス(順伝播): ロボットが「考えている(データを処理している)」間に、システムはバックグラウンドで次の道具のセットをエキスパートへ静かに送ります。
  • バックワードパス(逆伝播): ロボットが「間違いから学んでいる」間に、システムはすでにエキスパートのための次のデータ収集を開始しています。
  • たとえ: レストランの厨房のようなものです。シェフ(オーナー)が野菜を切っています。シェイトが野菜を切り終えるのを待ってからウェイターが次の注文を持ってくるのではなく、シェフがまだ切っている間に、ウェイターは次の注文を持ってきます。待ち時間は「切る作業」の中に隠されます。

3. 「スマート組み立てライン」(バッチ処理とチューニング)

Muonが行う計算は複雑です。時には、パーツが巨大な壁のように大きいこともあれば、小さなタイルくらいに小さいこともあります。

  • 問題: 小さなタイルを巨大な機械で処理しようとすると、機械が遊んでしまいます。逆に、巨大な壁を処理しようとすると、非常に時間がかかります。
  • 解決策: DMuonは、多くの小さなタイルを一つの「バッチ」としてまとめ、機械が常に稼働するようにします。また、特定の形状のタイルに対して最も速い処理方法を自動的に見つける「チューナー」も使用しています。
  • たとえ: 封筒をたった一通送るために配送トラックを出すのではなく、DMuonはトラックがいっぱいになるまで待ち、まとめて発送します。また、目的地が都市なのか農村なのかに応じて、トラックのルートを変更します。

結果

論文では、ロボットの訓練モデル(Wall-OSS)や言語モデル(Qwen2.5)を含む、現実世界のモデルを用いてDMuonをテストしました。

  • スピード: DMuonは、従来の素朴な方法と比較して、「オプティマイザー・ステップ(ミーティング)」を6倍から163倍高速化しました。
  • 効率性: 1ステップの訓練にかかる総時間は、標準的なAdamWの手法よりもわずか2%遅いだけです。
  • 結論: DMuonを使用すれば、莫大な時間のペナルティを支払うことなく、Muonの優れた「グループセラピー」的な学習スタイルを利用できます。これにより、複雑で重苦しいプロセスをスムーズで効率的なものへと変え、巨大なAIモデルでの実用的な運用を可能にしました。

要約すると、DMuon は、最も賢いコーチ(Muon)が、コンピュータの高速道路で渋滞を起こすことなく走れるようにするための「交通管制システム」であり、次世代のAIを訓練することを初めて現実的なものにしたのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →