← 最新の論文
🤖 machine learning

Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies for VLA and RLVR

本論文は、Muon のノイズの多い勾配成分を抑制し、ヘッドごとの専門性を維持することで Muon を上回る Pion という高域通過スペクトル最適化手法を導入し、Muon および AdamW が困難に直面する検証可能な報酬を伴う視覚言語行動学習および強化学習において、優れた性能と安定性を達成することを示す。

原著者: Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Chongyu Fan, Gaowen Liu, Mingyi Hong, Ramana Rao Kompella, Sijia Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

「Rethinking Muon Beyond Pretraining」という論文を、平易な言葉と日常的な比喩を用いて解説します。

全体像:ロボットと推論のための新しいオプティマイザ

AI の学習を、生徒を教えることに例えてみましょう。長らく、大規模言語モデル(LLM)にとって最高の教師(オプティマイザ)はAdamWでした。最近、Muonという、より高度な新しい教師が登場しました。Muon は、「事前学習」段階、つまり AI が一般的な知識を学ぶためにインターネット全体を読み込む段階において非常に優れています。Muon は、AI の脳を楽器のように扱い、すべての音符(数学的な方向)が等しい音量で鳴るように調整することで、大胆な探索を促します。

しかし、この論文の著者たちは、Muon を 2 つの特定の高度なタスクに適用しようとした際、重大な欠陥があることを発見しました。

  1. ロボットへの教育(VLA): 賢い言語モデルを、見て、話し、動くことができるロボットに変えること。
  2. 数学・論理への教育(RLVR): 報酬を用いて、AI に数学パズルのような難しい問題を解くことを教えること。

これらの新しいシナリオでは、Muon はしばしば失敗し、ロボットが不器用に動いたり、数学の解き手が学んだことをすべて忘れてしまったりします。著者たちは、これらの問題を解決する新しい教師Pionを提案します。


問題点:なぜ Muon は新しい状況で失敗するのか

問題を理解するために、AI の学習プロセスを、多くのスピーカー(数学的な方向)を持つサウンドシステムだと想像してください。

1. ロボットの問題(「低ランク」問題)

ロボットを訓練する際、腕を制御する脳の部分(「アクションモジュール」)は非常に単純です。それは数少ない特定の方向にのみ動く必要があります。

  • 比喩: 3 人の歌手だけが正しい歌詞を持っている合唱団で、残りの 97 人はただ無意味なノイズをハミングしている状況を想像してください。
  • Muon の動作: Muon は、すべての歌手の音量を正確に同じレベルに上げる音響エンジニアのようです。それは 3 人の良い歌手の音量を上げますが、97 人の騒がしい歌手の音量も同じレベルまで最大に上げてしまいます。その結果どうなるでしょうか?ロボットはノイズに混乱し、不規則に動いてしまいます。
  • 解決策: 良い歌手の音量は保ちつつ、騒がしい歌手をミュートするシステムが必要です。

2. 数学の問題(「低信号対雑音比」問題)

報酬(RLVR)を用いて AI に数学の問題を解くことを教える際、フィードバックは非常に「ノイズ」が多いものです。AI は推測し、報酬を受け取り、再び試みます。信号(実際の数学の教訓)は弱く、ノイズ(無作為な推測)は強いです。

  • 比喩: ハリケーンの中でささやきを聞こうとする状況を想像してください。
  • Muon の動作: Muon は、ささやきとハリケーンの風を同じ音量にしようとします。これによりささやきは完全に飲み込まれ、AI は「崩壊」して学習を停止してしまいます。
  • 解決策: ささやきを増幅し、ハリケーンの風を遮断するフィルターが必要です。

解決策:Pion の登場

著者たちはPion(sPectral hIgh-pass Optimization on momeNtum)を作成しました。Pion は、Muon が見落としていたスマートなオーディオ・イコライザーだと考えてください。

すべての音量を均等に上げるのではなく、Pion は 2 段階のプロセスを使用します。

  1. 促進(Promotion): 重要で明確な信号(音の「頭」)を強化します。
  2. 抑制(Suppression): 騒がしく弱い信号(音の「尾」)を積極的にミュートします。

これは**「ハイパス」フィルター**と呼ばれます。音楽におけるハイパスフィルターが、クリアなボーカルを際立たせるために低く響くベースノイズをカットするのと同様に、Pion は数学的なノイズをカットし、有用な学習方向を際立たせます。

Pion の主な特徴:

  • ドロップイン交換: 既存のトレーニングコードにおいて、Muon が使われる場所にそのまま組み込むことができます。より多くのコンピューターパワーや時間を必要とせず、同じくらい高速です。
  • ヘッド単位モード: 数学の問題に対して、Pion は AI の脳の異なる部分(「アテンションヘッド」と呼ばれる)を個別に扱うことができます。これは、クラス内の一部の生徒が幾何学が得意で、他の生徒が代数学が得意だと認識し、全員を一つの大きな塊として扱うのではなく、それぞれに異なる宿題を与えるようなものです。

結果:ロボットと数学が賢くなる

この論文は、主に 2 つの分野で Pion をテストしました。

1. 実在のロボット(VLA)

  • テスト: ロボットにキュウリや立方体のような物体を掴み、ボウルや皿に置くことを訓練しました。
  • 結果:
    • AdamW: ロボットは苦労し、物を落としたり目標を外したりすることが多かったです。
    • Muon: ロボットはより良く動作しましたが、まだ揺れ動き、あまりに多くのノイズを「聞いている」ため、時折何かに衝突していました。
    • Pion: ロボットは滑らかで正確でした。あるテストでは、Pion は 1,500 ステップ後に100% の成功率を達成しましたが、Muon は 97%、AdamW はわずか 32% でした。
    • 実世界: 彼らはさらに、実在の物理的なロボットアーム(Franka Research 3)でもこれをテストし、Pion は依然として勝利し、他の方法よりもはるかに確実に物体を掴み、配置することに成功しました。

2. 数学的推論(RLVR)

  • テスト: 強化学習を用いて、AI モデル(Qwen3)に数学の問題(MATH および GSM8K データセット)を解くことを教えました。
  • 結果:
    • Muon: モデルは崩壊しました。ノイズが学習信号を圧倒したため、精度はほぼゼロまで低下しました。
    • AdamW: モデルはゆっくりですが着実に学習しました。
    • Pion: モデルはより速く学習し、AdamW よりも高い精度を達成し、騒がしい数学の環境をうまく navigated しました。

まとめ

この論文は、Muon が AI 学習の初期の「読書」段階には素晴らしいツールである一方で、ロボットを制御したり数学の問題を解いたりする繊細なタスクには、あまりに「騒がしく」無差別であると主張しています。Pionは、AI 学習のためのノイズキャンセリングヘッドフォンのような新しいツールです。それは重要な学習信号をクリアで大きく保ちながら、邪魔なノイズを静かにし、速度を落とすことなく、より賢いロボットと優れた数学の解き手を実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →