← 最新の論文
🤖 machine learning

When Does Muon Help Agentic Reinforcement Learning?

本論文は、Group-in-Group Policy Optimizationにおいて、特に隠れ層の重み行列に対してMuonオプティマイザを適用することが、報酬が疎なエージェント的強化学習タスクにおいてAdamWを大幅に上回る性能を示すことを実証しており、その性能向上は、アドバンテージ推定器、学習率、および方策最適化戦略の相互作用に強く依存している。

原著者: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Kai Ruan, Jinghao Lin, Zihe Huang, Ziqi Zhou, Qianshan Wei, Xuan Wang, Hao Sun

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、ロボットに巨大で散らかった家の中をナビゲートして隠された宝物を見つけさせる方法を教えていると想像してください。ロボットはコードで作られた「脳」であり、一歩進むたびに、その一歩が良かったか悪かったかを教える教師から小さな刺激を受け取ります。これが**強化学習(RL)**の世界であり、エージェントは試行錯誤を通じて学習します。この物語における「教師」は、オプティマイザ(最適化アルゴリズム)と呼ばれる数学的なツールです。これは、ミスや成功の後にロボットの脳をどれくらい変化させるべきかを決定します。長年、最も人気のある教師はAdamWと呼ばれる手法でした。これは、フィードバックの大きさに基づいてロボットのステップを調整する、注意深く着実なコーチのようなものです。

最近、Muonという、より華やかな新しいコーチが登場しました。Muonは、ロボットをゼロから教えるプロセス(事前学習と呼ばれます)において、非常に高速かつ効率的で、半分のエネルギーで仕事をこなすことで有名です。しかし、ここで大きな疑問があります。ロボットがすでに基礎を学び、特定の難しいタスクをマスターしようとしている「微調整(ファインチューニング)」の段階においても、Muonは同様にうまく機能するのでしょうか?初期の報告では、Muonは「微調整」の段階においてはあまりに攻撃的すぎて、ロボットに学んだことを忘れさせたり、混乱させたりする可能性があると示唆されていました。この論文は、その謎を解明するために、報酬が稀で発見が困難な複雑な長期的なパズルを解くようにエージェントを教えるための「秘密兵器」として、Muonが機能するかどうかを検証しています。


オプティマイザの大対決

研究室では、研究者たちがハイステークスのレースを用意しました。彼らは、小さくても有能なAIエージェント(Qwen2.5-0.5B-Instructモデルに基づいています)を取り上げ、オブジェクトを持ち上げたり、掃除をしたり、加熱したりといった家事を行うシミュレーション環境であるALFWorld内のパズルを解かせるという任務を与えました。ただし、条件があります。エージェントは長い一連のアクションの最後にのみ「成功」報酬を受け取り、途中で何か間違ったことをするとペナルティを受けます。これは、出口に到達したときにだけ「勝ちました!」と聞こえる一方で、間違った方向へ曲がるたびに「ブーッ!」と警告される迷路に挑むようなものです。

Muonが役立つかどうかを確認するために、研究者たちは単にロボットを迷路に投げ込んだわけではありません。そのパフォーマンスを解釈するための3つの異なるタイプの「フィードバック・コーチ」(アドバンテージ推定器と呼ばれます)を与えました。

  1. GRPO: このコーチは最終的な結果のみを見ます。「ゲームに勝ちましたか? はい? よし! いいですね! いいえ? もう一度やってみて。」 個々のステップは無視します。
  2. GiGPO: このコーチはより賢いです。最終的な結果を見るだけでなく、ロボットが全く同じ状況に何度も直面した瞬間をグループ化します。「冷蔵庫の前に立っていたとき、通常通り正しく開けていましたか?」と問いかけます。
  3. GraphGPO: 最も洗練されたコーチであり、旅の全行程をグラフとして描き出し、あらゆるステップがいかに目標に近かったかを分析します。

驚くべき発見

チームは実験を行い、信頼できる旧来のAdamWコーチと、新しいMuonコーチを対決させました。彼らは、基本部分(単語の辞書など)はAdamWのままにし、ロボットの「隠れた」脳の重み(複雑な内部接続)に対してのみオプティマイザを入れ替えることで、他のすべての条件を全く同じに保ちました。

結果は、どのフィードバック・コーチを使用したかによって、「まあまあ」であったり「ワオ!」であったりと、大きく分かれました。

「ワオ!」の瞬間:GiGPO
GiGPOコーチを使用したとき、Muonはロボットをスーパー学習者に変えました。

  • 標準的なAdamWコーチを使用した場合、ロボットは最終テストの実行回数の約**29%**で成功しました。
  • Muonを使用した場合、その数値は**54.6%**へと急上昇しました。
  • これは88%の相対的な改善です。
  • さらに印象的なことに、AdamWのロボットがある時点を過ぎると完全に崩壊してタスクを解けなくなったのに対し、Muonのロボットは200回のアップデートを通じて学習と成功を継続しました。

「まあまあ」の瞬間:GRPO
より単純なGRPOコーチ(最終的な勝利のみを重視するもの)を使用したとき、Muonは助けにはなりましたが、それほど劇的ではありませんでした。成功率は**16.1%から26.8%**へと向上しました。これは勝利ではありましたが、ロボットはGiGPOほど速く、あるいは上手には学習しませんでした。

「あと一歩」の瞬間:GraphGPO
超高性能なGraphGPOコーチを使用した場合、ロボットはAdamWでもすでに非常に高い成果(成功率約81%)を出していました。Muonは、特定の学習率において、それを90.1%へとわずかに押し上げ、AdamWよりも30〜60ステップ早くその成功レベルに到達しました。しかし、ロボットはすでに頂点に近かったため、ゴールに近づくにつれて両者のコーチの差は縮まりました。

なぜMuonが勝ったのか?(そしてなぜ常に勝てるわけではないのか?)

研究者たちは、なぜこのようなことが起きたのかについて理論を持っています。彼らは、それがノイズに関係しているのではないかと疑いました。

ロボットの脳が霧の深い森の中を進もうとしていると考えてみてください。

  • AdamWは、最も強く、大きな音のする道を辿るハイカーのようなものです。もし霧が濃ければ(ノイズが高ければ)、行き詰まったり迷走したりする可能性があります。
  • Muonは、地形を平坦にし、静かで小さな道も大きな道と同じくらい目に見えるようにするハイカーのようなものです。これは、もしその静かな道が実際に有用な場所へ通じているのであれば、非常に効果的です。

論文は、GRPOの設定(シングルターン、低報酬タスク)において、この「静かな道」のほとんどが単なるランダムなノイズであることを示唆しています。Muonの平坦化効果はこのノイズを増幅させてしまうため、他の研究において失敗したり苦戦したりすることがあるのです。しかし、GiGPOの設定では、「ステップレベル」のフィードバックが灯台のように機能します。それはノイズをフィルタリングし、真に有用な方向を際立たせます。GiGPOが「どの特定のステップが良かったか」について明確な信号を提供するため、Muonの「弱い信号を増幅する能力」は、呪いではなくスーパーパワーとなるのです。

この論文が否定したもの

この研究が「見つけられなかったこと」に注意することが重要です。研究者たちは、成功の理由が単にMuonがより高い「学習率」(より大きなステップサイズ)を使用していたからではないかをテストしました。AdamWのスピードをMuonのペースに合わせて引き上げようと試みましたが、ロボットは即座に崩壊し、失敗しました。これは、Muonの成功が単に大きなステップを踏んだことによるものではなく、ステップを「どのように計算したか」によるものであることを証明しています。

また、この論文はMuonがあらゆることに対する完璧な解決策であると主張しているわけでもありません。実際、他の種類のタスク(シングルターンの数学問題など)において、Muonが過去に失敗したことを明記しています。ここでの成功は、フィードバックが注意深く構造化されている(GiGPOのような)長期的なスパンの疎な報酬タスクに特有のものです。

結論

この論文は、Muonは適切な種類のフィードバックと組み合わされたときのみ、エージェンティックな強化学習のための強力なツールになることを示唆しています。

AIに複雑で多段階のパズルを解かせようとしているなら、単にMuonに入れ替えるだけでは不十分かもしれません。問題をより小さく明確な断片に分解するフィードバックシステム(GiGPOのようなもの)が必要です。Muonの「静かな有用な道」を見る能力と、GiGPOの「ノイズをフィルタリングする」能力を組み合わせることで、AIは大幅に速く学習し、より多くのパズルを解くことができるようになります。

著者らは、これが単一のシード(一度の実験実行)を用いた「探索的」な研究であることを認めており、このパターンが異なるモデルやタスクにおいても維持されるかどうかを確認するために、さらなるテストが必要です。しかし、結果は有望です。オプティマイザとフィードバックシステムを共にチューニングすることで、私たちはAIエージェントを、より複雑で現実世界の混沌とした世界をナビゲートできるレベルへと進化させることができるかもしれません。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →