← 最新の論文
🤖 AI

Optimizer-Induced Mode Connectivity: From AdamW to Muon

本論文は、AdamW や Muon などのオプティマイザがニューラルネットワークにおいて、しばしば非連結なゼロ損失解多様体を誘起することを示し、モード接続性が損失地形の普遍的な性質ではなく、特定のオプティマイザとその暗黙的正則化に本質的に依存することを明らかにする。

原著者: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Fangzhao Zhang, Sungyoon Kim, Erica Zhang, Yiqi Jiang, Mert Pilanci

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

広大な山岳地帯で最も低い地点を見つけようとしていると想像してください。この風景はニューラルネットワークの「損失関数」を表しています。高い位置にいるほどモデルの性能は悪く、低い位置にいるほど性能は優れています。

長らく、研究者たちはこの谷の底(「ゼロ損失」状態)に到達するよう 2 つの異なるモデルを訓練すれば、それらの間を登り返すことなく滑らかな単純な経路で結ぶことができると信じていました。この考え方はモード接続性と呼ばれます。「同じ谷の底を 2 人のハイカーが見つけたなら、彼らを結ぶ平坦な道が必ず存在するに違いない」というようなものです。

しかし、この論文は新たな問いを投げかけます:その経路は、ハイカーが「どのように」歩いたかに依存するのでしょうか?

著者たちは 2 つの異なる「ハイキングスタイル」(オプティマイザ)を導入します:

  1. AdamW:古典的で信頼性の高いハイカー。
  2. Muon:より新しく、特殊で、異なる動きをするハイカー。

以下は、この論文が単純なアナロジーを用いて説明した発見です:

1. 「スペクトル指紋」

すべてのモデルは、特異値と呼ばれる数値で構成された独自の「指紋」を持っています(これらはモデルの内部の「筋肉の張力」や「形状」と考えてください)。

  • AdamW モデルは、非常に強い筋肉が数本あり、多くの弱い筋肉を持つ傾向があります(スペクトルにおける外れ値)。
  • Muon モデルは、筋肉の大きさがすべてほぼ均等である傾向があります(よりバランスの取れた「等方性」のスペクトル)。

論文は、AdamWで訓練された 2 つのモデルの間を歩けば、それらの「筋肉の張力」が一定に保たれることを発見しました。Muonモデル同士の場合も同様です。彼らはそれぞれの「近隣地域」にとどまります。

2. 同一オプティマイザ・ハイウェイ(オプティマイザ内接続性)

論文は数学的に証明しています。ニューラルネットワークが十分に広い(十分な数のニューロンを持つ)場合、AdamWによって発見されたすべての解は、滑らかで損失の低い経路で接続されています。Muonについても同様です。

  • アナロジー:広大な平坦な草原を想像してください。あなたと友人が同じハイキングブーツ(AdamW)を使用している場合、岩を踏んだり上り坂に行ったりすることなく、あなたの場所から友人の場所まで歩くことができます。あなたは同じ「ブーツの跡」のゾーンにとどまります。

3. クロスオプティマイザの障壁(オプティマイザ間非接続性)

これが最も驚くべき部分です。AdamWモデルからMuonモデルへ歩こうとするとどうなるでしょうか?

  • 理論:小さく単純なネットワークにおいて、著者たちは「AdamW の谷」と「Muon の谷」が、高い山稜によって隔てられている可能性を証明しました。一方から他方へ移動するには登り坂を登って性能を失う必要があり、それらは解空間内の異なる「島」にあります。
  • 現実(大規模モデル):大規模な実験(言語モデル GPT-2 を使用)では、それらを接続することは可能ですが、その経路は特別であることがわかりました。AdamW から Muon へ歩くにつれて、モデルの「筋肉の張力」(スペクトル)は単に一定に保たれるのではなく、滑らかに変化します。
    • アナロジー:松の森(AdamW)から樫の森(Muon)へ歩くことを想像してください。瞬間移動するのではなく、松から樫へと木々が徐々に変化する遷移地帯を歩きます。経路は存在しますが、それはどちらのオプティマイザも単独では自然に作り出さない独特の「ハイブリッド」な風景を通ります。

4. 「スムージー」効果(汎化)

論文は、AdamW の解と Muon の解の中間にあるモデルを取った場合に何が起こるかをテストしました。

  • 結果:これらの「ハイブリッド」モデルは、元のモデルよりも、見たことのないデータ(分布外データ)に対して優れた性能を示すことが多くありました。
  • アナロジー:コーヒー(AdamW)と紅茶(Muon)をブレンドすると、コーヒー単体でも紅茶単体よりも、ある人々には美味しく感じる新しい飲み物が生まれます。「ブレンド」は、個々のオプティマイザが見逃していた風景の一部を探索します。

主張の要約

  • 同一オプティマイザ:同じオプティマイザを 2 回使用する場合、解はモデルの内部構造を一定に保つ滑らかな経路で接続されています。
  • 異なるオプティマイザ:異なるオプティマイザを使用する場合、小さなネットワークでは解が障壁によって隔てられている可能性がありますが、大規模ネットワークでは、モデルの内部構造を滑らかに遷移させる経路で接続されています。
  • 利点:これらの異なるオプティマイザの解の間を移動することで、新しい未見のデータに対してより優れた汎化能力を持つ「ハイブリッド」モデルが作成されます。

この論文は、医療診断、自動運転、または特定の将来の AI 応用においてこれが機能すると主張していません。これは厳密に、これらのモデルがどのように接続されるかの数学的幾何学と、言語モデルの訓練においてそれらを混合することが汎化を改善するという経験的観察に焦点を当てています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →