← 最新の論文
🤖 machine learning

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

本論文は、10 億から 680 億のパラメータを有する言語モデルにおいて、鋭い局所最小値からの脱出と最先端の収束性及び下流タスク性能の達成を実現するために、Muon フレームワークにネステロフ型加速を組み込んだ新たなオプティマイザ「MONA」を提案する。

原著者: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Jiacheng Li, Jianchao Tan, Hongtao Xu, Jiaqi Zhang, Yifan Lu, Yerui Sun, Yuchen Xie, Xunliang Cai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で超知能なロボットに人間の言語を教えることを想像してください。そのためには、そのロボットの脳内にある数百万もの小さなつまみを調整する必要があります。これらのつまみの最適な設定を見つけるプロセスは「トレーニング」と呼ばれ、それらのつまみを回すために使用するツールはオプティマイザーと呼ばれます。

長らく、この作業の標準ツールとしてAdamWが用いられてきました。それは、小さな一歩を踏み出し、常に地図を確認する、頼もしく慎重なハイカーのようなものです。最近、Muonという新しいツールが登場しました。Muon は、山脈全体を一度に見渡し、つまみのグループを単一の単位として扱うハイカーのようです。これにより、Muon はより高速で効率的になりますが、まだ欠点があります。それは「鋭い谷」に陥りやすいという点です。

問題:鋭い谷の罠

ロボットの学習プロセスの風景を、起伏のある地形だと想像してください。

  • 平坦な谷は落ち着くのに良い場所です。これは、ロボットが多くの状況でうまく機能する、安定した一般的な解を見つけられたことを意味します。
  • 鋭い谷は、狭く深い穴です。ロボットがそこに落ちると、最低点に到達したように見えるかもしれませんが、実際には非常に特定され、脆弱な場所に立ち往生しているのです。わずかに押されただけで、その「完璧な」場所から転落し、性能が低下してしまいます。

AdamW もMuon も、これらの鋭い谷に偶然落ちてしまい、そこに立ち往生してしまいます。彼らには、場所が鋭すぎるかどうかを事前に知るために、地面の形状を「感じる」方法が欠けています。

解決策:MONA(Muon with Nesterov Acceleration)

この論文の著者たちは、MONAという新しいツールを作成しました。MONA を、ソナーゴーグルを装着したMuon と考えてください。

それがどのように機能するかを、簡単な比喩を使って説明します。

  1. **従来の方法(Muon):**Muon は、立っている場所の傾斜を見て、下へ進みます。効率的に移動するには優れていますが、前方の地面が緩やかな斜面なのか、崖の縁なのかはわかりません。
  2. **新しい方法(MONA):**Muon が一歩を踏み出す前に、MONA は「最後のステップから現在のステップにかけて、傾斜がどのように変化したか」を見ます。
    • 傾斜が急激に変化した場合(鋭い崖にぶつかったように)、MONA は「おっと、これは鋭い谷だ!ここから跳ね出すために、もっと強く押そう」と判断します。
    • 傾斜がゆっくりと変化した場合(穏やかで平坦な谷)、MONA は「これは安全そうだ。ここで落ち着こう」と言います。

MONA は数学に特別な「加速項」を追加します。それは、現在の方向と前の方向との差を計算します。この差は、地形の「鋭さ」を検知するセンサーのように機能します。地形が鋭ければ、ロボットを穴から押し出します。平坦であれば、ロボットに休ませます。

彼らは何を見つけましたか?

研究者たちは、この新しいツールを、10 億から 680 億のパラメータを持つ、3 つの異なるサイズの言語モデル(小、中、大)でテストしました。彼らは、最大 1 兆語に及ぶ膨大な量のテキストでそれらをトレーニングしました。

  • より優れたトレーニング: すべてのテストにおいて、MONA はモデルがより速く学習し、古い標準(AdamW)および新しいMuon のいずれよりも優れた最終状態に到達するのを助けました。
  • より賢いロボット: MONA でトレーニングされたモデルは、一般的なタスク、数学の問題、コードの作成において優れていました。例えば、680 億パラメータのモデルにおいて、MONA は数学とコーディングのベンチマークで最高スコアを達成しました。
  • ファインチューニング: 初期トレーニングの後、モデルに追加の特定のトレーニング(例えば、コード作成に特化した学習など)を与えた際にも、Muon で開始したモデルよりも、MONA で開始したモデルの方が優れたパフォーマンスを発揮しました。

実用化(MONA-Lite)

著者たちはまた、この「ソナー」システムを追加すると、コンピュータメモリを少し多く消費することに気づきました。これを解決するために、彼らはMONA-Liteと呼ばれる軽量バージョンを作成しました。

  • 彼らは、メモリデータを圧縮するトリック(高解像度ビデオから標準画質へ切り替えるようなもの)と、追加のファイルを保存せずに傾斜の変化をその場で計算する方法を用いました。
  • これにより、追加で必要なメモリが約 75% 削減され、メリットを失うことなく、メモリが限られたコンピュータでも簡単に使用できるようになりました。

まとめ

要約すると、MONAはMuon オプティマイザーのアップグレードです。これは、Muon の速度と効率を維持しつつ、学習中に AI が悪い鋭い場所に立ち往生するのを防ぐ「曲率センサー」を追加します。その結果、数学、コーディング、一般的な推論において優れ、かつ標準的なハードウェアで実行可能な効率的な、より賢く能力の高い言語モデルが生まれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →