← 最新の論文
🤖 machine learning

M+Adam: Low-Precision Training via Additive-Multiplicative Optimization

本論文は、低精度訓練における相補的な失敗モードを克服するために加算更新と乗算更新を組み合わせた新しいオプティマイザであるM+Adamを提案しており、これにより、BF16、FP8、およびFP4のマスターウェイトのみを用いたLLaMAスタイルのモデルの安定かつ正確な訓練を可能にする。

原著者: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

公開日 2026-07-14
📖 1 分で読めます☕ さくっと読める

原著者: Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup, Anima Anandkumar

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、巨大で超知能を持つロボット(大規模言語モデル)に、人間のように書く方法を教えようとしていると想像してください。これを行うには、ロボットの脳にある何百万もの微細なダイヤルを調整しなければなりません。通常、これらのダイヤルは、顕微鏡を使ってネジを回すかのように、極めて精密に調整されます。しかし、顕微鏡は重くて遅く、高価です。

この論文はこう問いかけています:もし、安価で軽量なレンチを使えたらどうだろうか?

これが**低精度トレーニング(low-precision training)**の世界です。高精度な「マスター・ウェイト(ロボットのダイヤルの記憶)」を使う代わりに、研究者たちは、BF16、FP8、あるいはFP4のような、より小さく粗い形式でそれらを保存しようと試みています。それは、10フィート刻みの目盛りしかない定規を使って山の高さを測ろうとするようなものです。

問題点:「丸め」の罠

著者たちは、このような粗い定規を使用する場合、標準的なトレーニング手法(Adamと呼ばれるもの)が壁に突き当たることを発見しました。その理由は以下の通りです。

  1. 巨大な山の問題: ダイヤルが非常に大きな値に設定されているとき、「定規」の目盛りは非常に間隔が広くなります。もしロボットがダイヤルをわずかに動かす必要があったとしても、定規はその動きを捉えることができません。その微小な動きはゼロに丸められてしまい、ロボットは「何も動かなかった!」と判断してしまいます。ロボットは、山を登ることができず、立ち往生してしまうのです。
  2. ゼロの谷の問題: 他の手法は、乗法的更新(multiplicative updates)Madamのような手法)を用いてこれを解決しようとしました。これは、値を加算するのではなく、ダイヤルに特定の係数を掛け合わせる方法です。これは大きな山に対しては非常に効果的です。なぜなら、ダイヤルの大きさに応じてステップサイズが大きくなるからです。しかし、もしダイヤルがちょうどゼロで止まっていた場合、何を掛けても動かすことができません。それは、車輪のない車を押そうとするようなものです。ゼロに何を掛けてもゼロのままです。また、ダイヤルがプラスからマイナスへ切り替わる(ゼロをまたぐ)必要がある場合、これらの手法は混乱し、切り替えを行うことができません。

解決策:M+Adam(二つの道具セット)

この論文では、巧妙なメカニックが二種類の異なる道具を同時に持ち歩いているような新しいオプティマイザ、M+Adamを紹介しています。これは、両方の良いところを組み合わせ、「補完的な失敗モード」を修正するものです。

  • 道具1:加法的レンチ(Adamスタイル)。 この道具は、小さく精密な調整に適しています。ゼロからのダイヤルの微調整、プラスからマイナスへの符号の反転、そして谷の底付近での微小な動きを扱うことができます。
  • 道具2:乗法的レバー(Madamスタイル)。 この道具は、大きく重い作業に適しています。加法的レンチが「丸め」によって機能しなくなるほどダイヤルが巨大になったとき、乗法的レバーが作動します。これはダイヤルを拡大または縮小させ、ロボットが最も高い山にいるときでも進み続けられるようにします。

M+Adamは、これら両方の道具を同時に使用します。もし加法的ツールが丸めによって動けなくなれば、乗法的ツールがロボットを動かし続けます。もし乗法的ツールがゼロから抜け出せない場合は、加法的ツールが押し出します。

証明:効果はあったのか?

著者たちは単に推測したわけではありません。大規模なスケールでテストを行いました。

  • テスト: 6,000万から10億のパラメータを持つ「LLaMAスタイル」の言語モデルを訓練しました。
  • 予算: 1倍から8倍の「Chinchilla」予算(モデルが見るデータの標準的な尺度)を使用してテストしました。
  • 精度: マスター・ウェイトとしてBF16FP8NVFP4を使用しました。

結果:
あらゆるテストにおいて、M+Adamは標準的なAdamオプティマイザを一貫して上回りました。

  • 最も極端な低精度設定(NVFP4)において、350MモデルのM+Adamは、Adamと比較して「パープレキシティ(モデルがどれほど混乱しているかの指標)」を**16.6%**減少させました。
  • 10億のパラメータを持つ場合でも、M+Adamはすべての精度領域においてAdamよりも明確な改善を示しました。

この論文は、この組み合わせたアプローチが、トレーニング損失が必ず減少すること(「単調減少」)を数学的に証明しており、つまりロボットが常に学習し続け、ループに陥ることがないことを保証しています。

できないこと

この論文が主張していないことも理解しておくことが重要です。

  • M+Adamは、メモリコストをすべて排除する魔法の弾丸であるとは言っていません。実際、論文ではM+Adamが(乗法的ツールのための追加の「状態」により)わずかなメモリ増分を加えることを認めていますが、これらは後で圧縮できることを示しています。
  • また、確率的丸め(Stochastic Rounding)(丸め誤差を修正する技術)が役に立たないと主張しているわけでもありません。彼らはAdamに確率的丸めを適用してテストしましたが、それでもM+Adamの方が優れた性能を示しました。
  • 私たちが高精度ハードウェアの使用を止めるべきだと示唆しているわけでもありません。むしろ、低精度のストレージを使用せざるを得ない場合、M+Adamが正しい方法であることを示しています。

まとめ

巨大なAIモデルを訓練するために「粗い」定規(低精度ウェイト)を使用せざるを得ない場合、単一の動きだけに頼ることはできない、とこの論文は示唆しています。ハイブリッドなアプローチが必要です。M+Adamはそのハイブリッドであり、加法的ステップと乗法的ステップの両方を用いることで、ロボットが巨大な山を登っているときも、ゼロの谷から脱出しようとしているときも、決して立ち往生しないように設計されています。これは、私たちが通常依存している重厚で高価な高精度メモリを必要とせずに、大規模なAIモデルを効率的に訓練するための、原理に基づいた一歩なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →