← 最新の論文
🤖 machine learning

QUADS: Stabilizing NVFP4 Reinforcement Learning for MoE via QUantization-error Alignment across Dual Sides

本論文は、非対称な量子化認識トレーニングと残差活性化補償を通じて活性化誤差に対処することにより、Mixture-of-ExpertsモデルにおけるNVFP4強化学習を安定化させる、両側量子化誤差整合手法であるQUADSを提案しており、これによりFP8と比較して大幅に向上したスループットを実現しつつBF16レベルの精度を達成している。

原著者: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

公開日 2026-07-20
📖 1 分で読めます☕ さくっと読める

原著者: Zhengyang Zhuge, Hao Yu, Xin Wang, Zheng Li, Yizhong Cao, Dayiheng Liu, Jianwei Zhang

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超高性能なロボットに、数学の問題を解いたりコードを書いたりといった複雑なパズルを解く方法を教えていると想像してください。本当に上手くなるために、ロボットは単に答えを暗記するのではなく、何千もの異なる解決策を試行錯誤し、何がうまくいったかというフィードバックを受け取り、次により良くできるように自分の脳を調整するという練習を繰り返します。このプロセスは「強化学習」と呼ばれます。しかし、ここには落とし穴があります。ロボットの「思考」し学習する部分(トレーナー)と、答えを生成する部分(ロールアウト・エンジン)は、しばしば切り離されています。学習を機能させるためには、これら二つの部分が全く同じ言語で話す必要があります。もしトレーナーが高精細(4K映画のような)で考えているのに、ジェネレーターが低解像度のぼやけたバージョン(ピクセル化された8ビットゲームのような)での会話を強制されているとしたら、ロボットは混乱してしまいます。その行動の「重要度」がぼやけによって歪められてしまうため、ロボットはミスを犯し始めます。このミスマッチは大きな問題であり、学習プロセス全体を遅らせ、ロボットが賢くなるまでに膨大な時間を要することになります。

ここで、ロボットをもっと速く思考させたいと考えてみましょう。その脳をさらに小さくし、「NVFP4」という超低解像度フォーマットを使うこともできます。これは、まるで非常に高速なレースカーを、小さな粗い小石でできたダートコースで走らせるようなものです。これは現在の標準よりもはるかに高速であることを約束しますが、小石があまりに粗いため、車のホイール(ロボットの論理)が滑ったり制御不能になったりしてしまいます。ロボットは学習しようとしますが、その粗いトラックのせいで、わずか数周でクラッシュしてしまいます。大きな疑問は、「この超高速で粗いトラックを、ロボットがクラッシュすることなく機能させることができるのか?」ということです。

これこそが、この論文の研究者たちが解決しようとした課題です。彼らは、単にロボットをこの粗いトラックに乗せるだけでは、トレーニング開始から約150ステップ以内に劇的な失敗を招くことを発見しました。ロボットの自信スコア(対数確率)が激しく乖離し、学習が完全に停止してしまうのです。彼らは注意深い実験を通じて、なぜこれが起こるのかを突き止めました。問題は、重み(ロボットに蓄えられた知識)にあるのではなく、それらは簡単に同期できるからです。真の犯人は「アクティベーション(活性化)」、つまりロボットが思考している最中にリアルタイムで行う計算です。トラック(NVFP4)があまりに粗いため、これらの新鮮な計算が歪んでしまい、トレーナーは重みを見るだけでは修正できない形で歪んでしまうのです。

これを解決するために、チームはQUADS(QUantization-error Alignment across Dual Sides:二面間における量子化誤差の整合)と呼ぶ、巧妙な二部構成の戦略を考案しました。これは、トレーナーとジェネレーターによるダンスのようなものです。トレーナー側では、「非対称量子化学習可能トレーニング(Asymmetric Quantization-Aware Training)」と呼ばれる特殊なテクニックを使用します。トレーラーにジェネレーターの粗い言語を無理に話させるのではなく、トレーナーの「思考(アクティベーション)」は高精細なまま維持しつつ、その「記憶(重み)」をジェネレーターの粗いフォーマットに合わせるように強制します。これにより、トレーナーは重みを見る際にジェネレーターが見ているものを正確に把握できるようになり、混乱を防ぐことができます。

しかし、それだけでは不十分でした。ジェネレーターは、新しい思考を計算しようとする際に、依然として粗い小石の上でつまずいていました。そこで、ジェネレーター側には「残留アクティベーション補償(Residual Activation Compensation)」を追加しました。これは、ジェネレーターが粗いトラックを歩いていて、「おや、特定の小石のせいで足が滑っているぞ!」と気づくようなものです。レース全体を止めてトラックを直す代わりに、ジェネレーターは、レースを極めて高速に保ちながら、その一箇所の滑りに対して、軌道から外れないよう、ごくわずかな追加の修正を加えます。彼らは、計算の中で最も滑りやすい部分(「高残留チャネル」)を特定し、それらに小さなブーストを与えることで、軌道を維持できるようにしたのです。

結果は素晴らしいものです。この二面的なダンスを用いることで、ロボットは単に粗いトラック上で生き残っただけでなく、まるで滑らかな高精細のトラックを走っているかのようなパフォーマンスを発揮しました。彼らのテストでは、この新手法は、助けなしに粗いトラックを使用した場合と比較して、成功率を約21.5ポイント向上させました。さらに優れたことに、速度の優位性も維持しており、従来の標準的な手法よりも約16%高速に動作しました。この論文は、粗いトラック自体は危険ではあるものの、適切な整合性と、滑りやすい箇所へのちょっとした修正を加えることで、これらの超高速・低精度AIモデルを確実に機能させることができるということを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →