← 最新の論文
🤖 machine learning

Accelerating RL Post-Training Rollouts via System-Integrated Speculative Decoding

本論文は、NeMo-RL 内でシステム統合されたスペキュレイティブデコーディングフレームワークを導入するものであり、これは RL 事後学習のロールアウトにおける損失なしの加速プリミティブとして機能し、8B スケールで 1.8 倍のスループット向上を達成し、非同期実行と組み合わせることで 235B スケールにおいて最大 2.5 倍のエンドツーエンド学習速度向上を予測する。

原著者: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Ko
公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Hayate Iso, Tiyasa Mitra, Sudipta Mondal, Rasoul Shafipour, Venmugil Elango, Terry Kong, Yuki Huang, Seonjin Na, Izzy Putterman, Benjamin Chislett, Maor Ashkenazi, Joseph Guman, Gerald Shen, Tugrul Konuk, Ashwath Aithal, Ritika Borkar, Ran Zilberstein, Bita Rouhani

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが複雑な数学の問題を解くように、天才的だが思考がゆっくりな生徒(AI モデル)を訓練していると想像してください。彼らを教えるには、質問を投げかけ、彼らが思考プロセスをすべて一歩一歩書き出すのを待ち、その後、正解かどうかを確認する必要があります。

問題は、「確認」の部分は速いですが、「書き出す」部分が信じられないほど遅いということです。生徒は単語を一つ書き、考え込んで一時停止し、次の単語を書き、再び一時停止し、これを繰り返します。この単語ごとの遅い書き出しが、これらの AI モデルの訓練における最大のボトルネックです。

この論文は、生徒の「考え方」や「学ぶ内容」を変えることなく、この書き出しプロセスを加速させるための巧妙なトリック、「Speculative Decoding(推測的デコーディング)」を提案しています。

核となるアイデア:「ドラフト助手」

AI モデルを非常に正確だが遅いマスターシェフだと考えます。これを加速させるために、素早くエネルギッシュな見習いシェフ(「ドラフトモデル」)を雇います。

  1. 従来の方法(自己回帰): マスターシェフは単語を一つ書き、止まり、考え、次の単語を書き、止まり、考えます。これには永遠にかかります。
  2. 新しい方法(Speculative Decoding): 見習いシェフが、シェフが次に書くかもしれない単語を 3 つまたは 4 つ素早く推測します。見習いシェフはそれらを素早く書き留めます。
  3. 確認: その後、マスターシェフは見習いシェフのメモを素早く一瞥します。
    • もしメモが正しければ、シェフは「素晴らしい!」と言い、4 つの単語を一度に採用します。
    • もしメモが間違っていれば、シェフはそれを取り消し、正しい単語を書き、最初から始めます。

魔法: 見習いシェフが速いため、シェフはほとんどの場合、複数の単語を一度に採用できます。最終的な結果は、シェフが一人で書いた場合と全く同じですが、はるかに速く完了します。

論文が実際に行ったこと

研究者たちは、このシステムを NeMo-RL という実際の訓練フレームワークに組み込みました。彼らは単純なタスクだけでなく、AI が深く考えなければならない「推論」タスク(数学の問題を解くなど)でもこれをテストしました。

彼らの主な発見を日常用語に翻訳すると以下のようになります。

  • 不正なく機能する: 一部の速度向上方法は、質の低い数学を使用したり、手順を省略したりするなど、近道を試みます。これは生徒の学習を台無しにする可能性があります。この方法は「ロスレス」です。アシスタントなしで AI が学ぶのと同じ方法を、AI がより速く学ぶことを保証します。
  • 速度向上:
    • 中規模モデル(80 億パラメータ)では、書き出しプロセスが 1.5 倍から 1.8 倍 速くなりました。
    • 書き出しは全体の訓練時間の約 70% を占めるため、訓練プロセス全体 が約 1.35 倍から 1.4 倍 速くなりました。
  • 「ドラフト」が重要: 見習いシェフは良い推測者である必要があります。
    • 生徒が学んでいる全く同じ種類の数学問題で見習いシェフを訓練した場合、速度向上は劇的です。
    • 一般的な会話しか知らない汎用的な見習いシェフを使用した場合、速度向上は小さくなります。
    • 先を読みすぎないこと: 見習いシェフが一度に 7 つの単語を推測しようとすると、誤りが多くなりすぎ、マスターシェフが修正に時間を費やすことになります。一度に 3 つの単語を推測することが「絶妙なバランス点」でした。
  • 未来(大規模モデル): 彼らは超精密なコンピュータシミュレーターを使用して、大規模モデル(2350 億パラメータ)と数千台のコンピュータが連携して動作する際の未来を予測しました。
    • 彼らは、これらの巨大なモデルにおいて、この技術により訓練プロセス全体2.5 倍 速くなる可能性を予測しています。

なぜこれが重要なのか

AI の世界では、時間は金銭です。モデルを 2.5 倍速く訓練できれば、同じ期間でより賢いモデルを得るか、同じモデルをコストの何分の一かで手に入れることができます。

この論文は、この速度を得るために AI の「脳」やゲームのルールを変更する必要はないことを証明しています。必要なのは、ドラフト作成を助ける賢く速いアシスタントを追加し、メインモデルに最終確認を任せるだけです。これは、何も壊すことなく、訓練パイプライン全体をよりスムーズに実行させるシステムアップグレードです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →