← 最新の論文
🤖 machine learning

RL Excursions during Pre-Training: Re-examining Policy Optimization for LLM training

本論文は、強化学習(RL)を教師あり微調整(SFT)の後にのみ適用するという標準的な慣行に対し、RLを事前学習のより早い段階で統合し、データ構成を最適化し、さらにRLをSFTの目的関数と融合させることが、汎用的な能力を維持しつつ、推論能力を効果的に向上させ、モデルの分布を拡大できることを示すことで異議を唱えるものである。

原著者: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

公開日 2026-06-04
📖 1 分で読めます☕ さくっと読める

原著者: Rachit Bansal, Clara Mohri, Tian Qin, David Alvarez-Melis, Sham Kakade

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、数学の問題を解くように訓練されている、天才的だが未熟な学生(AIモデル)を指導していると想像してください。長年、標準的なレシピは以下の3つのステップでした。

  1. 事前学習(Pre-training): 学生が何百万冊もの本を読み、一般的な言語や知識を学ぶ。
  2. 教師あり微調整(SFT - Supervised Fine-Tuning): 教師が学生に教科書を与え、そこには正確な正解が記載されている。学生は解法のプロセスを丸暗記するように強制される。
  3. 強化学習(RL - Reinforcement Learning): 学生はゲームに参加し、最終的な答えが合っている場合にのみポイントをもらえる。これにより、学生は自力で問題を解くための「新しい方法」を見つけ出すよう促される。

この論文はこう問いかけています。「学生がすべての本を読み終え、教科書を暗記するまで、ゲームをさせるのを待たなければならないのでしょうか?」

研究者たちの発見を、分かりやすく説明します。

1. ゲームを早く始めることができる

標準的なルールでは、「学生が完全に訓練されるまで、ゲームを与えてはいけない」とされています。研究者たちは、学生が最初の数章を読んでいる最中(事前学習の初期段階)に、ゲーム(RL)を与える実験を行いました。

  • 結果: 驚くほど上手くいきました!学生が本のほんの一部しか読んでいない状態でも、ゲームをプレイすることは、単に本を読み続けるよりも数学の問題を解く能力を大幅に向上させました。実際、ゲームを早期に導入することは、最後まで待ってから「読む → 暗記する → 遊ぶ」という一連のルーチンを行うのと同等に効果的でした。

2. 教科書がないときこそ「ゲーム」が威力を発揮する

通常、「暗記」ステップ(SFT)には、正しい答えが載った教科書が必要です。しかし、もし教科書が十分に足りなかったらどうなるでしょうか?

  • 発見: 問題の解き方の例が1つか2つしかない場合、「暗記」ステップは失敗します。しかし、「ゲーム」(RL)はこれに強く反応します。学生は、完璧な解答集を必要とすることなく、自ら探索し、解決策を見つけ出すことを学びます。例題が少ないとき、ゲームはより強力な教師となります。

3. 秘密の材料は「学生のサイズ」ではなく「本の種類」である

人々はよく、「学生がより大きく(より強力に)なれば、より良く学ぶだろう」と考えがちです。研究者たちは、学生を大きくすることでこれをテストしました。

  • ひねり: 学生を大きくしても、ゲームの学習速度は上がりませんでした。しかし、初期の読書フェーズにおいて、数学の本をより多く与えると効果がありました。
  • 教訓: もし学生に数学を得意にさせたいのであれば、早い段階で数学の物語を食べさせてください。学生の脳の大きさよりも、何を読んだかという「コンテンツ」の方が重要なのです。

4. 「研磨」の神話 vs 「拡張」

最近の議論があります。「ゲーム(RL)は、既存の答えをより鋭く、自信に満ちたものにするだけなのか、それとも実際に新しい考え方を教えているのか?」という点です。

  • 古い見解: 多くの人は、RLは単に学生を「研磨」し、自信を持たせるだけで、必ずしも賢くするわけではないと考えていました。
  • 新しい発見: 研究者たちは、「研磨」の効果は実は「暗記」ステップ(SFT)によって引き起こされるものであることを発見しました。教科書を先に丸暗記させることで、学生は探索することを止めてしまうのです。
  • 真の魔法: もし教科書を暗記させる前に直接ゲームをプレイさせた場合、学生の思考は実際に**「拡張」**されます。彼らは多くの異なる経路を試し、以前は知らなかった新しい解決策を発見するのです。「暗記」ステップこそが、創造性を制限してしまう要因であり、ゲームそのものが制限しているのではないのです。

5. 「スーパー学生」のレシピ

研究者たちは、両方の良いとこ取りをしました。「暗記してから遊ぶ」のではなく、両方を同時に行わせたのです。

  • 仕組み: 学生が問題を解いている場面を想像してください。脳の一部分は教科書をチェックしており(SFT)、もう一方の脳は新しいアイデアを試しています(RL)。彼らは両方の部分からのアドバイスを平均して、脳を更新します。
  • 結果: この「スーパー学生」(並列平均化)は、問題解決において最高の結果を出しました。彼らは他の誰よりも正解を導き出し、単に教科書を暗記しただけの学生とは異なり、他のこと(一般的な会話など)を忘れてしまうこともありませんでした。

まとめ:重要なポイント

  • 待たないこと: 強化学習(ゲーム)は、モデルの学習プロセスが完了する前、つまり「読書」フェーズの非常に早い段階から使用できます。
  • データがサイズに勝る: 事前学習中に特定の種類のデータ(数学など)をモデルに食べさせることは、単にモデルを大きくすることよりも重要です。
  • RLは悪役ではない: RLはモデルの一般的なスキルを損なったり、単に「研磨」したりするものではありません。それらの否定的な影響は「暗記(SFT)」ステップによるものです。RLは、モデルが探索し、新しい解決策を見つけるのを実際に助けます。
  • 一緒に行う: 最良の結果は、「暗記」と「遊び」を順番に行うのではなく、同時に混ぜ合わせることによって得られます。

要するに、この論文は、強化学習をトレーニングプロセスの最後に行う「仕上げの磨き」として扱うのをやめるべきだと提案しています。代わりに、より賢く、より能力の高いモデルを得るために、より早い段階からプロセスの中に織り込み、他の手法と組み合わせるべきなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →