✨ 要約🔬 技術概要
あなたが複雑な数学パズルを解くために、優秀だが少し硬直した学生を訓練していると想像してください。あなたは、正解を導く一つのやり方を単に暗記する人物ではなく、問題解決の達人になってほしいと願っています。
この論文は、AI チャットボットの「頭脳」である大規模言語モデル(LLM)向けの新しい訓練手法について記述しています。研究者たちは、AI に報酬から学習させる(強化学習と呼ばれるプロセス)前に、まず同じ問題を解く 複数の異なる方法 を教えるべきであると発見しました。
以下に、彼らのアプローチを簡単な比喩を用いて解説します。
1. 問題:「一方通行の思考」
通常、AI を訓練する際、私たちは質問と単一の「正解」を示します。これは、学生に数学の問題を示し、それを解くたった一つの方法だけを見せるようなものです。
課題: AI が後で報酬から学習する際(正解であればポイントを得る仕組み)、すでに知っているその一つの方法に対して上手くなる だけで済むことがよくあります。柔軟に考えることを学ばないのです。これは、パスタを一つの方法だけで調理するしか知らないシェフに似ています。材料が変われば、行き詰まってしまうかもしれません。
2. 解決策:「ポリアのブートキャンプ」
研究者たちは、最終的な報酬訓練の前に、**中間訓練(Mid-Training)**と呼ばれる中間ステップを導入しました。
コーチ: 彼らは、有名な問題解決のルールを提唱した数学者ジョージ・ポリア (『いかにして問題をとくか』の著者)の手法を用いました。ポリアは、さまざまな戦略を教える賢い老コーチのような存在です。「逆から考えよ」「図を描け」「小さな部分に分解せよ」「似ていて簡単な問題を見つけよ」などです。
ドリル: 数学の問題一つひとつに対して、AI は複数の異なる正解 を生成するように求められました。それぞれが異なるポリアの戦略を用いるものです。
比喩: 単に学生に答えを見せるのではなく、コーチは「では、地図を使ってこの問題を解いてごらん。次に、コンパスを使って解いてごらん。最後に、後ろ向きに歩いて解いてごらん」と言います。
自己生成: AI はこれをすべて自分自身で行いました。答えを示す人間の教師や、超賢い AI は必要ありませんでした。AI は自分自身で多様な練習問題を生成したのです。
3. 魔法のステップ:強化学習(RL)
このブートキャンプの後、AI は標準的な強化学習(試行錯誤を行い、正解でポイントを得て、機能するものを繰り返すように学習する)を受けました。
結果: ブートキャンプで AI がすでに多くの異なる「手」を練習していたため、RL 訓練はこれらの手を組み合わせて 活用できるようになりました。
比喩: ジャズ奏者を想像してください。もし彼が一つの音階しか練習していなければ、一曲しか演奏できません。しかし、もし彼が音階、コード、リズムを別々に練習していたなら(中間訓練)、即興演奏(RL)を始めるとき、突然音階とリズムを組み合わせて、新しく素晴らしい何かを生み出すことができます。AI は、異なる問題解決戦略を組み合わせ、単一の強力な答えを導き出すことを学びました。
4. 彼らが発見したこと
研究者たちは、この手法を AIME やオリンピックなどの難易度の高い数学コンテストでテストしました。
より高いスコア: 「多様なブートキャンプ」を経た AI は、一つの方法だけを学んだ AI や、標準的な教師から学んだ AI に比べて、著しく高いスコアを記録しました。
「Pass@K」効果: AI の用語で「Pass@K」とは、「AI に 64 回試行させて、どれくらいの頻度で正解するか」を意味します。ブートキャンプを経た AI は、多くの機会を与えられた場合、正解する可能性がはるかに高くなりました。それはより柔軟で、行き詰まりにくいものでした。
数学を超えて: 訓練は数学のルールに基づいていましたが、AI はコードの作成や物語内の論理パズルの解決など、他の分野でも能力が向上しました。柔軟に考えるという習慣 が、他のタスクにも転移したようです。
5. 重要な教訓
この論文は、多様性が秘密の調味料 であると主張しています。
もし AI にある問題を 64 通りの異なる方法で解くように教えるなら、それは戦略の「図書館」を学ぶことになります。
その後、報酬から学習しようとするとき、それは一つの戦略を選ぶだけでなく、それらを**構成(コンポーズ)**することを学び、異なる戦略の最良の部分を組み合わせて問題を解決します。
1,000 個の問題を 1 つの方法で解くように教えるよりも、100 個の問題を 10 通りの方法で解くように教える方が優れています。
要約すると: 最終試験の前に AI に解決への多くの異なる「経路」を実践させることで、AI は古いトリックを組み合わせて、新しく難しい問題を解決できる、より賢く適応力のある思考者へと成長します。
技術サマリー:自己生成データを用いた中間学習が言語モデルにおける強化学習を改善する
問題提起 大規模言語モデル(LLM)の最近の進展は、推論時のスケーリングを通じて推論能力を強化する強力な手法として強化学習(RL)を浮き彫りにしました。しかし、RL の有効性は、RL 学習前にモデルに確立された事前分布に大きく依存します。既存の文献は、検証可能な報酬を伴う RL(RLVR)がしばしば「分布の鋭化」を行い、ベースモデルに既に存在する行動を選択的に増幅し、真に新しい能力を誘発するのではなく、と述べています。モデルが単一のタスクに対する多様な問題解決アプローチに触れていない場合、その後の RL 学習は性能向上に苦労するか、特定の評価指標(例:pass@k)の下ではむしろ性能を低下させる可能性があります。ここで扱われる核心的な課題は、RL を適用する前に、ベースモデルに多様な推論戦略の豊富なセットを効果的に備えさせる方法であり、それによって RL プロセスが単に狭い範囲の既存行動を強化するのではなく、これらの戦略を構成し洗練できるようにすることです。
手法 著者らは、事前学習と RL の間に位置する中間ステップとして機能する中間学習 フレームワークを提案します。このフェーズは、同じ問題に対する複数の有効な解決軌跡をモデルに曝露させるために、多様な自己生成データ を利用します。
ヒューリスティック誘導データ生成:
このフレームワークは、ジョージ・ポリアの問題解決ヒューリスティック(例:類推 、分解と再構成 、後方への作業 )から着想を得ています。
シードデータセット(GSM8K)の各質問に対し、ベースモデルに特定のヒューリスティックの説明と数ショットの例をプロンプトし、複数の候補回答を生成させます。
このプロセスはブートストラップされます:モデルは、より強力な教師モデルからの蒸留に依存することなく、自身の学習データを生成します。
フィルタリングと選択: 生成された回答は、ルールベースの検証器(例:Math-Verify)を用いて正しさをフィルタリングします。残りの候補は、特定のヒューリスティックへの準拠度に基づき報酬モデル(R ϕ R_\phi R ϕ )によってスコアリングされます。各質問 - ヒューリスティックのペアに対して、最高スコアの回答が選択されます。
結果として得られるデータセット(D P o ˊ l y a D_{Pólya} D P o ˊ l y a )には、各質問あたり n n n 個の異なる解決バリエーションが含まれており、ここで n n n は適用されたヒューリスティックの数を表します。
中間学習(教師あり微調整):
ベースモデルは D P o ˊ l y a D_{Pólya} D P o ˊ l y a 上で微調整されます。単一の回答を質問にペアリングする標準的な SFT と異なり、このアプローチでは各質問に n n n 個の多様な軌跡をペアリングします。
目的は、これらの複数の軌跡にわたって負の対数尤度を最小化することであり、これによりモデルは分岐点において様々な次のトークンオプションに無視できない確率を割り当てるよう促され、実質的にN 次モーダルな次のトークン分布 を形成します。
強化学習:
中間学習に続き、モデルは別のデータセット(DAPO-Math-17k)上でグループ相対方策最適化(GRPO)を用いて RL 学習を受けます。
本研究は、異なる数のヒューリスティックで初期化されたモデル(n ∈ { 1 , 2 , … , 64 } n \in \{1, 2, \dots, 64\} n ∈ { 1 , 2 , … , 64 } )を、ゼロショット、バニラ RL(ベースモデルに直接適用)、STaR+RL(自己学習推論者 followed by RL)というベースラインと比較します。
理論的視点 本論文は、中間学習が方策勾配更新にどのように影響するかについての理論的分析を提供します:
単一モーダル対 N 次モーダル体制: 単一のトークンに対する高い確信度を持つ単一モーダル体制では、方策勾配更新は無視できる変化(∝ ϵ 2 \propto \epsilon^2 ∝ ϵ 2 )をもたらします。対照的に、確率質量が N N N 個の支配的モード間で分割される N 次モーダル体制では、更新は抑制的ながら顕著な変化(∝ 1 / N \propto 1/N ∝ 1/ N )を誘発します。
戦略の構成: 著者らは、負のアドバンテージ更新の下では、サンプリングされたトークンから除去された確率質量が、主に残りの N − 1 N-1 N − 1 個の支配的モードに再分配されることを証明しています。このメカニズムは、モデルが RL 中に単一の戦略に収束するのではなく、単一の回答内で異なる問題解決アプローチを組み合わせることを学習することを促進します。
主要な結果 実験は、Llama 3.2–3B–Instruct および Qwen2.5–7B–Instruct に対して、6 つの数学的推論ベンチマーク(Math-500、AIME 2024/2025、AMC 2023、HMMT 2025、OlympiadBench)およびドメイン外タスク(HumanEval、MuSR)で行われました。
性能向上: 多様な自己生成データを用いた中間学習は、特に高い k k k 値(pass@64)において RL 性能を一貫して向上させます。
Math-500 において、pass@64 はゼロショットの 87.76% から(n = 64 n=64 n = 64 で)88.94% に向上しました。
AIME 2025 において、pass@64 は 12.84% から 18.66% に増加しました。
高い推論多様性(n = 64 n=64 n = 64 )で中間学習されたモデルは、すべてのベンチマークにおいてバニラ RL および STaR+RL ベースラインを上回りました。
多様性対量: 制御実験により、固定された学習予算の下では、より多くの問題に対して単一のアプローチを学習するよりも、質問ごとに複数のアプローチを学習する(より少ない問題、より多くのアプローチ)方が、RL に対してより大きな利益をもたらすことが示されました。
正しさが不可欠: 誤った答えにつながる多様なアプローチを用いた中間学習は RL 性能を向上させず、多様性の恩恵を受けるためには正しさが前提条件であることを示しています。
蒸留への優位性: 自己生成データは、より強力な教師モデル(QwQ-32B)から蒸留されたデータ(Vendi スコア 10.95)と比較して、より高い多様性(Vendi スコア 13.81)を示し、より良い下流性能につながりました。
一般化: ポリアのヒューリスティックが数学中心であるにもかかわらず、学習された戦略はコード生成(HumanEval)や物語的推論(MuSR)にも一般化し、多段階推論タスクで顕著な向上が見られました。
意義と主張 本論文の主な貢献は、中間学習中の自己生成データを通じた複数の問題解決アプローチへの曝露が、モデルの事前分布を根本的に形成し、その後の RL がこれらの戦略を効果的に構成できるようにする ことを実証している点です。
改善のメカニズム: 本研究は、RL が必ずしもゼロから「創発的」な推論能力を創造するのではなく、既存の行動を構成するものであると仮説立てています。中間学習は、これらの行動が多様であり、構成のために利用可能であることを保証します。
実用性: このアプローチは、人間の注釈やより強力な教師モデルを必要とせずに RL を改善する、シンプルで効果的かつスケーラブルな方法を提供します。
理論的洞察: この研究は、RL の経験的成功と理論的理解の間のギャップを埋め、N 次モーダル分布がモード収束を防ぎ、複合推論チェーンの学習を促進する方法を示しています。
著者らは、単一サンプル精度(pass@1)については控えめな見解を示しており、焦点は多様な曝露が RL 行動をどのように形成するかを理解し、複数のサンプリング試行を必要とするシナリオ(pass@k)での性能を向上させることにあると述べています。ヒューリスティックは数学中心であるものの、他のドメインへの結果的な一般化は、この手順がベースモデル内の潜在的な能力を表面化し統合することを示唆していると認めています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。 登録 ×