← 最新の論文
🤖 AI

Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models

本論文は、ポリアの手法に導かれた自己生成の多様な問題解決バリエーションを用いて後続の強化学習の効果を高め、数学的推論、コード生成、および物語作成タスクにおけるパフォーマンスの向上をもたらすミドトレーニング・フレームワークを提案し、検証する。

原著者: Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Aswin RRV, Jacob Dineen, Divij Handa, Mihir Parmar, Ben Zhou, Swaroop Mishra, Chitta Baral

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが複雑な数学パズルを解くために、優秀だが少し硬直した学生を訓練していると想像してください。あなたは、正解を導く一つのやり方を単に暗記する人物ではなく、問題解決の達人になってほしいと願っています。

この論文は、AI チャットボットの「頭脳」である大規模言語モデル(LLM)向けの新しい訓練手法について記述しています。研究者たちは、AI に報酬から学習させる(強化学習と呼ばれるプロセス)前に、まず同じ問題を解く 複数の異なる方法を教えるべきであると発見しました。

以下に、彼らのアプローチを簡単な比喩を用いて解説します。

1. 問題:「一方通行の思考」

通常、AI を訓練する際、私たちは質問と単一の「正解」を示します。これは、学生に数学の問題を示し、それを解くたった一つの方法だけを見せるようなものです。

  • 課題: AI が後で報酬から学習する際(正解であればポイントを得る仕組み)、すでに知っているその一つの方法に対して上手くなるだけで済むことがよくあります。柔軟に考えることを学ばないのです。これは、パスタを一つの方法だけで調理するしか知らないシェフに似ています。材料が変われば、行き詰まってしまうかもしれません。

2. 解決策:「ポリアのブートキャンプ」

研究者たちは、最終的な報酬訓練の前に、**中間訓練(Mid-Training)**と呼ばれる中間ステップを導入しました。

  • コーチ: 彼らは、有名な問題解決のルールを提唱した数学者ジョージ・ポリア(『いかにして問題をとくか』の著者)の手法を用いました。ポリアは、さまざまな戦略を教える賢い老コーチのような存在です。「逆から考えよ」「図を描け」「小さな部分に分解せよ」「似ていて簡単な問題を見つけよ」などです。
  • ドリル: 数学の問題一つひとつに対して、AI は複数の異なる正解を生成するように求められました。それぞれが異なるポリアの戦略を用いるものです。
    • 比喩: 単に学生に答えを見せるのではなく、コーチは「では、地図を使ってこの問題を解いてごらん。次に、コンパスを使って解いてごらん。最後に、後ろ向きに歩いて解いてごらん」と言います。
  • 自己生成: AI はこれをすべて自分自身で行いました。答えを示す人間の教師や、超賢い AI は必要ありませんでした。AI は自分自身で多様な練習問題を生成したのです。

3. 魔法のステップ:強化学習(RL)

このブートキャンプの後、AI は標準的な強化学習(試行錯誤を行い、正解でポイントを得て、機能するものを繰り返すように学習する)を受けました。

  • 結果: ブートキャンプで AI がすでに多くの異なる「手」を練習していたため、RL 訓練はこれらの手を組み合わせて活用できるようになりました。
  • 比喩: ジャズ奏者を想像してください。もし彼が一つの音階しか練習していなければ、一曲しか演奏できません。しかし、もし彼が音階、コード、リズムを別々に練習していたなら(中間訓練)、即興演奏(RL)を始めるとき、突然音階とリズムを組み合わせて、新しく素晴らしい何かを生み出すことができます。AI は、異なる問題解決戦略を組み合わせ、単一の強力な答えを導き出すことを学びました。

4. 彼らが発見したこと

研究者たちは、この手法を AIME やオリンピックなどの難易度の高い数学コンテストでテストしました。

  • より高いスコア: 「多様なブートキャンプ」を経た AI は、一つの方法だけを学んだ AI や、標準的な教師から学んだ AI に比べて、著しく高いスコアを記録しました。
  • 「Pass@K」効果: AI の用語で「Pass@K」とは、「AI に 64 回試行させて、どれくらいの頻度で正解するか」を意味します。ブートキャンプを経た AI は、多くの機会を与えられた場合、正解する可能性がはるかに高くなりました。それはより柔軟で、行き詰まりにくいものでした。
  • 数学を超えて: 訓練は数学のルールに基づいていましたが、AI はコードの作成や物語内の論理パズルの解決など、他の分野でも能力が向上しました。柔軟に考えるという習慣が、他のタスクにも転移したようです。

5. 重要な教訓

この論文は、多様性が秘密の調味料であると主張しています。

  • もし AI にある問題を 64 通りの異なる方法で解くように教えるなら、それは戦略の「図書館」を学ぶことになります。
  • その後、報酬から学習しようとするとき、それは一つの戦略を選ぶだけでなく、それらを**構成(コンポーズ)**することを学び、異なる戦略の最良の部分を組み合わせて問題を解決します。
  • 1,000 個の問題を 1 つの方法で解くように教えるよりも、100 個の問題を 10 通りの方法で解くように教える方が優れています。

要約すると: 最終試験の前に AI に解決への多くの異なる「経路」を実践させることで、AI は古いトリックを組み合わせて、新しく難しい問題を解決できる、より賢く適応力のある思考者へと成長します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →