← 最新の論文
🤖 AI

RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs

本論文は、推論経路を軌道レベルとステップレベルで分析する新たな枠組みを導入し、検証可能な報酬を用いた強化学習(RLVR)が誤った軌道を圧縮して推論をより少ないステップに集中させる一方、教師あり微調整(SFT)は正しい軌道を拡張して推論を多数のステップに分散させることを明らかにすることで、現在の 2 段階トレーニングパラダイムの相補的な成功を説明する。

原著者: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Kohsei Matsutani, Shota Takashiro, Gouki Minegishi, Takeshi Kojima, Yusuke Iwasawa, Yutaka Matsuo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、論文「RL Squeezes, SFT Expands: A Comparative Study of Reasoning LLMs」を、平易な言葉と創造的な比喩を用いて解説したものです。

全体像:ロボットに思考を教える 2 つの方法

あなたが、話すのは得意だが、複雑な数学やコーディングの謎を解くのは得意ではないロボットを持っていると想像してください。これを賢くするために、研究者たちは主に 2 つのトレーニング手法を使用します。

  1. SFT(教師あり微調整): これは模倣のようなものです。あなたはロボットに、人間の専門家が問題をステップバイステップで解決する完璧な例を見せ、「まさにこれをやれ」と言います。
  2. RL(強化学習): これはスコアカード付きの試行錯誤のようなものです。ロボットに自分で問題を解かせます。正解すれば「ゴールドスター(報酬)」をもらい、間違えれば何ももらえません。時間の経過とともに、失敗につながる経路を避けることを学びます。

この論文は問いかけます:これらの 2 つの異なる方法を用いたとき、ロボットの頭の中で実際に何が起こるのでしょうか? それらはロボットがを答えるかだけでなく、どのように考えるかを変えるのでしょうか?

著者たちは、この 2 つの方法がロボットの「思考プロセス」に対して逆の作用をもたらすことを発見しました。


比喩 1: 「推論の道筋」(経路レベル)

ロボットの思考プロセスを、隠された宝物(正解)を見つけるために、霧深い森を歩くハイカーだと想像してください。そこには多くの道があります。宝物につながる道もあれば、行き止まりや崖につながる多くの道もあります。

  • SFT(模倣者)は「良い道」を広げる:
    あなたがロボットに専門家の地図(SFT)を見せると、それは正しい道を進むことを学びます。しかし、ここには落とし穴があります。それは、その正しい道の多くの異なるバリエーションを進むようになることです。宝物を見つける方法において、非常に創造的かつ多様になります。

    • 落とし穴: それは悪い道を進むのをやめません。ロボットがすでに沼地(間違い)をさまよっていた場合、SFT は新しい歩き方を教えますが、それでも時折沼地をさまよってしまうかもしれません。それは正しい経路の数を「拡大」しますが、必ずしも悪い経路を排除するわけではありません。
  • RL(採点者)は「悪い道」を絞り込む:
    あなたが報酬付きのゲーム(RL)をロボットにやらせると、それはすぐに沼地の道がゼロ点につながることに気づきます。そのため、そこを歩くのをやめます。それは、誤った、混乱を招く、あるいは行き止まりのすべての経路を存在から「絞り込み」ます。

    • 落とし穴: それはまた、良い道も「絞り込む」傾向があります。正解の創造的なバリエーションを探求するのをやめ、最もうまく機能することがわかっている 1 つの道に固執するかもしれません。それは非常に集中しますが、多様性は失われます。
  • 勝つ組み合わせ(SFT + RL):
    この論文は、現在の最良の慣行がまず SFT を行い、その後 RL を行う理由を説明しています。

    1. まず、SFTを使ってロボットに宝物を見つける新しい方法を教えます(正しい経路を拡大)。
    2. 次に、RLを使って、ロボットが沼地をさまようことを罰します(誤った経路を絞り込む)。
    • 結果: 問題解決の多くの方法を知っているが、間違いを避けることについては非常に規律正しいロボットが手に入ります。

比喩 2: 「思考の都市」(ステップレベル)

次に、ロボットの思考を単一の道筋ではなく、都市の地図として見てみましょう。推論の各「ステップ」(例えば「面積を計算する」や「式を確認する」など)は、この都市の建物です。ステップ間のつながりは道路です。

  • RL は「ハブ・アンド・スポーク」型の都市を作る:
    RL 訓練の後、都市は変化します。ロボットは、いくつかの特定の、極めて重要な建物(ハブ)に大きく依存し始めます。それはこれらの重要なステップを何度も何度も訪れます。

    • 効果: 都市は非常に効率的になりますが、これらの少数のスポットの周りは混雑します。ロボットは、その「思考力」を少数の重要なステップに集中させます。他の橋を無視して、川を渡るために特定の 3 つの橋しか使わない通勤者のようなものです。
  • SFT は「分散型」の都市を作る:
    SFT 訓練の後、都市は異なって見えます。ロボットは思考を広げます。それは多くの異なる建物を訪れ、RL 型の都市のように、単一の建物が圧倒的に頻繁に訪れることはありません。

    • 効果: 思考は「均質化」され、均等に広がります。それは、誰もが幅広い種類の通りを使い、単一の通りが渋滞することのない都市のようです。

重要な発見:

  • RLは、ロボットの思考を少数の重要なステップに集中的かつ焦点を絞ったものにします(絞り込み)。
  • SFTは、ロボットの思考を多くのステップに広範かつ分散したものにします(拡大)。

都市の形状(トポロジー)

研究者たちはまた、幾何学を用いてこれらの思考都市の「形状」も調べました。

  • ベースモデル(訓練前): 都市は孤立した地区(コミュニティ)に分断されています。ある地区から別の地区へ移動するのは困難です。ロボットは局所的なループに陥ってしまいます。
  • RL: それは地区間の壁を壊します。すべてをつなぐ少数の巨大な「ハブ」が支配する都市を作ります。これにより、ロボットはもし正しいハブにたどり着けば、答えを見つけるのが非常に速くなりますが、その特定のハブに依存します。
  • SFT: それはまた壁を壊しますが、ハブを作る代わりに、すべてがすべてにつながっているウェブを作ります。これにより、都市は非常に頑健になり、どの点からどの点へも移動しやすくなります。

論文の主張のまとめ

  1. RL は「絞り込み屋」です: 誤った思考経路を粉砕し、ロボットの推論を少数の非常に効率的で交通量の多いステップに集中させます。悪い選択肢を排除することで、ロボットを初回で正解に導く能力(Pass@1)を非常に高めます。
  2. SFT は「拡大屋」です: ロボットに正しく考える新しい方法を教え、推論の負荷を多くのステップに分散させます。しかし、ロボットが以前に使っていたかもしれない悪い経路を自動的に取り除くわけではありません。
  3. なぜ SFT + RL が機能するか: 最良の結果は、SFT を使ってロボットにどのように正しく考えるかを教え(良い経路を拡大)、その後 RL を使って間違いを止めるよう強制する(悪い経路を絞り込む)ことから得られます。
  4. 構造が重要である: RL は「ハブ偏重」の推論構造を作り、SFT は「分散型」の構造を作ります。どちらも、訓練されていないモデルの「分断された」構造とは異なります。

この論文は、これらの機械的な違いを理解することが、賢い推論 AI を作成するための現在の「2 段階」トレーニングレシピ(まず SFT、次に RL)がなぜこれほど成功しているのかを説明するのに役立つと結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →