← 最新の論文
🤖 machine learning

RL Fine-Tuning Heals OOD Forgetting in SFT

本論文は、「SFT は記憶し、RL は一般化する」という考え方に挑戦し、チェックポイントごとの分析とスペクトル分析を通じて、SFT がしばしば分布外忘却を引き起こし、それが後に RL によって回復されることを示すとともに、この回復過程は特異値の変化ではなく特異ベクトルの回転に関連していることを明らかにする。

原著者: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

公開日 2026-05-12
📖 1 分で読めます☕ さくっと読める

原著者: Hangzhan Jin, Sitao Luan, Tianwei Ni, Sicheng Lyu, Guillaume Rabusseau, Reihaneh Rabbany, Doina Precup, Mohammad Hamdaqa

原論文は CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) のもとパブリックドメインに提供されています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文を、平易な言葉と創造的な比喩を用いて解説します。

全体像:AI 学習の「2 段階」ダンス

複雑なパズルを解く方法を、才能はあるが経験の浅い学生(大規模言語モデル)に教える状況を想像してください。この学生を推論の専門家にするための標準的なレシピは、2 つのステップから成り立っています。

  1. ステップ 1:教師あり微調整(SFT) – 答え付きの教科書を学生に渡し、「これらのパターンを暗記し、スタイルを模倣せよ」と言います。
  2. ステップ 2:強化学習(RL) – 正解でポイントを得て、不正解でポイントを失うゲームに学生を参加させ、「さあ、勝つために論理を自分で見つけろ」と言います。

長らく AI 界隈では、以下のような単純な物語が信じられてきました。「SFT は学生に教科書を暗記させ(既知の問題に有効)、RL は学生に一般化させ、創造的に考えさせる(未知の問題に有効)」。

しかし、この論文は、その物語が不完全であると述べています。 著者らは、SFT は最初は素晴らしいものの、学生に教科書を勉強させすぎると、実は新しい種類のパズルを解く能力を損なうことを発見しました。その後、RL が学生に「新しい超能力」を教えるわけではなく、主に SFT が引き起こした「ダメージを修復」するに過ぎないのです。


発見:「ピークと崩壊」

研究者らは、学習プロセス中の毎日、学生の進捗を観察しました。そして、驚くべきパターンを発見しました。

  • 初期の勝利:「教科書学習(SFT)」のごく初期において、学生は「新しい種類のパズル(分布外データ、OOD タスク)」を解く能力が劇的に向上します。まるで学生が突然、数学の根本的な論理を理解したかのようです。
  • 崩壊:学生が教科書の勉強を続けるにつれ、新しいパズルを解く能力は「低下」し始めます。一方で、特定の教科書の問題については「向上」します。彼らは教科書の答えの正確な形式に夢中になりすぎて、論理をわずかに異なる状況に適用する方法を忘れてしまうのです。
  • 修復:最終的に「ゲーム」フェーズ(RL)に切り替わると、学生の新パズルに対するパフォーマンスは再び回復します。

比喩:
料理人を想像してください。

  • 初期の SFT:料理人は味の基本ルールを学びます。どんな材料でも素晴らしい料理を作ることができます。
  • 後期の SFT:料理人は特定のレシピ本を暗記することを強いられます。彼らは「その特定の料理」を作るのが驚くほど上手になりますが、異なる材料を与えられた場合に味を調整する方法を忘れてしまいます。彼らは「一般的な料理の直感」を「忘れた」のです。
  • RL:料理人は、レシピに関係なく美味しい食べ物を作ればポイントがもらえるコンテストに参加させられます。これにより、彼らは盲目的に本に従うのをやめ、再び直感を使うことを強いられます。彼らは一般的な料理スキルを取り戻しますが、学習の最初期よりも突然優れた料理人になるわけではありません。

重要な発見:RL は「創造者」ではなく「修復者」

この論文は、RL がゼロから新しい推論能力を創造するという考えに挑戦しています。代わりに、著者らは以下を発見しました。

  1. SFT は忘れる:特定のデータで長すぎる学習を行うと、モデルは奇妙な状況や新しい状況に対処する能力を「忘れます」。
  2. RL は回復させる:RL は絆創膏のような役割を果たします。SFT が作った穴を塞ぎ、モデルを SFT フェーズの「ピーク」時のパフォーマンスレベルまで回復させます。
  3. 天井:RL は、モデルをその初期のピークよりも「優れ」させることはめったにありません。単に、モデルが専門化しすぎた前の状態まで戻すだけです。

「ジャスト・ミート」ゾーン:
研究者らは、RL が機能するのは、適切なタイミングで開始した場合のみであることを発見しました。

  • 基礎を学ぶ前に RL を始めすぎると、モデルが混乱しすぎて失敗します。
  • すべてを忘れた後に RL を始めすぎると、「ゲーム」のシグナルがモデルにとって学習するにはあまりにも雑多すぎます。
  • RL が「忘却」を成功裡に癒せる、特定の「絶妙なタイミング」(チェックポイントの範囲)が存在します。

秘密のメカニズム:「回転するコンパス」

なぜこれが起こるのかを理解するために、著者らは**特異値分解(SVD)**と呼ばれる数学的ツールを用いて、モデルの頭の中を覗き込みました。モデルの知識を、さまざまな方向を指す多数の針を持つ巨大なコンパスだと考えてください。

  • 針の大きさ(特異値):研究者らは、これらの針の「強さ」(どれだけの知識が保存されているか)は学習中ほとんど変化しないことを発見しました。それらは安定しています。
  • 針の方向(特異ベクトル):しかし、針が指す「方向」は劇的に変化します。

比喩:
モデルの知識を地図だと想像してください。

  • SFTは地図を消去するわけではありません(データの規模はそのままですが)、地図を回転させます。コンパスを回転させて、「北」を特定の教科書の例に向けるため、新しく異なる場所における「北」を見つけるのが難しくなります。
  • RLはコンパスを元に戻します。地図に新しい土地を追加するのではなく、コンパスを再調整して「北」を再び一般的な論理に向けることで、モデルが新しい地形をナビゲートできるようにします。

一般読者のためのまとめ

  • 古い信念:「SFT は暗記し、RL は一般化する」。
  • 新しい現実:「SFT は(過度の専門化によって)忘れ、RL は(再調整によって)回復する」。
  • 教訓:同じ特定のデータで AI を永遠に学習させないでください。柔軟に考える能力を失います。新しいことに対して賢くさせたいなら、「暗記」フェーズを適切なタイミングで止め、「ゲーム」フェーズを使って焦点を修復する必要があります。ゲームがゼロから全く新しいスキルを教えることを期待してはいけません。

この論文は、新しい厄介な問題を解決するための最良のパフォーマンスは、学習プロセスの初期に発生することが多く、2 段階目(RL)は主に、1 段階目で学習しすぎることによって犯した間違いから私たちを救うために存在すると結論付けています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →