SFT Overtraining Predicts Rank Inversion via Entropy Collapse Under RLVR
本論文は、過度な教師あり微調整(SFT)がロールアウト分布を圧縮し、エントロピー崩壊を引き起こすことで、その後のグループ相対方策最適化(GRPO)学習におけるランク逆転と性能低下を招くことを実証しており、この失敗モードは、RL前のエントロピーおよび初期のGRPOのダイナミクスを監視することによって予測および軽減が可能である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
全体像:「完璧すぎる」という罠
想像してみてください。あなたはロボットにコードを書く訓練をしています。標準的なレシピは次の2ステップです。
- 教師あり微調整 (SFT): 正解のコードの例を何千も示して、パターンを学習させます。
- 強化学習 (RL): ロボットが自力で新しい問題に挑戦させてみます。正解すれば「ご褒美(報酬)」を与え、失敗すれば何も与えません。
問題点: この論文では、ステップ1でロボットを「訓練しすぎ(ステップ1の過学習)」ると、ステップ2において逆に性能が悪くなることが分かりました。
通常、私たちは「ステップ1でより多くの例を暗記させればさせるほど、ロボットは優秀になる」と考えがちです。しかし、著者たちはその逆を発見しました。ステップ1で最も多くを暗記したロボットが、実はステップ2で最悪の結果を出したのです。 実際には、暗記が最も少なかったロボットがチャンピオンとなりました。
メタファー:硬いダンサー vs 柔軟なダンサー
なぜこのようなことが起きるのかを理解するために、ランダムな音楽に合わせて即興でダンスを披露しなければならないコンテストに参加する、2人のダンサーを想像してみてください。
- 「過学習した」ダンサー (深いSFT): このダンサーは、完璧な10種類のルーチンを何千回も練習しました。非常に正確ですが、音楽が変わると固まってしまいます。彼らはその10種類の動きしか知らないのです。それ以外の動きをどうすればいいのか全く分かりません。
- 「ちょうど良い」ダンサー (浅いSFT): このダンサーは基礎を練習しましたが、体は常にリラックスして柔軟な状態を保っています。ルールは知っていますが、音楽が変わったときには、体を揺らしたり、ひねったり、新しい動きを試したりすることができます。
コンテスト (RL):
コンテストでは、どの動きが最も効果的かを見極めるために、多くの異なる動きを一度に試すことが求められます。
- 過学習したダンサーは、毎回まったく同じ完璧な動きをしようとします。それらはすべて同じに見えるため、審査員(アルゴリズム)はどの動きがより優れているかを判断できません。ダンサーは行き詰まり、新しいことを学ぶことができなくなります。
- 柔軟なダンサーは、多種多様な動きを試します。審査員は「ああ、この動きはうまくいったが、あちらはダメだった!」と判断できるため、ダンサーは素早く学習を進めることができます。
技術的な理由:「エントロピーの崩壊」
論文では、「多様性」や「柔軟性」を表すために、エントロピーという専門用語を使用しています。
- エントロピーの崩壊: ロボットが過学習すると、その「思考」はあまりに狭くなってしまいます。さまざまな可能性を模索することをやめ、同じ回答を繰り返すようになります。論文の言葉を借りれば、エントロピーが崩壊した状態です。
- 信号の消失: 学習アルゴリズム(GRPOと呼ばれます)は、異なる回答を比較することで機能します。もしロボットが8回連続で同じ回答を出してしまうと、アルゴリズムは混乱します。比較すべき「差」が存在しないため、改善のための「勾配(方向性)」を計算できないのです。これは、ハンドルが真っ直ぐにロックされた状態で車を操縦しようとするようなものです。
- ランクの逆転: これにより、ランクの逆転と呼ばれる奇妙な結果が生じます。
- 第二段階のトレーニングの前、過学習したロボットは天才のように見えます(練習テストで100%正解します)。
- しかし、第二段階のトレーニングの後、それは悲惨な状態になります。
- 一方で、「完璧ではなかった」方のロボットは、最初は少し劣って見えたにもかかわらず、スーパースターへと成長します。
2つのモデル:二つの都市の物語
著者らはこれを2つの異なるロボットの脳(モデル)でテストしました。
- Qwen (犠牲者): このモデルは罠に陥りました。ステップ1での訓練を増やせば増やすほど、モデルは硬くなってしまいました。「最高の」チェックポイント(最高スコア)が、実は次のフェーズのための最悪の出発点となってしまったのです。
- DeepSeek (生存者): このモデルは元々、より柔軟でした。集中的な訓練の後でも、硬くなることはありませんでした。モデルは依然として学習可能な「安全圏」に留まっていました。これは、問題が第二段階のトレーニング自体にあるのではなく、具体的には第一段階がQwenモデルの柔軟性をどのように損なったかにあることを証明しています。
解決策:2ステップの診断
著者らは単に問題を見つけただけでなく、時間と資金を無駄にする前にそれを察知するための診断ツールを構築しました。
- ステップ1:「ストレッチ」テスト (Pre-RL エントロピー): 第二段階のトレーニングを開始する前に、ロボットの思考がいかに「緩い」かを確認します。もしロボットが硬すぎる(低エントロピーである)場合、リスクが高いとフラグを立てます。
- ステップ2:「早期警告」モニター: 第二段階を開始している間、最初の数分間を監視します。もしロボットが新しいことを試すのをやめ、すぐに繰り返し始めた場合は、リソースを節約するためにトレーニングを早期終了させます。
うまくいかなかったこと
著者らは、標準的なテクニックを用いて壊れたロボットを直そうと試みました。
- ペナルティの追加: 「元のトレーニングから離れすぎないように」。(これは状況を悪化させました)。
- ラベルの平滑化: 「自分の答えに対して少し自信を持たせないように」。(これによりロボットは再び自信を持っているように見えましたが、コンテストではやはり失敗しました)。
結論: コンテスト中に「もっと頑張れ」と言っても、硬くなったダンサーを直すことはできません。そもそも、最初からあんなに厳格に訓練すべきではなかったのです。この論文は、モデルに学習を続けさせたいのであれば、完璧さよりも多様性(エントロピー)の方が重要であるということを証明しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。