Complementing reinforcement learning with SFT through logit averaging in the post training of LLMs
本論文は、凍結されたSFT参照方策と学習可能な方策のlogitsを平均化することによりGroup Relative Policy Optimization(GRPO)を強化する、大規模言語モデル向けの新たなポストトレーニング手法を導入し、これによりKL正則化やクリティックを不要としつつ、RLの推論能力とSFTのフォーマット安定性を効果的に組み合わせる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
以下は、この論文を平易な言葉と創造的な比喩を用いて解説したものです。
全体像:二人の教師、一人の生徒
あなたが数学の問題を解くために大規模言語モデル(AI)を訓練していると想像してください。そこには、AI に教えるために二人の異なる「教師」がいます。
- フォーマット教師(SFT): この教師は、AI に答えを綺麗に書く方法、正しい記号を使う方法、そして(最終的な答えを枠で囲むような)厳格なルールに従う方法を教えるのが得意です。しかし、この教師は実際の数学的な論理において、ときどき間違いを犯します。
- 推論教師(RL): この教師は数学の天才であり、複雑な方程式を完璧に解くことができます。しかし、この教師は乱雑です。答えを枠で囲むのを忘れたり、手順を飛ばしたり、試験で求められる形式と合わない奇妙な形式で書いたりすることがよくあります。
問題点:
従来、これら二つを組み合わせようとする場合、「KL 正則化」と呼ばれる方法が使われてきました。これは、推論教師をフォーマット教師に結びつけるゴムバンドのようなものです。このゴムバンドは、推論教師をフォーマット教師のスタイルに近づけさせます。
- 欠点: フォーマット教師が数学的な間違いを犯した場合、ゴムバンドが推論教師をその同じ間違いへと引きずり込みます。その結果、AI は「綺麗に」書こうと必死になる一方で、「賢く」あることに失敗してしまいます。
新しい解決策:ロジット平均化
この論文の著者たちは、これらの教師を組み合わせる新しい方法を提案しています。ゴムバンドで結びつける代わりに、**「混合された声」**を作ります。
AI を合唱団だと想像してください。新しい方法は、歌手たちに完璧な同調(これは彼らの表現の幅を制限します)を強要するのではなく、彼らが歌う前に声を混ぜ合わせます。
- フォーマット教師が「答えを枠で囲め」と言い、推論教師が「答えは 5 です」と言う場合、混合された声は「答えを枠で囲む:5」と言います。
- フォーマット教師が数学的な間違いを犯して(答えは 6 だと言う)、しかし推論教師がそれが 5 だと知っている場合、混合された声はフォーマット教師の「枠で囲め」という指示を保ちつつ、推論教師の数学的な正しさに大きく傾きます。
仕組み(「ロジット」の魔法)
AI の用語では、モデルの「声」は、次にどの単語や数字を選ぶ可能性の高さを表す数値であるロジットで構成されています。
- 混合: 研究者たちは、フォーマット教師と推論教師からの数値を取り出し、数学的に平均化します。
- 結果: これにより、新しい一時的な「混合ポリシー」が生まれます。
- 訓練: AI はこの混合ポリシーに基づいて練習することで学習します。最終的な答えが正しければ、報酬(ポイント)を獲得します。
- フォーマット教師が混合の一部であるため、AI は綺麗に書く方法を忘れません。
- 推論教師が混合の一部であるため、AI はフォーマット教師の数学的な間違いを修正する自由を持っています。
なぜこれが優れているのか(「専門家たちの積」)
この論文では、「専門家たちの積(Product of Experts)」という概念を使用しています。これは委員会での決定のようなものです。
- 専門家 A(フォーマット) がスタイルについて確信を持ち、専門家 B(推論) が数学について確信を持っている場合、最終的な決定は両方において強力になります。
- 専門家 A が数学について間違っている場合、専門家 B の確信がそれを上書きしますが、スタイルに関する専門家 A の確信は残ります。
この論文は、この「混合された声」アプローチが、従来の「ゴムバンド」方式よりも優れていることを発見しました。AI は数学の問題を正しく解くことを学びつつ、綺麗なフォーマットを維持しました。一方、従来の方法では、AI が正しいフォーマット方法を忘れたり、フォーマット教師の数学的な間違いに陥ったりすることがよくありました。
実験
研究者たちは、3 つの異なる「試験」(データセット)でこれをテストしました。
- MATH: 難易度の高い数学の問題。
- cn-k12: 中国の中・高等学校の数学。
- MMLU: 一般教養と推論。
また、3 つの異なるサイズの AI モデル(小、中、大)でテストを行いました。
結果:
- ほぼすべてのケースで、新しい「混合された声」方式は、従来の方式よりも高いスコアを獲得しました。
- 特に、特定の課題を修正する点で優れていました。従来の方式では、より難しい数学を解くようになるにつれて、AI が答えのフォーマット方法を「忘れる」ことがよくありました。新しい方式は、数学のスキルを向上させながら、フォーマットのスキルを維持しました。
論文からの具体的な例
論文には、幾何学の問題に関する具体的な例が示されています。
- フォーマット教師(SFT): 方程式を正しく立てますが、数学的な間違いを犯し、半径は6であると結論付けます。答えを綺麗に枠で囲みます。
- 推論教師(RL): 数学を正しく計算し、半径が5であることを発見しますが、答えを枠で囲んだり、最終的な形式で書いたりすることを忘れます。
- 混合された声: 推論教師からの正しい数学(5)と、フォーマット教師からの綺麗な枠で囲む指示を取り入れます。最終的な出力は、綺麗に枠で囲まれた5となります。
まとめ
この論文は、厳格な階層制ではなく、協力的なチームとして機能する AI モデルの訓練方法を導入しています。綺麗だが乱雑な教師と、賢いが乱雑な教師の「思考(ロジット)」を数学的に平均化することで、AI は賢くも綺麗でもあり、一方を他方に厳格に従わせることによる落とし穴を回避することを学びます。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。