SR-OPSD: Self-Referenced On-Policy Self-Distillation
本論文は、トークンレベルの変分特性化とレニィ・ダイバージェンスを通じて、適応的な蒸留対象を投影幾何学から分離することで学習を安定化させる、新規の自己参照型オンポリシー自己蒸留フレームワークであるSR-OPSDを提案し、多様なLLMタスクにおいて最先端の性能を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに物語を書かせたり、数学の問題を解かせたりする方法を教えていると想像してみてください。あなたは単にロボットに最終的な正解を出させたいのではなく、どのようにステップ・バイ・ステップで考えるかという「思考プロセス」を学ばせたいと考えています。AIの世界では、これはロボットに試行錯誤させ、最後に小さな「報酬」や「罰」を与えることで行われることがよくあります。しかし、これは学生がテストを受け、終わった後に「B評価」だったと知らされるようなものです。どの文章や計算が間違いの原因だったのか、全く分からないままです。これを解決するために、研究者たちは「自己蒸留(self-distillation)」と呼ばれるトリックを使います。これは、ロボットが二つの役割を同時にこなすようなものです。すなわち、問題を解こうとする「生徒」と、その生徒の作業を見守り、一語一語に対してフィードバックを与える「先生」(実際には同じロボットですが、検証済みの解答などの追加の助けを得たもの)です。生徒は、先生の選択を模倣しようと努めます。
問題は、この先生が静止した、完璧なガイドではないということです。生徒が賢くなるにつれて、先生もまた変化します。なぜなら、両者は共に進化する一つの脳の一部だからです。これは、風によって向きが変わっている中で、動く標的を狙うようなものです。もし生徒が、あまりにも厳格に先生を模倣しようとすると、ループに陥ったり、同じ間違いを繰り返したり、思考が狭まってしまったりすることがあります。この論文は、この「ダンス」を扱うための新しい方法、SR-OPSDを紹介しています。これは、数学的な「コンパス」を用いて学習を安定させ、効果的にすることで、生徒が混乱することなく先生から学ぶことを可能にする手法です。
動く標的の問題
多くのAI学習手法では、AI自身が自身の成功から学ぶことで、より賢くすることを目標としています。この論文は、「オンポリシー自己蒸留(On-Policy Self-Distillation: OPSD)」と呼ばれる手法に着目することから始まります。生徒がテストを受けている場面を想像してください。OPSDでは、生徒が回答を書き、その後「自己教師」(これは生徒自身ですが、正解のヒントを含んだ視点を持つもの)が、「おい、ここまでは合っているが、あの単語は少し違っていたぞ」と言います。生徒は、将来の回答を先生に合わせるように調整しようとします。
しかし、落とし穴があります。先生は固定された本ではなく、絶えず変化する生徒のバージョンなのです。生徒が学習するにつれて、先生も変化します。もし、常に位置を変え続けている先生をコピーしようとすれば、答えに落ち着くことなく、ふらふらと揺れ動いてしまうかもしれません。単純に標準的な数学ツールを使ってこの動く先生に合わせようとすると、しばしば不安定さを招きます。生徒は一つの考え方に集中しすぎてしまい(創造性の喪失)、あるいは絶え間ない変化によって混乱してしまう可能性があります。
新しい解決策:固定されたアンカーと柔軟なコンパス
著者らは、SR-OPSD(Self-Referenced On-Policy Self-Distillation)と呼ばれる新しい手法を提案しています。彼らは、揺れ動きを止めるためには、二つのものが必要であることに気づきました。それは、「固定された地点」と「目標に向かって動くための柔軟な方法」です。
- 固定されたアンカー(参照方策 / Reference Policy): 動いている先生を見る代わりに、生徒は「参照(Reference)」にも目を向けます。これは、生徒の元の、事前学習された自分自身――つまり、この特定のトレーニングを開始する前のバージョン――だと考えてください。この参照は、灯台のような役割を果たします。先生(動く標的)が漂流しても、生徒は自分の元の、確固たる基礎から離れすぎてはいけないということを知っています。この新しい手法は、先生のアドバイスとこの参照を混合することで、安定しながらも役に立つ「ターゲット」を作り出します。
- 柔軟なコンパス(レニ数ダイバージェンス / Rényi Divergence): ターゲットが決まったら、次は生徒がそこへ向かう方法が必要です。この論文では、レニ数ダイバージェンスという数学的ツールを使用しています。これは、生徒がターゲットにどれほど強く引き寄せられるかを制御する、特別な種類の「磁石」や「コンパス」だと考えることができます。
- 磁石が強すぎると、生徒はターゲットに素早く吸い寄せられ、自分自身の声を失ってしまいます。
- 弱すぎると、何も学習できません。
- レニ数の優れた点は、研究者が現在の回答とターゲットとの差異に対して、生徒がどのように反応するかを微調整できる「つまみ」(次数 と呼ばれるもの)を持っていることです。これにより、タスクに応じて、細部に敏感になることも、それらを無視することも可能になります。
研究結果
研究者らは、この新手法を非常に異なる三つのタイプのタスクでテストしました。
- 科学の質問: 化学、物理学、生物学に関するトリッキーな質問への回答。
- 数学的推論: 答えと同じくらいステップ(過程)が重要な、難しい数学の問題の解決。
- コーディング: 実際に動作するコンピュータプログラムの記述。
彼らは、この新手法(SR-OPSD)を、標準的な「逆KL(Reverse KL)」(非常に厳しい先生のようなもの)や「イェンセン・シャノン・ダイバージェンス(Jensen-Shannon Divergence)」(よりバランスは取れているが、時に不安定な先生のようなもの)といった古い手法と比較しました。
結果:
- 安定性: 科学と数学のテストにおいて、古い手法は最初は好調でも、次第に悪化していくことがありました。これは、全力疾走した後に倒れてしまうランナーのようなものです。しかし、SR-OPSDは着実に向上し続けました。例えば、ある物理学のベンチマークにおいて、新手法は(Avg@16と呼ばれる特定の指標を用いて)81.1の精度に達しましたが、古い手法は79.4以下を彷徨っていました。
- 数学の習熟: 難易度の高い数学コンテスト(AIMEやHMTなど)において、新手法はAIがより多くの問題を正しく解く助けとなりました。例えば、AIME 2025のテストでは、新手法は、GRPOと呼ばれる人気のあるベースライン手法と比較して、「パス率(正解率)」を6.7パーセントポイント向上させました。
- コーディング: AIにコードを書かせる学習において、新手法はAIモデルが大きくなるにつれてより優れた成果を出しました。テストされた最大のモデル(Qwen3-8B)において、新手法は50.1のスコアを達成し、従来の最高スコアである48.8を上回りました。
なぜ重要なのか
この論文は、AIに自身の間違いから学ばせるための秘訣は、単により良い先生を持つことではなく、生徒と先生をどのように「接続するか」にあることを示唆しています。学習プロセスを安定した「参照(Reference)」に繋ぎ止め、調整可能な「コンパス(レニ数ダイバージェンス)」を使用することで、AIは混乱したり道を見失ったりすることなく、複雑なスキルを学ぶことができます。
著者らは、単に参照点を追加するだけでは不十分であり、誤った数学的ツールと組み合わせると、かえって状況を悪化させることも発見しました。しかし、その参照点を新しい柔軟なコンパスと組み合わせたとき、結果は科学、数学、コーディングのすべてにおいて一貫して優れたものとなりました。これは、AIが真に複雑な推論をマスターするためには、新しいフィードバックの刺激と、元の知識の安定性の間のバランスを取る学習方法が必要であることを示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。