← 最新の論文
🤖 AI

DASH: Divergence-Adaptive Supervision Horizons for On-Policy Self-Distillation of Reasoning Models

本論文は、教師モデルと生徒モデルの間のダイバージェンス(乖離)の時系列的推移に基づいてトークンレベルの教師監督重みを適応的に調整することで、追加のフォワードパスを必要とせずに数学的ベンチマークにおける性能を向上させる、推論モデル向けのオンポリシー自己蒸留手法であるDASH(Divergence-Adaptive Supervision Horizons)を導入するものである。

原著者: ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

公開日 2026-08-07
📖 1 分で読めます☕ さくっと読める

原著者: ZhiYan Hou, Xinyu Tang, Hongyan An, Jianjin Zhang, Weizhen Wang, Yunyun Han, Gengsheng Li, Xiangzhao Hao, Haiyun Guo, Wenbin Hu, Jinqiao Wang, Yafeng Deng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが高度な数学の問題やプログラミングコードの作成といった複雑なパズルを、何度も繰り返し練習することで解けるようになる世界を想像してみてください。この分野は「強化学習」と呼ばれ、コンピュータ(「生徒」)がさまざまな答えを試し、最後にそれが正しかったかどうかを示す単純な「はい」または「いいえ」を受け取ります。問題は、もし生徒が長く回り道をしてそこに到達した場合、そのたった一つの「はい」や「いいえ」だけでは、どの特定のステップが良く、どのステップが悪かったのかを教えてくれないことです。これは、どの問題を間違えたのかを知らされないまま、期末試験で「B」の成績をもらうようなものです。これを解決するために、研究者たちは「オンポリシー自己蒸留(On-Policy Self-Distillation)」と呼ばれるトリックを使用します。これは、生徒が「特権的な教師」(正解の鍵を知っている存在)に、自分の旅のあらゆるステップに対して、進んでいる最中に採点してもらうことを意味します。これにより、生徒には最後に一度だけではなく、密度の高いフィードバックのストリームが与えられます。しかし、ここには落とし穴があります。教師の使い方の標準的な手法は、すべてのステップのフィードバックを全く同じものとして扱います。つまり、生徒のパフォーマンスがどのように変化していたかにかかわらず、最初に行ったミスも最後に行ったミスも、等しく重要であるかのように扱うのです。

この論文は、その盲点を修正するための新しい手法であるDASH(Divergence-Adaptive Supervision Horizons:ダイバージェンス適応型監督ホライゾン)を紹介しています。研究者たちは、標準的なアプローチが硬直的すぎることを発見しました。それは、生徒のミスの「物語」に注意を払っていません。早い段階での小さなエラーが後に致命的な事態を招くこともあれば、同様のエラーが後半では無害であることもあります。DASHは、フィードバック全体を見るスマートなエディター(編集者)のように機能します。もし生徒が教師のアドバイスから逸脱し、問題が拡大している兆候が見られる場合、DASHはその信号の重みを増幅して軌道を修正します。もし生徒が順調に進んでいるなら、その信号を弱めます。論文では、このように調整を行うことで、DASHが追加の計算能力やより賢い教師を必要とすることなく、異なるモデルサイズにおいて数学的推論のスコアを向上させ、以前よりもはるかに速く、より良く学習できることを示しています。

問題点: 「画一的な」採点者

AIに推論を教える世界には、生徒モデルと教師モデルが存在します。生徒は問題を解くために長い思考の連鎖(「ロールアウト」)を生成します。正解へのアクセスを持つ教師は、生徒を見守り、「ねえ、この特定の単語のところで、君は別の単語を選ぶべきだったんだよ」と伝えます。これは**トークンレベルの監督(token-level supervision)**と呼ばれます。

OPSD(On-Policy Self-Distillation)と呼ばれる標準的な手法は、これらすべての小さな「君は間違っている」という信号を集め、それらを平均化します。これは、教師が生徒に対して、いつ起きたものかに関わらず、すべてのミスが全く同じ重みを持つ成績表を与えるようなものです。

著者らは、これが少し愚かなことだと気づきました。生徒が数学の問題を解いている場面を想像してください。

  • シナリオA: 生徒がステップ1で小さな計算ミスをしたが、ステップ2で自分自身で気づいて修正した。このとき、「ダイバージェンス(生徒と教師の乖離)」は一時的に高まったが、その後は解消された。
  • シナリオB: 生徒がステップ1で全く同じ小さなミスをしたが、その後、ミスを悪化させ続け、ステップ10までに完全に間違った答えへと突き進んでしまった。

標準的なOPSDでは、両方のシナリオに対して、最初のステップに対して全く同じ「ペナルティ」が課されます。システムは、シナリオBにおいてはその最初のミスが悲劇の始まりであったのに対し、シナリオAにおいては単なるつまずきに過ぎなかったという事実を理解していません。標準的な手法は、その局所的なミスを、それまでのパフォーマンスの履歴や、そのミスが将来どこへ導くかという文脈を無視して、孤立した状態で扱ってしまうのです。

解決策: DASH、適応型のコーチ

著者らは、採点システムに記憶と文脈を与えるためにDASHを提案しています。単にミスを平均化するのではなく、DASHはこう問いかけます。「この特定のミスは、答え全体の物語の中にどのように組み込まれているのか?」

DASHの仕組みを、簡単な比喩で説明します。

生徒が道を歩いており、教師は生徒の腰に付いたロープを握っていると考えてください。「ダイバージェグンス」とは、生徒が理想的な経路からどれだけ離れているかを表します。

  1. ギャップの測定: DASHは、あらゆるステップにおいて、生徒が教師からどれだけ離れているかを観察します。
  2. 「ゲート」メカニズム: 毎回同じ力で生徒を引き戻すのではなく、DASHは特別な「ゲート」を使用します。
    • もし生徒が平均よりも成績が悪化している(ギャップが広がっている)場合、ゲートは大きく開きます。これは、教師のフィードバックが、生徒を強く引き戻すためのより強い信号として機能することを意味します。「おい、これは悪い傾向だ! この経路を修正するために、より注意を払う必要があるぞ」と伝えているのです。
    • もし生徒が平均よりも順調に進んでいる(ギャップが小さい)場合、ゲートは少し閉じます。教師のフィードバックは依然として存在しますが、生徒はすでに正しい軌道に乗っているため、大きな声で叫ぶことはありません。
  3. 後方への集約: DASHは「バックワード・アグリゲーション(後方集約)」と呼ばれる巧妙なトリックを使用します。答えの終点から始まりに向かって遡ります。そして、「この経路の終わりを見たとき、この特定のステップは最終的な混乱(あるいは成功)にどれだけ貢献したのか?」と問いかけます。そして、その後の出来事に基づいて、そのステップのフィードバックの重みを調整します。

これにより、ミスの「重要性」が固定されない動的なシステムが生まれます。長いエラーの連鎖につながるミスには重いウェイトが置かれ、すぐに修正されるミスには軽いウェイトが置かれます。

研究結果

研究者らは、3つの異なるサイズのAIモデル(17億、40億、80億パラメータ)を用い、3つの困難な数学ベンチマーク(AIME 2024、AIME 2025、HMMT February 2025)でこのアイデアをテストしました。

  • 結果: DASHは、あらゆる場面で標準的な手法(OPSD)を一貫して上回りました。最小のモデル(1.7B)では、平均精度が 41.87% から 45.07% に上昇しました。より大きなモデルでも明確な向上が見られ、8Bモデルは 64.80% から 66.40% へと向上しました。
  • 「なぜ」なのか: 一連の実験を通じて、彼らはこの改善が単に「ノイズ」を追加したり、数学的にランダムに変更したりしたことによるものではないことを証明しました。彼らは、固定されたゲート(旧来の手法)を使用した場合と、スマートに変化するゲートを使用した場合を比較しました。スマートなゲート(DASH)が勝者でした。また、論理の方向性が重要かどうかも確認しました(例:大きなギャップをより厳しく罰すべきか、あるいは緩めるべきか?)。彼らは、彼らの特定のロジック、すなわち「大きなギャップに対してゲートを広げて修正をより多く受け入れることで、より厳しく罰する」というロジックこそが鍵であることを発見しました。
  • 効率性: 最も素晴らしい点は、DASHは超スマートな教師や追加の計算能力を必要としないことです。単に、標準的な手法がすでに計算していた情報を再利用し、それをよりスマートに処理しているだけです。これは、より多くのデータを集めるのではなく、既存のデータの山をより良く整理するようなものです。

まとめ

この論文は、AIに推論を教える際、単にミスを数えるのではなく、ミスの「物語」を理解すべきであることを示唆しています。監督を「適応的(アダプティブ)」にし、生徒の状況に応じて教師の言葉に耳を傾ける度合いを変えることで、AIをより効果的に学習させることができます。DASHは、文脈(コンテキスト)がどれほど大きな役割を果たすかを示しており、硬直した採点システムを、いつ厳しく、いつ寛大になるべきかを知っている柔軟で知的なコーチへと変貌させるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →