← 最新の論文
🤖 AI

Step-Level On-Policy Distillation: Interpolating Between On-Policy Distillation and Supervised Fine-Tuning

本論文は、教師あり微調整(Supervised Fine-Tuning)とオンポリシー蒸留(On-Policy Distillation)の間を補完する新しい手法であるStep-Level On-Policy Distillation(SOPD)を提案しており、これにより生徒モデルが生成した軌跡に対してステップレベルの完全な修正を提供することで、推論およびエージェントタスクにおいて従来の双方のアプローチを大幅に上回る性能を実現している。

原著者: Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Changhui Sun, Lanbo Liu, Hang Lei, Tong Ling, Jiahang Xie, Zhiyong Zheng, Yujia Wang, Hao Liu, Feng Xiao, Lu Liu, Yanlong Du, Zifeng Cheng, Ziwei Jiang, Qing Gu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、大規模言語モデルはしばしば、教師から学ぶ学生に例えられます。長年、これらデジタルの学生を教える標準的な方法は、専門家によって書かれた完璧な例を見せ、そのシーケンスを暗記させることでした。教師あり微調整(supervised fine-tuning)として知られるこの手法は効果的ですが、硬直的でもあります。なぜなら、学生が実際に犯しやすい間違いを無視して、学生が常に専門家の辿る道を完璧に辿ることを前提としているからです。オンポリシー蒸留(on-policy distillation)と呼ばれる新しいアプローチは、学生自身に回答を生成させ、進めていく中でトークンごとに修正を行うことで、この問題を解決しようと試みています。しかし、これにより学生は自身のミスから学ぶことができる一方で、別の問題が生じます。すなわち、修正があまりに断片的であるため、学生が正解への完全で一貫した経路を一度も見ることができないという点です。これは、カーブを曲がる方法を見せてもらうのではなく、ハンドルに触れるたびに一単語ずつの指示を受けることで運転を学ぼうとするようなものです。

研究者たちは、両方の利点を組み合わせることでこの溝を埋める新しい学習手法を開発しました。「ステップレベル・オンポリシー蒸留(Step-Level On-Policy Distillation)」と呼ばれる手法を導入することで、研究チームは学生がひとつの思考やアクションのシーケンスを自力で完了できるようにし、その上で、その旅の主要な各ステップに対して、教師に単一の、一貫した修正を提供させることに成功しました。このアプローチは、難解な数学の問題の解決から、仮想的な家庭環境のナビゲーションに至るまで、複雑なタスクを用いてテストされました。結果として、この手法は従来の技術よりも学生の学習速度と正確性を大幅に向上させ、以前のモデルの規模では到達不可能だった成功率を達成しました。鍵となる発見は、学習プロセスを個々の単語ではなく、自然で意味のある塊(チャンク)に分解することで、モデルが単に正解が何かを知るだけでなく、自身が犯した特定の間違いからどのように到達すべきかというプロセスまで理解できるようになったことです。

この新手法の核心は、学生モデルと教師の間の相互作用をどのように扱うかにあります。従来のオンポリシー蒸藤のアプローチでは、教師は学生の成果物を見て、生成されるすべての単語に対して微細な修正を行います。もし学生が早い段階で間違いを犯した場合、教師はそれを単語ごとに修正しようとしますが、学生は依然として混乱した状態にあり、壊れた経路に従おうとし続けてしまいます。新しい手法であるステップレベル・オンポリシー蒸留は、この相互作用のリズムを変えます。まず、学生は中断されることなく、完全な応答または一連のアクションを生成することが許されます。学生が生成を終えると、システムはその応答を、数学の証明における完全な一文や、ゲームにおける会話の一巡といった、自然なステップへと分解します。

この時点で、教師が介入しますが、物語全体を書き直すわけではありません。代わりに、教師は各特定のステップにおける学生の開始地点を確認し、そのステップの単一の正しいバージョンを生成します。その後、学生は、自身の元のコンテキストを維持しながら、この正しいステップに一致するように学習します。これは、教師がプロセス全体を乗っ取るのではなく、学生が自身の軌道を修正する方法を学ぶことを意味します。教師は旅の各部分に対して明確で局所的なガイドを提供し、学生が間違いに陥ったまさにその場所から、論理的な前進の道筋を見ることができるようにします。これにより、学生が間違いを経験するプロセスを維持しつつ、それらを修正するための構造化された方法を与えることが可能になります。

研究者たちは、このアプローチが圧力の下でも通用するかどうかを確認するために、二つの非常に異なる環境でテストを行いました。最初のテストは、ALFWorldとして知られる、シミュレーションされた家庭内をナビゲートするエージェントによるものでした。この環境では、モデルはテキストベースの世界と相互作用することで、鍵を見つける、あるいは部屋を掃除するといったタスクを実行する方法を考え出さなければなりません。チームは、より小さな学生モデルを導くために強力な教師モデルを使用しました。彼らがこの新手法を従来のトークン単位の修正スタイルと比較したところ、結果は驚くべきものでした。新手法で訓練された学生は、既知のタスクにおいて成功率が18パーセントポイント以上向上し、未知のタスクにおいては21パーセントポイント以上向上しました。さらに、これらのタスクをより少ない試行回数で完了させたことは、単に推測が上手くなっただけでなく、問題を解決するためのより効率的な方法を学習したことを示しています。

二つ目のテストは、論理的一貫性が極めて重要となる数学的推論に焦点を当てました。ここでは、モデルに競技レベルの数学問題の解決を求めました。研究者たちは、この新手法によって、学生が自身の思考をより明確で構造化されたステップへと整理できるようになったことを発見しました。訓練が進むにつれて、学生はより明確で構造化された推論ステップを生成するようになり、教師の修正もより豊かで詳細なものへと変化していきました。4つの異なる数学ベンチマークにおいて、この新手法で訓練された学生は、従来の最高のアプローチを大幅に上回り、平均精度を10パーセント近く向上させました。これは、この手法が単純なタスクのためのテクニックではなく、複雑な推論を改善するための堅牢な方法であることを実証しました。

この新技術の最も実用的な利点の一つは、教師が自身の内部計算を明かす必要がないことです。多くの従来の手法では、学生が教師のすべての単語に対する生の確率スコアにアクセスする必要があり、これは教師がクローズドなブラックボックス・システムである場合にはしばしば不可能です。新しい手法は、教師がテキストを生成することのみを要求するため、最高のモデルが完全にオープンではない実世界のシナリオにおいて適用するのがはるかに容易です。さらに、教師は学生の既存の成果物に基づいて一度に一つのステップのみを生成するため、プロセスは高速であり、環境が個々の動きに対して反応するのを待つことによる遅延も回避できます。

本研究は、学習をどのように構造化するかが、教師の質と同じくらい重要であることを裏付けています。断片的な単語単位の修正から、一貫したステップレベルのガイダンスへと移行することで、研究者たちは、学生自身の経路を尊重しながら、修正のための明確な地図を提供するという、学習のダイナミクスを生み出しました。このアプローチは、自身のミスから学ぶ柔軟性と、専門家の指導による明快さを、見事に融合させています。これらの知見は、人工知能が、特に複雑でインタラクティブなタスクにおいてより有能で信頼できるものになるためには、モデルがエラーの全体像を把握し、それを単一の論理的な動作の中で修復する方法を学べるような、学習手法を設計しなければならないことを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →