← 最新の論文
🤖 machine learning

RASFT: Rollout-Adaptive Supervised Fine-Tuning for Reasoning

本論文は、問題の解明可能性とポリシーの確信度に基づいてエキスパートの模倣と自己生成された推論のバランスを動的に調整する、ポリシー認識型の教師あり微調整フレームワークであるRASFTを提案しており、既存のSFTおよびRL手法と比較して数学およびコード推論のベンチマークにおいて優れた性能を達成している。

原著者: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

公開日 2026-06-08
📖 1 分で読めます☕ さくっと読める

原著者: Yongliang Miao, Fengyuan Liu, Wei Shi, Yanguang Liu, Fei Sun, Na Zou, Mengnan Du

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、高度な数学の問題やコンピュータコードのような複雑なパズルを解く方法を教えている、天才的だが少し頑固な生徒を教えていると想像してください。

旧来の手法:「達人のコピー」

伝統的に、これらのAIモデル(大規模言語モデルと呼ばれます)を訓練する場合、「教師による監督付き微調整(Supervised Fine-Tuning: SFT)」という手法を用います。これは、熟練した教師が書いた完璧な解答を生徒に手渡し、「この正確な経路を暗記しなさい。私がやった通りに、一言一句違わずにやりなさい」と命じるようなものです。

問題は、推論とは単なるコピーではないということです。パズルには、多くの場合、正解に至るための異なる有効な経路が存在します。もし生徒が教師の特定の経路を硬直的にコピーしてしまうと、以下のような事態を招く可能性があります:

  1. 自身の直感を忘れる: 教師を模倣することに夢中になりすぎて、自分自身の思考力を停止させてしまう。
  2. 表面的な部分に過学習する: 解答の背後にある「論理」ではなく、その「スタイル」だけを学習してしまう。
  3. 行き詰まった時に失敗する: 教師の提示する経路が、生徒の現在のスキルレベルに対して難しすぎる場合、生徒は混乱して諦めてしまう。

新しい手法:RASFT(「スマートコーチ」)

この論文では、RASFT(Rollout-Adaptive Supervised Fine-Tuning)と呼ばれる新しい手法を紹介しています。硬直的な教師の代わりに、生徒が練習している様子を見守り、どの程度介入するかを判断する**「スマートコーチ」**を想像してみてください。

このコーチの仕組みは、以下のステップで行われます。

1. 「試しにやってみる」フェーズ(ロールアウト)

レッスンが始まる前に、コーチは生徒に対し、自力で問題を何度か解いてみるよう求めます(これらは「ロールアウト」と呼ばれます)。

  • 生徒が正解した場合: コーチはこう言います。「素晴らしい!君はこれを明確に理解しているね。私の解答を強制的にコピーさせる必要はない。君自身の正しい解答を見てみよう。」
  • 生徒が失敗した場合: コーチはこう言います。「なるほど、君はこの問題に苦戦しているようだね。介入して、君を導くためにマスターの解答を見せなければならない。」

これが**「適応型(Adaptive)」**の部分です。コーチによる「指導の量」は、生徒が「今」どれほど上手くいっているかに基づいて変化します。

2. 「セーフティネット」

コーチが親切すぎると、生徒が自分自身の独自の思考プロセスを完全に忘れ、教師のやり方しか知らないロボットになってしまうリスクがあります。

これを防ぐために、RASFTは**「セーフティネット」**を使用します。コーチは常にこうチェックしています。「生徒は、元の自然な思考プロセスから離れすぎていないか?」

  • もし生徒が教師に合わせようとして、そのスタイルを劇的に変えすぎている場合、セーフティネットが優しく引き戻します。
  • これにより、生徒は単に教師のデータで脳を書き換えるのではなく、新しいテクニックを学びつつも、自身の「推論の個性」を維持し続けることができます。

なぜこれがより優れた方法なのか

論文では、この「スマートコーチ」を、数学やコーディングのテストにおいて、従来の「硬直的な教師」や他の手法と比較検証しました。

  • 結果: RASFTで訓練された生徒は、問題を解く能力が大幅に向上しました。彼らは単にコピーするのではなく、教師の知恵と自分自身の成長するスキルを組み合わせる方法を学んだのです。
  • 比喩: ミュージシャンが曲を練習している場面を想像してください。
    • 旧来のSFT: 生徒は、たとえ自分がジャズ奏者であっても、楽譜通りに正確に演奏することを強制されます。その結果、即興演奏のスキルを失ってしまいます。
    • RASFT: 教師は生徒のジャムセッションを聞きます。もし生徒がうまく演奏できているなら、教師はそのジャズスタイルを維持させます。もし生徒が音を外したら、教師は間違いを修正するために楽譜を見せます。結果として、生徒はより優れた、多才なミュージシャンになります。

課題(限界)

論文では、この手法にはコストがかかることも認めています。

  • 時間がかかる: 「コーチ」は、教える前に生徒が練習する様子(ロールアウトの生成)を見守り、それが正しいかどうかを確認しなければなりません。これは、単に解答集を渡すよりも時間がかかります。
  • 明確な解答キーが必要: この手法は、答えが特定の数値である数学や、コードが実行可能か否かであるコーディングにおいては非常に効果的です。しかし、「詩を書いてください」のようなオープンエンドな質問には使いにくいです。なぜなら、その詩が「正しい」かどうかを自動的に検証する簡単な方法がないからです。

まとめ

RASFTは、よりスマートなAIの訓練方法です。AIに専門家の解答を盲目的にコピーさせるのではなく、AIの現在の能力をチェックします。AIが苦戦しているときは、専門家に大きく頼ります。AIが順調に進んでいるときは、AI自身の推論を信頼させます。これにより、知識が豊富でありながら、柔軟性も兼ね備えたモデルが誕生するのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →