← 最新の論文
💬 NLP

Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling

本論文は、各手法の限界を克服し数学的推論タスクにおいて優れた性能と頑健性を示すために、接頭辞サンプリングを通じて教師あり微調整と強化学習微調整を相乗的に組み合わせるハイブリッド微調整手法であるPrefix-RFTを導入する。

原著者: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

公開日 2026-05-18
📖 1 分で読めます☕ さくっと読める

原著者: Zeyu Huang, Tianhao Cheng, Zihan Qiu, Zili Wang, Yinghui Xu, Edoardo M. Ponti, Ivan Titov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に頭は良いが経験の浅い学生に、複雑な数学のパズルを解く方法を教えることを想像してください。教えるには主に二つの方法がありますが、どちらも単独では重大な欠点があります。

二つの欠陥のある指導スタイル

  1. 「コピーキャット」方式(教師あり微調整、SFT):
    完璧な解答集が載った教科書を学生に渡し、「これを読んで、暗記し、そのまま正確に書き写しなさい」と言います。

    • 良い点: 学生は正しい形式と事実を非常に素早く学びます。
    • 悪い点: 学生はロボットになってしまいます。少し異なるパズルを見ると、コピーするしかできず、思考する方法を知らないため、固まってしまいます。彼らは本を模倣しますが、論理を真に理解しているわけではありません。
  2. 「試行錯誤」方式(強化学習微調整、RFT):
    学生を深淵に投げ込みます。「これらのパズルを解きなさい。正解すればゴールドの星をやる。間違えれば何もない」と言います。

    • 良い点: 学生は創造的に考え、新しい解決策を見つける方法を学びます。これまで見たことのない問題を非常に上手に解けるようになります。
    • 悪い点: 指導者がいないため、学生は奇妙な癖を身につけるかもしれません。ゴールドの星をもらうために、言語を混ぜて話したり、奇妙で非効率な経路を辿ったりするようになるかもしれません。また、一度悪い癖がつくと、それを直すのは非常に困難です。

新しい解決策:「プレフィックス」コーチ(Prefix-RFT)

この論文の著者は、Prefix-RFTと呼ばれる新しい方法を提案しています。これは「開始ヒント」戦略を用いるハイブリッドコーチのようなものです。

簡単な比喩を使って、その仕組みを説明します。

学生が迷路を解こうとしていると想像してください。

  • 古い方法(SFT): 迷路全体の地図を渡し、その経路を暗記するよう指示します。
  • 古い方法(RFT): 目隠しをして、出口が見つかるまで歩き続けるよう指示します。
  • 新しい方法(Prefix-RFT): 地図を与えますが、迷路の最初の 20% 分だけです。「この地図が示す通り、正確に始めなさい。この地点に到達したら地図をしまい、残りの迷路は自分で考えなさい」と言います。

なぜこれが素晴らしいのか?

  1. 安全なスタートを提供する: 学生に最初の部分は専門家の経路に従うことを強制することで、すぐに死路に迷い込むのを防ぎます(RFT の「奇妙な癖」という問題を修正)。
  2. 独立した思考を強制する: 学生は残りの迷路を自分で考えなければならないため、単なるコピーキャットにはなりません。仕事を完了させるために脳を使わなければなりません(SFT の「一般化の欠如」という問題を修正)。
  3. 「ゴールドの星」の論理: 学生が専門家のスタートに従い、かつ残りの部分で素晴らしい解決策を見つけると、大きな報酬が得られます。これにより、モデルは専門家のスタートが良いアイデアであったことを学びつつ、学生自身の仕上げも価値あるものであることを学びます。

「エントロピー」フィルター(安全弁)

論文には、「エントロピーベースのクリッピング」という厄介な技術的な詳細が言及されています。その簡単なバージョンは以下の通りです。

時には、専門家の地図が学生が知っていることとあまりにも異なりすぎているため、学生がそれをコピーしようとすると混乱し、頭が壊れてしまう(数学的には「勾配」が極端に大きくなる)ことがあります。

これを修正するため、コーチは学生に、不確実な部分の地図だけをコピーさせます。

  • 学生が最初のステップをすでに完璧に知っている場合、コーチは「それは飛ばしなさい、あなたは知っている」と言います。
  • 学生がステップについて混乱している場合、コーチは「専門家の動きをここで見なさい、ここが学ぶべき場所だ」と言います。

これにより、学生は圧倒されることなく、実際に助けが必要な部分でのみ専門家から学ぶことができます。

結果が示すもの

著者は、数学の問題(AIME 大会など)でこれをテストしました。

  • コピーキャット(SFT) はそこそこでしたが、難しい新しい問題には対応できませんでした。
  • 試行錯誤(RFT) は良好でしたが、時には立ち往生したり、悪い癖がついたりしました。
  • プレフィックスコーチ(Prefix-RFT) は両方を上回りました。専門家のパターンを学びつつ、新しい解決策を探る能力を維持しました。

実際、単一の難しい問題を解くために大量の試行(例えば 2,048 回)を与えた場合、解決策を見つける可能性を大幅に向上させたのは、唯一プレフィックスコーチという方法でした。この方法はモデルを単にコピー上手にするだけでなく、モデルが達成できる能力の天井そのものを引き上げることを証明しました。

要約
Prefix-RFT は、旅の最初の部分に「補助輪」をつけてから取り外し、残りの道のりを自分で漕がせるようなものです。ガイドの安全性と探索の自由を組み合わせることで、知識豊かで創造的な学習者を生み出します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →