← 最新の論文
🤖 machine learning

Not only where, But when: Temporal Scheduling for RLVR

本論文は、検証可能な報酬を伴う強化学習(RLVR)向けに「時間的スケジューリング」を導入するものであり、これは訓練の過程でクレジット割り当て基準を動的に調整し、一般的な最適化へ移行する前に特定のポリシー行動を優先させることで、ポリシーエントロピーを維持しつつより安定かつ効率的な学習ダイナミクスを実現する手法である。

原著者: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Jinghao Zhang, Ruilin Li, Feng Zhao, Jiaqi Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢い学生(AI)に複雑な数学の問題を解くよう訓練していると想像してください。従来の方法(RLVRと呼ばれる)では、学生の論文の最後に単一の成績を与えます。もし「A」を獲得すれば、「よくやった!」と伝え、学生は次回も「A」を獲得できるよう、自分が書いたすべての単語を記憶しようと努めます。

問題は、学生が数千語も書いたことです。その中には論理を理解した重要な「ひらめき」の瞬間もあれば、「そして」「したがって」「結論として」といった単なるつなぎの言葉もあります。従来の方法はすべての単語を同様に重要視するため、実際の方程式を解いたことと同じくらい、「the」という単語を書いたことにも金メダルを与えるようなものです。

従来の方法:静的なスポットライト

以前の研究者たちは、この問題を「スポットライト」を使って解決しようと試みました。彼らはどの単語(論理のステップなど)が重要かを特定するツールを構築し、訓練中にそれらをより明るく照らしました。これはクレジット割当と呼ばれます。

しかし、この論文は、このアプローチには欠陥があると主張しています。スポットライトは決して動きません。 ツールが「500 番目の単語が重要だ」と判断すると、訓練の初日から最終日まで、500 番目の単語に照準を当て続けます。これは、クォーターバックだけがすでにその役割をマスターし、他のことに集中する必要があるにもかかわらず、コーチがチームの他のメンバーを無視してクォーターバックだけを叱り続けるようなものです。この硬直した焦点は、やがて学生がさらに成長することを妨げます。

新しいアイデア:動的なスケジュール(時間的スケジューリング)

著者たちは新しいアイデアを提案します。光を当てる場所だけでなく、いつ当てるかが重要なのです。

彼らは、訓練プロセスを静止画ではなく映画の脚本のように扱うことを提案します。

  • 映画の序盤(訓練初期): 学生は始めたばかりです。彼らはシーンの設定(「推論の足場」)を学ぶ必要があります。この論文は、最も信頼性の高い部分(最終的な答え)である学生の回答の末尾に訓練の焦点を当てることを提案します。
  • 映画の後半(訓練後期): 学生が回答を完成させることに熟達したら、焦点を徐々に論文の冒頭へとシフトさせます。これで、学生は最初からより良い論理と議論を構築することを訓練されます。

これは時間的スケジューリングと呼ばれます。静的なスポットライトではなく、シーンが進むにつれてカメラの焦点を変える監督がいるようなものです。

「軌道パーセンタイル」のトリック

論文のどの部分に焦点を当てるべきか、どのようにしてわかるのでしょうか?彼らは軌道パーセンタイルと呼ばれる単純なトリックを使用します。

学生の回答を 100 メートルの競走トラックだと想像してください。

  • 95 パーセンタイルはゴールライン(最終的な答え)です。
  • 50 パーセンタイルはレースの中間(推論)です。
  • 5 パーセンタイルはスタートブロック(導入部)です。

この論文は、学生の回答の「ゴールライン」部分だけを訓練し始め、徐々に「中間」を含め、最後に「スタート」も含めるように訓練範囲を広げると、学生ははるかに速く、かつ安定して学習できることを発見しました。運転を学ぶようなものです。まずゴールである駐車技術をマスターし、次に直線道路での運転を学び、最後に複雑な交差点のナビゲーション(思考プロセスの始まり)を習得します。

実験では何が起きたか?

研究者たちは、数学と推論のパズルを用いて、この手法を大規模 AI モデル(Qwen など)でテストしました。

  1. より良いスコア: この「スケジュール」方式を採用したモデルは、標準的なモデルよりも数学テスト(AIME や HMMT など)や一般的な推論テストで高いスコアを記録しました。
  2. 健全な学習: 彼らは、古く硬直した方法が AI に「パニック」を起こさせ、創造性(エントロピーと呼ばれる)を失わせることを見出しました。AI は硬直化し、問題を解決する新しい方法を探索することをやめてしまいます。新しい「スケジュール」方式は、AI の学習プロセスを健全で柔軟に保ち、行き詰まることなく改善し続けることを可能にしました。
  3. 既存のツールとの互換性: この新しいスケジューリング方式は、古い「スポットライト」ツールと組み合わせても機能します。既存のコーチングの上に新しい層を追加するようなものです。

結論

この論文は、AI をより賢くするためには、どの単語を訓練するかを決めるだけでなく、いつそれらを訓練するかを決めるべきだと主張しています。回答の最も信頼性の高い部分から始め、徐々に複雑な推論部分へと逆方向に作業を進めることで、AI はより効率的に学習し、創造性を保ち、より良い結果を達成します。これにより、硬直した画一的な訓練セッションが、動的でタイミングの取れたコーチングセッションへと変わるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →