← 最新の論文
🤖 machine learning

ExTra: Exploratory Trajectory Optimization for Language Model Reinforcement Learning

Extraは、多様な正解への新規性報酬とエントロピー誘導型のプレフィックス再生成を組み合わせることで、容易な推論タスクと困難な推論タスクの両方における標準的なRLVRの限界を克服し、精度と推論時のカバレッジを大幅に向上させる、GRPO互換のフレームワークです。

原著者: Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

公開日 2026-06-25
📖 1 分で読めます☕ さくっと読める

原著者: Wenyang Hu, Junxiang Jia, Zhen Shu, Daniel Dahlmeier, See-Kiong Ng, Bryan Kian Hsiang Low

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に賢い学生(AI言語モデル)に難しい数学の問題の解き方を教えていると想像してください。あなたは「強化学習」と呼ばれる手法を用いています。これは、学生が問題を解こうとし、正解すれば「親指を立てる(グッド)」、間違えれば「親指を下に向ける(バッド)」をもらえるというものです。目標は、この「親指」から学習し、時間をかけてより優れたものへと成長させることです。

この論文は、ExTra(探索的軌跡最適化:Exploratory Trajectory Optimization)と呼ばれる新しい教育手法を紹介しています。これは、学生が複数の試行から学習しようとする際に発生する、2つの特定の課題を解決するものです。

ExTraが解決する2つの問題

1. 「簡単すぎる」問題(退屈な授業)
例えば、2+22+2 のような非常に簡単な数学の問題を学生に与えたとします。

  • 何が起きるか: 学生は10回試行しますが、そのすべてで「4」と書きます。
  • 問題点: すべての回答が同じで、かつ正解であるため、教師(AIシステム)は混乱してしまいます。学習の対象となる試行の間に違いが存在しません。学生は新しい考え方を試すことをやめ、ただ同じ退屈なパターンを繰り返すようになります。彼らは「停滞」し、創造的に考える能力を失ってしまうのです。
  • ExTraによる解決策: これは**「新規性ボーナス(Novelty Bonus)」**を追加します。もし学生が正しい答え(2+2=42+2=4)に到達したとしても、それを以前とは異なるユニークで新しい方法で説明できた場合に、追加のポイントを与えます。これにより、学生が簡単な問題に対して多様な「スタイル」で解くことを促し、脳を活性化させ、思考の多様性を維持させます。

2. 「難しすぎる」問題(行き止まり)
次に、複雑なオリンピックレベルの数学問題のような、超難問を学生に与えたとします。

  • 何が起きるか: 学生は10回試行しますが、そのすべてで途中で行き詰まるか、間違った答えを出してしまいます。
  • 問題点: 教師は10回の失敗を目にすることになりますが、どうすればよいのか全く分かりません。学習の糧となる「親指を立てる」サインが一つも存在しないのです。通常、システムはこれら10回の試行をすべて破棄し、ゼロからやり直そうとします。これは、学生が行き詰まる前に積み上げてきた努力をすべて無駄にしてしまいます。
  • ExTraによる解決策: ExTraは、単にすべてを捨てるのではなく、**「賢いハイキングガイド」**のように振る舞います。
    • まず、学生の失敗した試行を見て、「どこで正解に近づけたのか?」を問いかけます。
    • 次に、**エントロピー(Entropy)**と呼ばれる特別な信号(これは、各ステップにおいて学生がどれほど「混乱」していたか、あるいは「不確実」であったかを測定する指標です)を使用します。これにより、学生が最も「混乱していなかった(確信を持っていた)」部分を見つけ出します。
    • そして、その「惜しい」部分を取り出し、「よし、この部分までは維持して、ここから残りの問題を解いてみよう」と指示します。
    • これにより、学生の進捗を保存し、ゼロから始めるのではなく、強力なスタート地点から新しい道を探索するように導くのです。

どのように連携して機能するか

ExTraは、同時に2つの役割を果たすコーチだと考えてください。

  1. 簡単なタスクに対して: 「よくできました!でも次は、もっと全く新しい方法で説明してみてくださいね」と伝えます(これが新規性報酬です)。
  2. 難しいタスクに対して: 「ここで詰まってしまったけれど、この文章までは本当によくできていました。この一文を保持して、そこからパズルを完成させてみましょう」と伝えます(これがエントロピー誘導型再生です)。

結果

研究者たちは、これらをAIMEやMATHといった6つの異なる数学ベンチマークでテストしました。彼らはExTraを、標準的な手法(GRPOと呼ばれます)と比較しました。

  • 精度の向上: AIは、初回の試行でより多くの正解を導き出しました。
  • カバー範囲の拡大: もしAIに1つの問題を解くために16回の試行を許した場合、ExTraを用いたAIは、その16回の中に少なくとも1つの正解を見つけ出す確率が非常に高くなりました。これは、AIが単に一つの特定の考え方に習熟しただけでなく、より幅広い解法を学習したことを意味します。
  • 効率性: ExTraは、余分な計算時間を費やしたり、人間がすべてのステップを採点したりすることなく、これらの結果を達成しました。AI自身の思考プロセスを観察することによって、何がうまくいっているのかを自律的に判断したのです。

要約すると、ExTraは、物事が簡単な時には多様性を、難しい時には**回復力(レジリエンス)**をAIに教えることで、反復のループに陥ったり、困難に直面して諦めてしまったりしないように設計されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →