← 最新の論文
🤖 machine learning

XRPO: Pushing the limits of GRPO with Targeted Exploration and Exploitation

XRPO は、大規模言語モデル向けの GRPO ベースの強化学習を、標的探索のための適応的ロールアウト割当と、より優れた活用のための新奇性認識型アドバンテージ鋭化メカニズムの導入によって強化する統合フレームワークであり、その結果、数学およびコーディングのベンチマークにおいて優れた性能とより高速な収束を実現する。

原著者: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

公開日 2026-05-26
📖 1 分で読めます☕ さくっと読める

原著者: Udbhav Bamba, Minghao Fang, Yifan Yu, Haizhong Zheng, Fan Lai

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢いけれど頑固な生徒(AI)に、難しい数学の問題の解き方や複雑なコードの書き方を教えることを想像してみてください。この生徒を教える従来の方法は、各問題に対して 16 回も答えを推測させる多肢選択テストを与えるようなものです。正解すればゴールドスターがもらえ、間違えれば何ももらえません。

問題は、この方法が非効率だということです。生徒は既に分かっている問題でも同じように推測を繰り返し、時間を浪費します。一方で、本当に難しい問題では常にゼロのスターしか得られず、生徒は学習を諦め、挑戦を止めてしまいます。なぜなら、何のフィードバックも得られないからです。

XRPO は、この問題を解決するために設計された新しい教育フレームワークです。それは、その瞬間の生徒の必要に応じて戦略を変化させる、超優秀なチューターのように機能します。その仕組みは、以下の 3 つの単純なトリックに分解して説明できます。

1. 「賢い賭け」戦略(ターゲットを絞った探索)

古い方法では、問題が簡単か難しいかに関わらず、生徒はすべての問題に対して 16 回推測することを強いられていました。

  • XRPO の解決策: チューターは問題を確認し、「生徒が最も混乱しているのはどこか?」と問います。
    • 問題が難解で、生徒の答えが散漫である場合(不確実性が高い場合)、チューターは「よし、この問題には 20 回試してみよう!」と言います。なぜなら、学習が起きるのはそこだからです。
    • 生徒がすでにその問題に精通している場合、チューターは「素晴らしい、1 回の推測で十分だ」と言います。
    • 比喩: これは、公平だと分かっているコインの表裏に賭けるのをやめ、ゲームを変える可能性が最も高いサイコロの目に全財産を賭けるギャンブラーのようです。これにより時間が節約され、最も重要な部分に努力が集中します。

2. 「ヒント付きのカンニング」トリック(ICL シーディング)

時には、生徒があまりにも難しい問題に直面し、毎回ゼロのスターしか得られないことがあります。古いシステムでは、生徒は空白のページをじっと見つめて落胆し、教師は生徒が「正解」を一度も生み出さなかったため、何の助けも与えられませんでした。

  • XRPO の解決策: チューターは密かに「カンニングペーパー」を生徒の手に忍び込ませます。これは現在の問題の答えではなく、生徒が過去に正しく解いた「類似した問題」です。
    • 比喩: パズルに詰まっていると想像してください。それをじっと見つめる代わりに、誰かが昨日あなたが解いた類似のパズルの写真を手渡します。すると、あなたはふと「あっ!あの時と同じ手を使えばいいんだ!」と気づきます。これにより、生徒は「詰まった」状態から抜け出し、以前は越えられなかった壁を突破する手助けとなります。

3. 「創造性の報酬」ボーナス(新規性の鋭敏化)

古いシステムでは、生徒が正解すればゴールドスターがもらえました。それが退屈で標準的な方法であれ、賢くユニークな方法であれ、結果は同じでした。これにより、生徒の答えはすべて同じように見え、創造性を発揮しようとする意欲が削がれました。

  • XRPO の解決策: チューターは正解を確認し、「正解だが、非常に珍しい方法で解いたね!素晴らしい」と言います。
    • 比喩: 料理コンテストを想像してください。全員が完璧なハンバーガーを作れば、全員が同じスコアになります。しかし、XRPO は、自分が発明した秘密の希少なスパイスを使って完璧なハンバーガーを作った人に、追加ポイントを与えます。これにより、生徒は最も一般的な解を単にコピーするのではなく、新しい創造的な道を探求するよう促されます。

結果

研究者がこの新しい「チューター」(XRPO)を従来の方法と比較してテストしたところ、以下の結果が得られました。

  • 学習が速くなった: 生徒は、以前よりも半分以上短い時間で同じレベルのスキルに達しました(2.7 倍速)。
  • 賢くなった: 生徒は、特に以前は手こずっていた非常に難しい問題を含む、より多くの問題を正しく解けるようになりました。
  • 効率的だった: 生徒は長くて支離滅裂な答えを書く時間を浪費しませんでした。簡潔で直接的である方法を学びました。

要約すると、XRPO は AI が盲目的に推測することを止め、人間のような学習者として扱うことを始めます。つまり、難しい部分に焦点を当て、詰まったときにヒントを与え、賢い思考に報酬を与えるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →