← 最新の論文
🤖 machine learning

Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information

本論文は、困難な推論問題における学習の崖を克服するために訓練中に特権的なガイダンスを活用し、かつ重要度補正を用いることでモデルが本来のガイダンスなしの目的関数を最適化することを保証する強化学習アルゴリズムであるOff-Context GRPO(OC-GRPO)を導入しており、その結果、数学的ベンチマークにおいて大幅な性能向上を実現している。

原著者: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Priyank Agrawal, Ankur Samanta, Shervin Ghasemlou, Jalaj Bhandari, Kavosh Asadi, Daniel Jiang, Aditya Modi

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

難しい数学パズルを解くように訓練されているロボットと、その答えが正しいか間違っているかを即座に判定できる先生がいる場面を想像してください。学習者と、正解か不正解かの明確な判定を下す自動判定器というこのセットアップは、AI研究者の間で「Reinforcement Learning with Verifiable Rewards」と呼ばれています。ロボットはパズルに挑戦し、正解すれば「親指を立てる(報酬)」、そうでなければ「親指を下に向ける(報酬ゼロ)」をもらい、多くの試行を通じて、より多くの「親指を立てる」を集めるように学習していきます。

問題は、いくつかのパズルがあまりにも難しいため、すべての試行が失敗してしまうことです。すべての試行が失敗すると、すべての判定が同一になってしまい、比較対象がなくなり、先生は手がかりにすべき信号を失ってしまいます。これは、ペダルを回した瞬間に転んでしまう中で、自転車の乗り方を学ぼうとするようなものです。バランスが取れている感覚を一度も味わえないため、積み重ねるべきものが何もありません。これは「学習の崖(learning cliff)」と呼ばれます。

明らかな解決策は、「カンニングペーパー(ヒントや解法の最初の数ステップ)」を与えて、ロボットが少なくとも時々成功できるようにすることです。それは機能しますが、一つの厄介な疑問を生みます。提示された勝利に対して、ロボットは実際にどれほどの功績があるのでしょうか?

この論文はその問いに適切に答えています。その手法である Off-Context GRPO(OC-GRPO)は、「カンニングペーパーがなかった場合に、ロボットがその正確な解に到達できた確率はどのくらいだったか?」を問う補正を適用します。報酬がフルで与えられることは決してありません。報酬の一部は常にヒントに属しており、どれだけが残るかは、ロボットがすでにどれほど有能であったかに依存します。自力で解く寸前まで来ていたロボットは、カンニングペーパーがすでにそこにあった能力を引き出しただけなので、報酬の大部分を保持します。一方で、成功の可能性が実質的にゼロだったロボットは、報酬をほとんど保持できません。なぜなら、カンニングペーパーは能力を明らかにしたのではなく、スキルを代替してしまったからです。カンニングペーパーは、存在しないスキルから進歩を生み出すことはできません。ミスについては逆のことが言えます。答えの半分が目の前にある状態でパズルを間違えた場合は、通常の失敗よりも重いペナルティが課されます。なぜなら、助けがあっても失敗したことは、助けがなくても失敗したことよりも、より強い証拠となるからです。自力での能力がほぼゼロである最も難しいパズルにおいては、ほとんどの真の学習は、補助による勝利ではなく、この増幅されたペナルティを通じてもたらされます。ロボットは、読み取ったことに対して祝福されるのではなく、まだ明らかにできないことへと押し出されるのです。

結果として、ロボットは助けを借りながら練習したとしても、常に(ヒントのあるものではなく)本物のパズルに基づいてスコアを付けられます。

標準的な数学ベンチマークにおいて、OC-GRPOは標準的な学習手法と比較して、実質的な追加コストなしに、平均精度を27.8%から31.7%へと向上させました(相対的に13.8%の向上)。この補正は、より小さなモデルにおいて最も重要となります。従来のヒントベースの手法では、学習能力が低いモデルはヒントのあるパズルとないパズルの不一致を吸収できないため、実際には通常の学習よりも性能が悪化しますが、OC-GRPOはテストされたすべてのサイズにおいてその利点を維持しています。より広範な教訓は、特権的なヒント(privileged hints)は探索を導くための完璧に優れた方法であるということです。ただ、その功績を正直に割り当てる必要があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →