Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity
本論文は、検証可能な報酬を用いた標準的な強化学習(RLVR)の目的関数が、正解間の確率質量の分布に対して無関心であるため多様性の崩壊を引き起こすことを特定し、有効な出力に対して均一性を強制する Uniform-Correct Policy Optimization(UCPO)を提案し、これにより単一試行の精度を維持しつつマルチサンプルの多様性とカバレッジを大幅に向上させる。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
「Uniform-Correct Policy Optimization」という論文を、平易な言葉と日常的な比喩を用いて解説します。
大きな問題:「画一的」な罠
あなたが数学の問題を解くために、優秀な生徒を訓練していると想像してください。あなたは彼に、「あなたの目標は正解を得ることだ」と伝えます。
AI の世界では、これをRLVR(検証可能な報酬を用いた強化学習)と呼びます。AI が問題を解こうとし、答えが正しければ「ゴールドスター」を獲得します。
問題点:
この論文は、標準的な訓練手法(GRPO など)は、ゴールドスターを「獲得すること」にあまりにも焦点が当たりすぎており、生徒がそれを「どのように」獲得したかには関心がないと主張しています。
3 つの異なる有効な解法(方法 A、方法 B、方法 C)がある数学の問題を想像してください。
- 従来の方法(GRPO): AI は 3 つすべてを試します。純粋な偶然で、方法 A を使って 1 つの問題を解きます。ゴールドスターを獲得します。スターを獲得したため、AI は「方法 A が最高だ!次はそれを使おう」と考えます。そして、方法 B と C の試行を止めてしまいます。
- 結果: AI は方法 A の達人になります。1 回試せばほぼ毎回正解を得られます(Pass@1)。しかし、64 回試して「いかなる解」でも見つけられるかどうかを問うと、失敗します。なぜなら、方法 B と C を忘れてしまったからです。AI は単一の狭い習慣へと収束してしまいました。
この論文はこれを**「多様性の崩壊(Diversity Collapse)」**と呼びます。AI は一芸に秀でた存在(one-trick pony)になってしまうのです。
診断:なぜこれが起こるのか
著者らは、これが起こる主な 2 つの理由を突き止めました。
- 目標が曖昧すぎる: 訓練のルールは「正解を最大化せよ」と言っていますが、「正解を最大化し、かつ可能なすべての方法を使ってみるよう努めよ」とは言っていません。そのため、AI は無関心になります。多様であるべきだと認識していないのです。
- 「富める者がさらに富む」サイクル:
- 想像してください。AI が偶然、方法 A を選ぶ確率が少し高いとします。
- 方法 A をより頻繁に選ぶため、それについてより多くの練習を積むことになります。
- 訓練による更新が、方法 A をさらに強力にします。
- すると、方法 A をさらに頻繁に選ぶようになります。
- 最終的に、方法 B と C は選ばれなくなり、AI はそれらを再び学ぶ機会を失います。それらは消滅してしまうのです。
解決策:「Uniform-Correct」方策
著者らは問いかけました。「複数の正解がある場合、AI が振る舞うべき『完璧な』方法とは何か?」
彼らは、AI は**Uniform-Correct(均一かつ正解)**であるべきだと結論付けました。
- Uniform(均一): すべての有効な解(方法 A、B、C)を完全に同じように扱うべきです。それぞれに均等な機会(それぞれ 33%)を与えるべきです。
- Correct(正解): 間違った答えに時間を浪費してはいけません。
これは、完璧なオムレツを作る 3 つの異なる方法を知っているシェフのようなものです。「Uniform-Correct」なシェフは、最初に作ったものだけに固執するのではなく、3 つすべての方法を均等に使い回すことで、他の作り方を忘れることがありません。
新しいツール:UCPO
「画一的」な罠を修正するために、著者らはUCPO(Uniform-Correct Policy Optimization)と呼ばれる新しい訓練手法を開発しました。
仕組み(比喩):
AI が生徒たち(異なる解)のクラスを採点する教師だと想像してください。
- 従来の方法(GRPO): 教師は、最初に手を挙げた生徒だけを褒めます。他の生徒は黙り込み、やがて手を挙げることやめてしまいます。
- 新しい方法(UCPO): 教師はクラス全体を見渡します。生徒 A が頻繁に手を挙げている場合、教師は「よくやったが、まだあまり手を挙げていない生徒 B と生徒 C に特別なボーナスを与えよう」と言います。
UCPO は訓練に「ペナルティ」を追加します。AI が特定の解を過度に好むようになると、訓練がそれを押し戻し、「いいえ、すべての正解の間で注意をより均等に配分する必要がある」と伝えます。
結果:何が起きたか
チームは、小規模から大規模までの 3 つの異なる AI モデルで、難易度の高い数学ベンチマーク(AIME 数学コンテストなど)を用いてこれをテストしました。
- 精度は高く維持された: AI は、従来の手法と同様に、1 回目で正解を得る能力(Pass@1)に優れていました。
- 多様性が劇的に向上した: AI に 64 回の異なる試行を生成させたとき、より多くのユニークで正解の解を見つけています。
- 最も難しいテスト(AIME24)において、新しい方法は、64 回の試行の中で「いかなる」正解も見つける能力を**10%**向上させました。
- 解答で使用された数式のバリエーションは**45%**増加しました。
まとめ
この論文は、標準的な AI 訓練がモデルを硬直化させていることを示しています。つまり、正解になる 1 つの方法を見つけると、それに固執し、他のすべての有効な方法を忘れてしまうのです。新しい手法UCPOは、AI がすべての選択肢を維持し、すべての正解の経路を等しく価値あるものとして扱うよう強制します。これにより、精度を犠牲にすることなく、AI はより堅牢で創造的になります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。