CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization
本論文は、正解と却下されたロールアウトの両方を利用して対照的報酬信号を生成し、多モーダル数学推論ベンチマークにおいて GRPO などの既存のベースラインを上回る性能を発揮しながら、決定的な推論ステップを正確に特定し情報漏洩を回避する新しい RLVR 自己蒸留手法である対照的証拠方策最適化(CEPO)を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに複雑な数学の問題を解く方法を教える場面を想像してください。ロボットが問題を解こうとし、正解したときにはゴールドの星を与え、間違えたときには「もう一度試せ」という信号を与えます。
これが現在の AI 訓練の仕組み(RLVRと呼ばれる)です。しかし、このアプローチには大きな問題があります。ロボットは、いくつかの言葉が素晴らしい洞察であったとしても、他の言葉が単なる「えーと」「つまり」「したがって」であったとしても、入力したすべての単語に対して同じゴールドの星を受け取るのです。
まるで、教師が生徒に、たった一つの素晴らしい文章しか書いておらず、残りは単なるつなぎ言葉だったとしても、そのエッセイ全体に対して A+ を与えるようなものです。ロボットは、実際に問題を解決した「どの」特定の単語なのかを知らないので、学習が遅く、混乱してしまいます。
従来の修正策(そしてなぜ失敗したか)
科学者たちは、「よし、ロボットが書く前に正解を教え、それがどのように異なる文章を書いたかを見てみよう」と言うことで、この問題を修正しようと試みました。
しかし、これにより**「情報漏洩」**と呼ばれる新たな問題が生じました。
- 比喩: 試験中に学生がカンニングしていると想像してください。学生に解答用紙を「書きながら」教えると、彼らは数学を学ぶ代わりに解答用紙を丸暗記するかもしれません。彼らは解答用紙のように見えるが、実際には意味をなさないものを書き始めるのです。この論文は、従来の手法がまさにこれを行っていたことを発見しました。AI は推論を学ぶのではなく、解答を丸暗記することで「カンニング」を始めたのです。
新しい解決策:CEPO
著者たちは、CEPO(Contrastive Evidence Policy Optimization)と呼ばれる新しい手法を提案しています。これは、簡単な比喩を用いて次のように機能します。
「善玉刑事・悪玉刑事」の尋問
単にロボットに「正解は得られましたか?」と尋ねる代わりに、CEPO はより鋭い質問をします:「この特定の単語は、正解を得るのに役立ちましたか、そして誤った答えを得る可能性を減らしましたか?」
- 善玉教師(正解): AI は正解の解法を見て、「もし答えが正しいと知っていたら、私はこの単語を書いただろうか?」と問います。
- 悪玉教師(誤答): AI は失敗した試行(すでに試して間違えたもの)を見て、「もし間違った答えを得ようとしていたなら、私はこの単語を書いただろうか?」と問います。
魔法のような比較:
- 「つなぎ」の単語: もし単語が単に「したがって」や「the」であれば、善玉教師も悪玉教師もいずれにせよそれを書いていたでしょう。両者が同意するため、その単語は中立スコアとなります。追加の加点はありません。
- 「決定的」な単語: もし単語が「2 で割る」のような重要な数学のステップであれば、善玉教師は「はい、それが必要だ!」と言いますが、悪玉教師は「いいえ、私はそれをしない!」と言います。両者が異なっているため、AI は**「ああ!この単語が問題を解決する鍵だ!」**と気づきます。それは莫大な加点を得ます。
なぜこれが優れているのか
- カンニングなし: AI は同じ試行のバッチから「正解」の経路と「誤答」の経路を比較するため、解答が訓練プロセスに漏洩することはありません。安全を保ち、実際の論理を学びます。
- 精度: 「the」や「and」を書いたことに対してロボットを称える時間を無駄にすることをやめます。パズルを実際に解決した特定のステップにすべての称賛を集中させます。
結果
この論文は、幾何学と論理を含む数学の問題を用いて、20 億パラメータと 40 億パラメータの 2 つのサイズの AI モデルでこれをテストしました。
- 勝者: CEPO は、従来の最良の手法を一貫して凌駕しました。
- 敗者: 解答を漏洩させることで「カンニング」しようとした従来の手法(OPSD および SDPO と呼ばれる)は、訓練されていないロボットよりも悪いパフォーマンスを示しました。これは、著者たちの理論が正しいことを証明しました。AI が解答を丸暗記しないように防がなければ、それは愚かになるのです。
まとめ
CEPO を賢いスポットライトと考えてください。ステージ全体(文章全体)に明るい光を当てるのではなく、実際にパンチラインを届けている俳優だけにズームインします。背景のノイズやつなぎ言葉を無視し、AI が解答用紙を偶然に丸暗記することなく、何が解決を可能にしたかを正確に学ぶことを保証します。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。