← 最新の論文
🤖 machine learning

ReCo: Reweighting GRPO Against Distributional Concentration

本論文は、応答の寄与度を正規化し、重要度比を分散に基づくスケーリングに置き換えることで、GRPOが高確率な応答やトークンに集中する傾向を緩和し、小規模kにおける精度を犠牲にすることなく数学的推論ベンチマークにおけるPass@k性能を向上させる再重み付け手法であるReCoを紹介している。

原著者: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

公開日 2026-07-30
📖 1 分で読めます☕ さくっと読める

原著者: Junoh Park, Junseo Hwang, Wonguk Cho, Taesup Kim

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータが単にチャットをするだけでなく、数学の問題やコーディングの課題のような複雑なパズルを実際に「思考」する世界を想像してみてください。これは人工知能(AI)の最前線であり、「強化学習」と呼ばれる分野です。これは犬の訓練に似ています。ただ犬に何をすべきか教えるのではなく、実際に試させてみて、もし座ったらおやつを与え、ソファに飛び乗ったら与えない、というものです。時間が経つにつれ、犬はおやつが欲しいために座ることを学びます。AIの世界では、コンピュータが問題を正しく解いたときに「報酬」を与えます。

これらのAIという「犬」を訓練する一般的な方法の一つに、「Group Relative Policy Optimization(GRPO)」があります。例えば、AIに数学の問題を10回解くよう頼んだとします。すると、AIは10通りの異なる答えを生成します。GRPOはこれら10個すべてを確認し、どれが「おやつ」を得たか(正解だったか)を見て、成功したものに似た振る舞いをするようにAIを促します。これはAIがより賢くなるための巧妙なトリックです。しかし、落とし穴があります。おやつを得ようと急ぐあまり、AIが自信過剰になり、新しいことを試すのをやめてしまうことがあるのです。AIは同じいくつかのテクニックを何度も繰り返すようになり、同じくらいうまく機能するかもしれない他の巧妙な解法を無視してしまいます。

このパズルを解決しようとしたのが、ソウル大学の研究チームです。彼らは、GRPOがAIを素早く問題を解くように賢くする一方で、AIの創造性を低下させ、多くのチャンスを与えても正しい答えを見つける可能性を低くしてしまうことに気づきました。彼らはこの問題を「分布の集中(distributional concentration)」と呼びました。これは、AIがすでに安全だと分かっている道だけを探索し、マンネリ化してしまうことを意味する、少し難しい言葉です。

この問題を解決するために、チームは「ReCo(Reweighting GRPO Against Distributional Concentration)」と呼ばれる新しい手法を考案しました。これがどのように機能するか、簡単な比喩を使って説明しましょう。

あなたが、クラスの生徒たちが皆、同じ難しい数学の問題に取り組んでいる中で、その採点を行う教師だと想像してください。

  • 従来の方法(GRPO): あなたはクラスに答えを書かせます。もし5人の生徒が全く同じ解法を書いた場合(それが最もポピュラーな解法であるため)、あなたは、その解法に多大な注目を与えます。「見て!5人がこうやったよ!みんなこうすべきだ!」とクラス全体に伝えます。一方で、一人だけが試した独創的で変わった方法が正解だったとしても、それは「唯一無二」であったために無視されてしまいます。クラスは新しいことに挑戦するのをやめ、ただ人気の解答をコピーするようになります。

  • 新しい方法(ReCo): 教師(ReCo)はこの偏りに気づきます。まず、もし5人の生徒が同じ答えを書いたなら、それはその答えが最高だからではなく、単に見つけやすかったからだと判断します。そこで、そのポピュラーな答えの重要性を引き下げます。「よし、君たちは5人ともこれを書いたけれど、あまりに一般的だったので、ユニークな解法ほどはカウントしないよ」と言うのです。これにより、クラスが盲目的に群衆を模倣することを防ぎます。

  • 二つ目のトリック: 教師はまた、生徒たちが「どのように考えているか」にも注目します。もしある生徒が数学の特定のステップに対して99%の自信を持っているなら、教師はこう言います。「素晴らしい、自信はあるね。でも、あまり調子に乗らないように!まだ間違いである可能性がわずかに残っているから、他の可能性に対しても心を開いておこう」。しかし、もし生徒が道の分岐点でどちらに進むべきか迷っているなら、教師はその不確実性に対して大きな励ましを与えます。これにより、生徒たちが早い段階で一つの硬直した考え方に固執してしまうのを防ぎます。

これらの二つのトリックを使うことで、ReCoはAIの学習方法を変えます。AIが「安全な」答えを暗記するだけでなく、さまざまな道を探索し続けるようにさせるのです。

研究チームはこの新手法を、AIME(アメリカ・インビテーショナル・数学試験)やオリンピック問題のような非常に難しい数学コンテストでテストしました。QwenやLlamaに基づいた様々なAIモデルを使用しました。結果は有望でした。AIに数回だけ試行させた場合、ReCoは従来の方法と同じくらい優れた性能を発揮しました。しかし、AIに多くのチャンスを与えた場合(例えば、64通りの異なる回答を生成させ、その中からベストなものを選ぶ場合)、ReCoは真価を発揮しました。従来の方法が見逃してしまった正解を見つけ出したのです。

実際、最も難しいテストの中には、試行回数を増やすと、従来のメソッド(GRPO)が未訓練の元のAIよりも性能が悪くなってしまうものがありました。それは、思考が狭まってしまったためです。しかし、ReCoはAIの「心」を開いたままにしておきました。多様な解法を見つける能力を維持し、たとえ最初の数回の試行が失敗しても、AIが頼れる多様な戦略のツールボックスを常に持っていられるようにしたのです。

チームはまた、なぜこのようなことが起こるのかについても調査しました。従来の方法の下では、AIの「思考プロセス」は、同じ曲を何度も再生する壊れたレコードのように、非常に反復的なものになっていました。ReCoの下では、AIは同じ問題を解いているときでも、ユニークで多様なアプローチを生成し続けました。それは、教科書をただ写すのではなく、図を描いたり、異なる公式を使ったり、さらには概念を理解するために物理的なモデルを作ったりする生徒を見ているかのようでした。

要約すると、ReCoは、AIを真に賢くするためには、単に素早く正解を得ることに報酬を与えるだけでは不十分であることを示唆しています。私たちは、AIがマンネリ化しないように促すことも必要です。多様性と不確実性を価値あるものとしてAIに優しく促すことで、研究者たちは、デジタルな脳の好奇心と創造性を保ち、私たちが予想もしなかったような方法で問題を解決できる能力を持たせる方法を見つけ出したのです。これは、時には選択肢を広げておくことこそが、最良の学習方法であるということを教えてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →