非常に賢い生徒(大規模言語モデル)に難しい数学の問題を解く方法を教えることを想像してください。現在、これを行う最良の方法はGRPOと呼ばれる手法です。GRPO を、生徒に同じ質問に対する8 つの異なる答えを書き出すよう求める教師と想像してください。教師はこれらの 8 つの答えを比較します。いくつかは正しく、いくつかは間違っていれば、生徒はどの戦略が最も効果的だったかを学びます。
しかし、この論文は、この「8 つの答え」方式には、生徒が陥りうる 2 つの大きな欠陥、つまり 2 つの罠があると指摘しています。
「すべてか無か」の罠(勾配消失):
- 問題点: 質問が難しすぎず、生徒が 8 つの答えすべてを正解してしまう場合や、逆に難しすぎて 8 つすべてを間違えてしまう場合、答え間に差がないため、教師は生徒にどのように改善すべきかを伝えられません。まるで教師が「よくやった!」あるいは「もう一度挑戦しなさい!」と言うだけで、なぜそうなのかを説明しないようなものです。生徒は有用なフィードバックを得られず、学習を停止してしまいます。
- 論文の解決策: 同じ質問を 8 回繰り返す代わりに、教師は同じ質問を言い換えて(語順を変えたり、異なる形式を使ったり、異なる角度から物語を語ったりするなど)出題します。
- 比喩: 友人に「2+2 は何?」と尋ねたとします。彼らは「4」と答えます。簡単です。次に、「リンゴを 2 つ持っていて、さらに 2 つ手に入れたら、全部でいくつありますか?」と尋ねます。彼らは「4」と答えるかもしれません。次に、「私は靴が 2 足あります。靴は全部で何足ですか?」と尋ねます。彼らは立ち止まって、より深く考えるかもしれません。数学は同じでも、質問の仕方が変われば、生徒の考え方も変わります。元の質問をこれらの「言い換えられた隣接質問」と混ぜることで、生徒はグループ全体で正解と不正解の両方が混在する可能性が高まり、教師は作業に使える豊富な有用なフィードバックを得ることができます。
「エコーチェンバー」の罠(多様性の崩壊):
- 問題点: 生徒がいくつかの答えを正解し、いくつかを間違えたとしても、8 つの答えすべてに対して同じ推論パターンを使い続ける傾向があります。まるで生徒に問題解決の「お気に入り」の方法が 1 つしかなく、他の方法を試すことを拒んでいるかのようです。彼らは新しい戦略を探求することをやめてしまいます。
- 論文の解決策: 言い換えられた質問は異なるように見えるため、生徒はそれらを解くために異なる戦略を試すことを強いられます。質問のバージョンの 1 つは「数式」アプローチを誘発し、別のバージョンは「視覚的」アプローチを誘発するかもしれません。
- 比喩: 料理人にハンバーガーを作らせることを想像してください。「ハンバーガーを作ってください」とだけ言えば、彼らは毎回全く同じものを作るかもしれません。しかし、「パンを下に置いてハンバーガーを作ってください」、「肉をサイコロ状に切ってハンバーガーを作ってください」、「チーズを先に溶かしてハンバーガーを作ってください」と言えば、料理人は異なる技術を実験せざるを得なくなります。これにより、料理人はより幅広い調理スタイルを探求することを強いられて、全体としてより優秀で多様な料理人になります。
新しい手法(TA-GRPO)の仕組み
著者たちは、新しい手法をTA-GRPO(Transformation-Augmented GRPO、変換拡張 GRPO)と呼んでいます。シンプルなレシピは以下の通りです。
- 数学の問題を 1 つ選びます。
- AI ツール(GPT-4 など)を使って、その問題を意味を変えずに 3 回、異なる方法で書き換えます。
- 生徒に元の問題と3 つの新しいバージョンを解かせ、4 つのバージョンのそれぞれに対して 8 つの答えを生成させます。合計 32 の答えになります!
- 教師はすべての 32 の答えをまとめて見て、どの戦略が最も効果的だったかを判断します。
- 重要なのは、生徒が質問の異なるバージョンを解いたとしても、教師は元の質問に基づいて生徒の脳を更新する点です。これにより、生徒は特定の言い回しに答える方法ではなく、核心的な概念を学ぶことになります。
結果
この論文は、難易度の高い数学コンテスト(AMC や AIME など)を用いて、4 つの異なる AI モデル(小規模から中規模まで)でこの手法をテストしました。
- スコアの向上: TA-GRPO は、標準的な手法よりも一貫して高いスコアを記録しました。例えば、最も難しい数学テストでは、平均して成功率が約 5 ポイント向上しました。
- 賢明な探求: モデルは単に運が良かっただけではなく、実際にはより多様な問題解決方法を試みました。
- データ効率: 最も印象的な発見は、TA-GRPO が2.5 倍のデータでモデルを訓練した場合と同等の結果を達成したことです。つまり、質問をより賢い方法で出すことで、モデルは追加の教科書の巨大なライブラリを与えられた場合と同じくらい学習したことになります。
注意点
論文は、1 つの小さなコストに言及しています。言い換えられた質問を得るためには、書き換えを行うために強力な AI(GPT-4-Turbo)を使用するための少額の費用が必要です。また、モデルがステップごとに多くの質問を処理しなければならないため、訓練に少し時間がかかります。しかし、著者たちは、パフォーマンスの向上がこの追加の努力に見合うと主張しています。
要約: TA-GRPO は、AI モデルが同じ質問を多くの異なる「衣装」で出されることで退屈したり行き詰まったりすることを防ぎます。これにより、モデルはより創造的に考え、より効果的に学習することを強いられます。単に問題に対してより多くのデータを投げることに比べ、時間と費用を節約できます。
技術的概要:変換拡張 GRPO(TA-GRPO)
問題定義
群相対方策最適化(GRPO)は、特に複雑な推論タスクにおいて、大規模言語モデル(LLM)における検証可能報酬を伴う強化学習(RLVR)の支配的な手法として浮上してきた。しかし、本論文は、効果的な探索を阻害する標準的 GRPO に存在する 2 つの構造的限界を特定している。
- 勾配の消失: 訓練質問が「易しすぎる(すべてのサンプリングされた回答が正しい)」か「難しすぎる(すべてが誤り)」と認識された場合、G個の回答群は同一の報酬を受け取る。その結果、報酬の標準偏差がゼロとなり、利得(advantages)がゼロになり、モデル更新のための勾配信号が失われる。動的サンプリング(DAPO)はこのような質問を破棄することでこれを緩和しようとするが、その結果としてデータの大規模な無駄が生じる。
- 多様性の崩壊: モデルは、G個のサンプリングされた回答全体において単一の推論パターンに収束する傾向がある。LLM の広大な行動空間のため、古典的なエントロピー正則化はこの現象を防げない。方策が狭い範囲の推論軌跡に集中すると、サンプリング分布もこの集中性を継承し、目的関数には支持範囲を広げることを報酬付けるメカニズムが欠如しているため、探索可能な解空間は単調に収縮する。
既存の GRPO の進展は、これらの問題に断片的に対処するか、データを破棄することに依存しており、最適化フレームワーク内で根本原因を共同で解決するものではない。
手法:変換拡張 GRPO(TA-GRPO)
著者は、質問の言い換えを通じて勾配の消失と多様性の崩壊の両方に対処する方策最適化手法である TA-GRPO を提案する。核心的な洞察は、言語的摂動(言い回し、形式、情報の順序の変更)がモデルの認識される難易度を変化させ、潜在的な問題意味論を保持しつつ、異なる解決戦略を誘発し得るという点にある。
TA-GRPO パイプラインは、標準的な GRPO プロセスを以下のように修正する。
- 質問変換: 各元の訓練質問 q0 に対して、システムは GPT-4-Turbo を用いて、N個の問題等価な言い換え {qn}n=1N(「近傍」と呼ばれる)を自動的に生成する。これらの言い換えは、潜在的な意味を保持しつつ、表面形式を変更する。
- 拡張された回答群: 元の質問 q0 に対してのみ G 個の回答をサンプリングする代わりに、モデルは元の質問に対して G 個の回答を、また各 N 個の近傍に対してそれぞれ G 個の回答をサンプリングする。これにより、(N+1)×G 個の回答からなる拡張された群が作成される。
- 結合された利得計算: 利得は、各言い換えごとに個別に正規化するのではなく、(N+1)×G 個の回答からなる拡張された全体セットに対して群相対正規化を通じて計算される。
- 勾配の消失の緩和: 元の質問が一様な報酬をもたらす場合でも、認識される難易度のシフトにより、言い換えられた近傍はしばしば混合した報酬(一部は正解、一部は誤り)をもたらす。結合正規化により標準偏差がゼロにならないことを保証し、勾配信号を保持する。
- 多様性の崩壊の緩和: 多様な言い換えが同一の群内で異なる推論パターンを誘発し、方策が単一モードに崩壊するのを防ぐ。
- アンカーされた重要度比: モデルが元の質問を解くことを学習することを保証するため、すべての重要度比は、特定の回答がどの言い換え(qn)から生成されたかに関わらず、元の質問 q0 に条件付けられる。これは、問題等価な言い換えが同様の推論軌跡をもたらすという仮定に基づき、言い換えを q0 の代理サンプリング分布として扱うものである。
目的関数は、この拡張された群に対してクリップされた代理損失を最大化し、利得は結合正規化から導かれ、重要度比は元のプロンプトにアンカーされている。
主要な貢献
本論文は、4 つの主要な貢献を概説している。
- 見過ごされていた問題の特定: 既存の GRPO の進展は、これらを個別に、またはデータフィルタリングを通じて対処することが多く、勾配の消失と多様性の崩壊が largely 見過ごされていることを浮き彫りにしている。
- TA-GRPO アルゴリズム: 質問とその言い換えられた近傍にわたる回答をプールし、結合された利得を計算し、更新を元の質問にアンカーすることで、両方の問題に同時に対処する単純な拡張。
- 経験的有効性: 広範な実験により、コンペティションレベルのベンチマーク(AMC、OlympiadBench、AIME24/25)および分布外ベンチマーク(Minerva、GPQA-Diamond)の両方において、4 つの LLM(Qwen3-1.7B/4B、Llama-3.2-1B/3B)で pass@k が一貫して向上することが示された。
- データ効率: TA-GRPO は、追加の高品質訓練データの収集を必要とせず、最大2.5 倍のデータで訓練されたベースラインと同等のパフォーマンスを達成し、データスケーリングに対する経済的な代替案を提供する。
実験結果
著者は、MATH データセット(7,498 問)を訓練セットとして使用し、TA-GRPO を評価した。
- 訓練信号の診断: 訓練チェックポイントの分析により、標準的 GRPO は訓練が進むにつれて勾配の消失(93.2% までの質問が一様な報酬をもたらす)と多様性の崩壊(集中した埋め込み距離)にますます苦しむのに対し、TA-GRPO は訓練全体を通じて混合された報酬と多様な推論経路の安定したマージンを維持することが示された。
- 性能向上:
- コンペティションレベルのベンチマークにおいて、TA-GRPO は Qwen3-1.7B および Qwen3-4B に対して平均 pass@32 をそれぞれ5.09および5.01ポイント向上させ、Llama-3.2-1B および Llama-3.2-3B に対して3.50および5.25ポイント向上させた。
- 顕著なピーク改善には、AIME24 における Qwen3-4B で**+9.98**、GPQA-Diamond における Qwen3-1.7B で**+8.58**が含まれる。
- 対照実験:
- マッチドサンプリング: TA-GRPO の予算に一致するようにサンプリングされた回答の総数を増加させた(言い換えなし)ベースラインと比較した場合、TA-GRPO は依然として明確なマージンを維持した(例:Qwen3-4B の AIME24 で +6.86)。これは、向上が単なるサンプルサイズではなく、サンプリング空間の多様性と結合正規化に由来することを確認する。
- データスケーリング: 1 倍のデータで訓練された TA-GRPO は、2.5 倍のデータで訓練された GRPO ベースラインと同等のパフォーマンスを達成し、顕著なデータ効率を示した。
意義と主張
本論文は、TA-GRPO を RL 事後訓練のパラダイムを転換する手法として位置づけている。以前の研究は損失関数や報酬軸の最適化に焦点を当てていたが、TA-GRPO は探索を強化するための第 3 のレバーとして入力分布を導入する。問題等価な言い換えを活用することで、この手法はデータを破棄したりエントロピー正則化に依存したりすることなく、モデルがより豊かな解決試行から学習することを可能にする。著者は、このアプローチが、データ収集が高価な場合や、標準的 GRPO が十分な勾配信号を提供できないようなシナリオにおいて、LLM の推論能力を向上させるための堅牢かつデータ効率的な経路を提供すると主張している。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録