← 最新の論文
🤖 machine learning

Transformation-Augmented GRPO for Enhancing Exploration in Reasoning of Large Language Models

本論文は、問題と等価な言い換えを生成して混合報酬と多様な探索経路を創出することにより、大規模言語モデルの推論における勾配消失と多様性の崩壊を緩和し、複雑な数学的ベンチマークにおける性能を著しく向上させる手法として、変換増強型GRPO(TA-GRPO)を提案する。

原著者: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Khiem Le, Phuc Nguyen, Youssef Mroueh, Chi-Heng Lin, Shangqian Gao, Ting Hua, Nitesh V. Chawla

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に賢い生徒(大規模言語モデル)に難しい数学の問題を解く方法を教えることを想像してください。現在、これを行う最良の方法はGRPOと呼ばれる手法です。GRPO を、生徒に同じ質問に対する8 つの異なる答えを書き出すよう求める教師と想像してください。教師はこれらの 8 つの答えを比較します。いくつかは正しく、いくつかは間違っていれば、生徒はどの戦略が最も効果的だったかを学びます。

しかし、この論文は、この「8 つの答え」方式には、生徒が陥りうる 2 つの大きな欠陥、つまり 2 つの罠があると指摘しています。

  1. 「すべてか無か」の罠(勾配消失):

    • 問題点: 質問が難しすぎず、生徒が 8 つの答えすべてを正解してしまう場合や、逆に難しすぎて 8 つすべてを間違えてしまう場合、答え間に差がないため、教師は生徒にどのように改善すべきかを伝えられません。まるで教師が「よくやった!」あるいは「もう一度挑戦しなさい!」と言うだけで、なぜそうなのかを説明しないようなものです。生徒は有用なフィードバックを得られず、学習を停止してしまいます。
    • 論文の解決策: 同じ質問を 8 回繰り返す代わりに、教師は同じ質問言い換えて(語順を変えたり、異なる形式を使ったり、異なる角度から物語を語ったりするなど)出題します。
    • 比喩: 友人に「2+2 は何?」と尋ねたとします。彼らは「4」と答えます。簡単です。次に、「リンゴを 2 つ持っていて、さらに 2 つ手に入れたら、全部でいくつありますか?」と尋ねます。彼らは「4」と答えるかもしれません。次に、「私は靴が 2 足あります。靴は全部で何足ですか?」と尋ねます。彼らは立ち止まって、より深く考えるかもしれません。数学は同じでも、質問の仕方が変われば、生徒の考え方も変わります。元の質問をこれらの「言い換えられた隣接質問」と混ぜることで、生徒はグループ全体で正解と不正解の両方が混在する可能性が高まり、教師は作業に使える豊富な有用なフィードバックを得ることができます。
  2. 「エコーチェンバー」の罠(多様性の崩壊):

    • 問題点: 生徒がいくつかの答えを正解し、いくつかを間違えたとしても、8 つの答えすべてに対して同じ推論パターンを使い続ける傾向があります。まるで生徒に問題解決の「お気に入り」の方法が 1 つしかなく、他の方法を試すことを拒んでいるかのようです。彼らは新しい戦略を探求することをやめてしまいます。
    • 論文の解決策: 言い換えられた質問は異なるように見えるため、生徒はそれらを解くために異なる戦略を試すことを強いられます。質問のバージョンの 1 つは「数式」アプローチを誘発し、別のバージョンは「視覚的」アプローチを誘発するかもしれません。
    • 比喩: 料理人にハンバーガーを作らせることを想像してください。「ハンバーガーを作ってください」とだけ言えば、彼らは毎回全く同じものを作るかもしれません。しかし、「パンを下に置いてハンバーガーを作ってください」、「肉をサイコロ状に切ってハンバーガーを作ってください」、「チーズを先に溶かしてハンバーガーを作ってください」と言えば、料理人は異なる技術を実験せざるを得なくなります。これにより、料理人はより幅広い調理スタイルを探求することを強いられて、全体としてより優秀で多様な料理人になります。

新しい手法(TA-GRPO)の仕組み

著者たちは、新しい手法をTA-GRPO(Transformation-Augmented GRPO、変換拡張 GRPO)と呼んでいます。シンプルなレシピは以下の通りです。

  1. 数学の問題を 1 つ選びます。
  2. AI ツール(GPT-4 など)を使って、その問題を意味を変えずに 3 回、異なる方法で書き換えます。
  3. 生徒に元の問題と3 つの新しいバージョンを解かせ、4 つのバージョンのそれぞれに対して 8 つの答えを生成させます。合計 32 の答えになります!
  4. 教師はすべての 32 の答えをまとめて見て、どの戦略が最も効果的だったかを判断します。
  5. 重要なのは、生徒が質問の異なるバージョンを解いたとしても、教師は元の質問に基づいて生徒の脳を更新する点です。これにより、生徒は特定の言い回しに答える方法ではなく、核心的な概念を学ぶことになります。

結果

この論文は、難易度の高い数学コンテスト(AMC や AIME など)を用いて、4 つの異なる AI モデル(小規模から中規模まで)でこの手法をテストしました。

  • スコアの向上: TA-GRPO は、標準的な手法よりも一貫して高いスコアを記録しました。例えば、最も難しい数学テストでは、平均して成功率が約 5 ポイント向上しました。
  • 賢明な探求: モデルは単に運が良かっただけではなく、実際にはより多様な問題解決方法を試みました。
  • データ効率: 最も印象的な発見は、TA-GRPO が2.5 倍のデータでモデルを訓練した場合と同等の結果を達成したことです。つまり、質問をより賢い方法で出すことで、モデルは追加の教科書の巨大なライブラリを与えられた場合と同じくらい学習したことになります。

注意点

論文は、1 つの小さなコストに言及しています。言い換えられた質問を得るためには、書き換えを行うために強力な AI(GPT-4-Turbo)を使用するための少額の費用が必要です。また、モデルがステップごとに多くの質問を処理しなければならないため、訓練に少し時間がかかります。しかし、著者たちは、パフォーマンスの向上がこの追加の努力に見合うと主張しています。

要約: TA-GRPO は、AI モデルが同じ質問を多くの異なる「衣装」で出されることで退屈したり行き詰まったりすることを防ぎます。これにより、モデルはより創造的に考え、より効果的に学習することを強いられます。単に問題に対してより多くのデータを投げることに比べ、時間と費用を節約できます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →