← 最新の論文
🤖 machine learning

AGPO: Adaptive Group Policy Optimization with Dual Statistical Feedback

本論文は、標準的な PPO および GRPO 手法と比較して数学および STEM ベンチマークにおける LLM の推論性能を向上させるために、グループレベルの統計量を用いてクリッピング境界とデコーディング温度を動的に調整する批評家不要の強化学習フレームワークである適応型グループ方策最適化(AGPO)を提案する。

原著者: Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

公開日 2026-05-21
📖 1 分で読めます☕ さくっと読める

原著者: Miaobo Hu, Shuhao Hu, Bokun Wang, Ruohan Wang, Xin Wang, Xiaobo Guo, Daren Zha, Jun Xiao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常に優秀な学生(大規模言語モデル)に、難しい数学の問題を解く方法を教える場面を想像してください。あなたはその学生に質問を与え、学生が答えようとします。そして、正解か不正解かを伝えます。目標は、学生が間違いから学び、時間とともに上達できるように支援することです。

本論文は、AGPO(Adaptive Group Policy Optimization:適応型グループ方策最適化)と呼ばれる新しい指導法を紹介しています。これがなぜ特別なのか理解するために、従来の方法と新しい方法を比較してみましょう。

従来の方法:硬直したコーチ

以前は、PPO や GRPO などの手法が「固定された」一連のルールを使用していました。これは、学生の状況に関係なく、常に同じ 2 つの設定を使用するコーチを想像してください。

  1. 「安全網」(クリッピング): 学生がリスクの高い思考の「巨大な飛躍」を試そうとした場合、コーチはそれをカットします。しかし、コーチは学生が始めたばかりなのか、ほぼ達人レベルなのかに関わらず、毎回同じ大きさの安全網を使用します。
  2. 「創造性のダイヤル」(温度): 学生が回答を生成する際、非常に厳格(唯一の可能な回答のみ)にすることも、非常に創造的(多くの突飛なアイデアを試す)にすることもできます。コーチはこのダイヤルを固定された数値に設定し、決して変更しません。

問題点: この硬直したアプローチは脆いものです。

  • 初期段階: 学生は混乱しており、正しい道を見つけるために突飛で創造的なアイデアを試す必要があります。固定された厳格な設定では、十分な探索を妨げてしまいます。
  • 後期段階: 学生は答えに近づいていますが、落ち着きがありません。固定された緩い設定では、学生が動きすぎてしまい、直前に学んだことを忘れてしまう可能性があります。
  • 結果: コーチはこれを正しく機能させるために、これらのダイヤルを手動で微調整(チューニング)することに多くの時間を費やさなければならず、それでも学生が行き詰まったり、破綻したりする可能性があります。

新しい方法:適応型コーチ(AGPO)

AGPO は、学生のパフォーマンスをリアルタイムで監視し、その場でルールを調整するコーチのようなものです。これは、何をすべきかを伝えるための 2 番目の「審判(クリティック)」を必要としません。学生が現在生成している回答のグループを直接見るだけです。

コーチは、互いに連携する 2 つの主要なツールを使用します。

1. 「スマートな安全網」(適応型クリッピング)

固定された安全網の代わりに、コーチは学生の回答の変動具合を確認します。

  • 回答がばらばらである場合(不一致が高い)または報酬が散漫な場合: コーチは学生が不確実であると判断します。学生により大きなリスクを取らせ、学習を加速させるために、安全網を広げます
  • 回答が混沌としている場合、または学生が激しく飛び跳ねている場合(不安定性が高い): コーチは学生が大きな過ちを犯して進捗を台無しにするのを防ぐために、安全網を狭めます
  • 比喩: これはサーファーがスタンスを調整するようなものです。波が穏やかであれば、大きく傾けることができます。波が激しく打ち寄せる場合は、安定を保つために身を低くします。

2. 「動的な創造性のダイヤル」(適応型温度)

コーチは、学生がどの程度「創造的」であるかを許可するかも調整します。

  • 学生が混乱している場合(不確実性が高い): コーチはダイヤルを高い創造性に上げます。これにより、学生は解決策を見つけるために多くの異なるアプローチを試すよう促されます。
  • 学生が自信を持っている場合(不確実性が低い): コーチはダイヤルを低い創造性に下げます。これにより、学生は迷い続けるのではなく、見つけた最良の回答に集中し、固執できるようになります。
  • 比喩: これはサーモスタットのようなものです。部屋(問題)が寒くて混乱している場合、コーチは熱(探索)を上げて部屋を温めます。部屋がすでに暑くて明確な場合は、安定を保つために熱を下げます。

実践における動作

本論文では、この「適応型コーチ」を 9 つの異なる数学および科学テスト(GSM8K や MATH ベンチマークなど)でテストしました。使用されたのは、Qwen2.5-14B という強力なモデルです。

結果:

  • より高いスコア: AGPO で訓練された学生は、従来の硬直した手法(PPO や GRPO)で訓練された学生よりも著しく高いスコアを記録しました。例えば、GSM8K 数学テストでは、67.3% の精度に達し、これまでの最高記録を破りました。
  • 高速な学習: 従来の手法と比較して、同じ量の「思考時間(トークン)」を使用しながらも、リアルタイムで高い精度レベルに到達するまでの時間が約1.6 倍速くなりました。
  • 他モデルへの適用: この手法を他の学生モデル(Llama-3 や Gemma-2)でも試したところ、同様に機能しました。これは特定のモデルに特化したトリックではなく、一般的な改善であることを証明しています。

結論

AGPO は、AI に推論を学習させるためのより賢い方法です。万能なルールブックを使用するのではなく、学生の自信と問題の難易度を常に確認し、「リスク制限」と「創造性のレベル」を即座に調整する、反応的なコーチのように機能します。これにより、より速く、より安定した学習が可能になり、難解な数学や科学の問題に対する結果が向上します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →