Group Entropy-Controlled Policy Optimization
本論文は、グループレベルのエントロピー推定を用いて非対称なアドバンテージ・シェイピングを行うことで、異種混合の強化学習タスクにおけるグローバルなエントロピー制御の限界に対処し、探索と利用のバランスを最適化して優れたクロスタスク性能を実現する、GRPOに対する軽量な拡張手法であるGroup Entropy-Controlled Policy Optimization (GEPO) を提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:グループ・エントロピー制御型方策最適化 (GEPO)
1. 問題提起
強化学習(RL)は、大規模言語モデル(LLM)の事後学習において、アライメントと推論能力を強化するための支配的なパラダイムとなっています。しかし、探索と利用(exploration-exploitation)のトレードオフのバランスを取ることは、特に不均質なタスク混合(例:数学、コーディング、物理学、指示追従の組み合わせ)で学習を行う際に、依然として重大な課題となっています。
現在のエントロピー制御型RL手法は、主に以下の2つの粒度で動作しています:
- 方策レベル(Policy-level): バッチ全体に対してエントロピーを計算し、一律の制御信号を適用する(図1a)。
- トークンレベル(Token-level): トークンの共分散を計算し、個々のトークンを制御する(図1b)。
本論文は、これらの手法をGroup Relative Policy Optimization (GRPO) に適用した際の根本的な欠陥として、**エントロピーの不均質性(Entropy Heterogeneity)**を指摘しています。異なるタスクドメインは、同一の方策の下でも異なるエントロピー・レジーム(領域)を示します。例えば、物理学のプロンプトは自然と低エントロピーに集中する傾向がある一方で、指示追従のプロンプトは高エントロピーを示すことがあります。
この不均質性は、標準的なGRPOにおいて以下の2つの具体的な病理を引き起こします:
- エントロピー依存のバイアス: グループ内でのアドバンテージ(利得)の正規化が、異なるエントロピーレベルを持つグループ間で統計的に比較不可能な信号を生み出します。低エントロピーのグループ(多くの場合、高精度なタスク)は強力で一貫した勾配信号を生み出す一方、高エントロピーのグループ(多くの場合、低精度なタスク)は弱くノイズの多い信号を生み出します。
- 最適化の不均衡: バッチレベルの最適化が低エントロピーのタスクに支配され、その結果、高エントロピーのタスクへの学習信号が減少します。これは、低エントロピーのタスクが早期に収束してしまう一方で、高エントロピーのタスクが効果的に探索できなかったり、退行的な出力につながる「暴走エントロピー」に陥ったりするという、自己強化的なサイクルを招きます。
2. 手法:GEPO
著者らは、GRPOに対する軽量かつモデルに依存しない拡張手法として、グループレベルでの**エントロピー条件付き非対称アドバンテージ・シェイピング(entropy-conditioned asymmetric advantage shaping)を実行するGroup Entropy-Controlled Policy Optimization (GEPO)**を提案しています。
コアメカニズム
GEPOは、プロンプトの既存のグループサンプルから推定されるグループ・エントロピー () を診断信号として利用します。グローバルなエントロピー目標を適用する代わりに、GEPOはグループのエントロピー状態に基づいて、各レスポンスのアドバンテージ信号 () を整形(シェイピング)します:
このシェイピング関数は、非対称なスケーリング係数 () を適用します:
- 低エントロピー・グループ (): 正のアドバンテージが によって減衰されます。これにより、モデルがすでに自信を持っているタスクにおける過剰な利用(exploitation)と早期収束を防ぎます。
- 高エントロピー・グループ (): 負のアドバンテージが によって減衰されます。これにより、モデルが不確実なタスクにおける探索の早期抑制を防ぎ、方策が正しい推論パスを発見できるようにします。
- それ以外の場合: アドバンテージは変更されません。
主要な設計上の選択
- 非対称シェイピング (): 著者らは、低エントロピーのグループはより脆弱であることを経験的に観察しています。これらのグループにおいて負のアドバンテージを積極的に罰すると、「長さの崩壊(length collapse)」(モデルが不確実性を減らすために回答を短縮してしまう現象)を誘発する可能性があります。そのため、GEPOは高エントロピー・グループに適用される強い減衰( がより低い)と比較して、低エントロピー・グループには緩やかな押し( がより高い)を適用します。
- 適応型閾値: 固定されたエントロピー閾値は、ベースモデルや訓練段階が変わると脆くなります。GEPOは、バッチのエントロピー分布(平均と標準偏差)から閾値 () を動的に導出し、指数移動平均(EMA)を用いてこれらを平滑化します。これにより、タスク固有のチューニングを行うことなく、ベースモデル特有のエントロピー・スケールに自動的に適応できます。
3. 主な貢献
- 理論的洞察: 本論文は、GRPOにおける正規化されたアドバンテージが、グループのエントロピーによって構造的にバイアスされることを示す理論的分析(命題 2.1 および 2.2)を提供しています。これは、方策加重報酬分布と参照報酬分布の間の乖離がエントロピーに依存しており、それが異種タスク間での比較不可能なアドバンテージ信号につながることを証明しています。
- アルゴリズムの革新: GEPOは、グループレベルのエントロピー制御を行い、非対称なアドバンテージ・シェイピングを実行する初のメカニズムを導入しました。エントロピーをグローバルまたはトークンレベルの特性として扱う従来の手法とは異なり、GEPOはそれをプロンプト・グループの診断指標として扱い、最適化の圧力を再調整します。
- ゼロコストの実装: この手法は、追加のサンプリングや価値関数の推定を必要としません。GRPOにおける既存のグループサンプルを活用するため、計算オーバーヘッドは極めて軽微です。
4. 実験結果
著者らは、数学、物理、科学、コード生成、および指示追従をカバーする13のベンチマークにおいて、2つのベースモデル(Intern-S1-mini および Qwen3.5-9B)を用いてGEPOを評価しました。
- パフォーマンス: GEPOは、GRPOおよび最近のエントロピー制御型ベースライン(AEPO, Clip-Cov, KL-Cov)を一貫して上回りました。
- Intern-S1-mini において、GEPOは最高の平均スコア(54.2)を達成し、AIME25、IMO-Bench、GPQAを含む13件中7件のベンチマークで勝利しました。
- Qwen3.5-9B において、GEPOは最高の平均スコア(71.2)を達成し、強力なベースラインであるClip-Cov(70.9)やKL-Cov(69.9)を上回りました。
- 安定性: GEPOは優れた訓練の安定性を示しました。GRPOは、エントロピーの増大による破滅的な性能崩壊(例:Qwen3.5-9Bにおいてステップ170付近)に見舞われ、AEPOは持続的な振動を示しましたが、GEPOは滑らかで単調に改善する検証曲線(validation curves)を維持しました。
- エントロピーのダイナミクス: 訓練のダイナミクス分析により、GEPOはタスク間で分化された探索レベルを維持できることが示されました。一様なエントロピーパターンを強制するAEPOとは異なり、GEPOは広範な探索を必要とするタスクが高いエントロピーを維持することを許容し、決定論的なタスクが低いエントロピーに落ち着くことを可能にし、早期の崩壊とエントロピーの暴走の両方を防ぎます。
5. 意義と主張
本論文は、GEPOがマルチタスクRLの事後学習における重要なギャップ、すなわち、多様なタスク間で生じるエントロピーの不均質性による構造的バイアスに対処するものであると主張しています。
著者らは以下のことを断言しています:
- タスク固有の制御は不可欠である: 異質なタスクを単一のエントロピーパターンへと強制することは最適ではありません。効果的なマルチタスク学習には、タスク固有の探索レジームを維持することが必要です。
- 非対称性が極めて重要である: 低エントロピー・グループの脆弱性は、長さの崩壊を避けつつ探索を促進するために、アドバンテージ・シェイピングへの非対称なアプローチが必要であることを示唆しています。
- スケーラビリティ: 既存のロールアウトから推定されるグループ・エントロピーと適応型閾値に依存することで、GEPOは、明示的なタスク注釈や追加のサンプリングコストを必要とせずに、平均的なパフォーマンスとタスク間のバランスを向上させる、スケーラブルでモデルに依存しないソリューションを提供します。
結論として、本論文は、複雑なマルチドメインのLLM事後学習シナリオにおいて、RL訓練を安定化させるための堅牢なフレームワークとしてGEPOを位置づけ、最適化プロセスが異なるタスクタイプの固有の不確実性と多様性を尊重するようにしています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。