← 最新の論文
💬 NLP

GTPO and GRPO-S: Token and Sequence-Level Reward Shaping with Policy Entropy

本論文は、動的なエントロピーに基づく報酬整形を実装することで、トークンレベルおよびシーケンスレベルのきめ細かなクレジット割り当てを実現し、既存のGRPOやDAPOのような粗い粒度の限界を克服することで、大規模言語モデルの推論能力を向上させる2つの新しい強化学習アルゴリズム、GTPOおよびGRPO-Sを導入するものである。

原著者: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

公開日 2026-02-06
📖 1 分で読めます☕ さくっと読める

原著者: Hongze Tan, Zihan Wang, Jianfei Pan, Jinghao Lin, Hao Wang, Yifan Wu, Tao Chen, Zhihang Zheng, Zhihao Tang, Haihua Yang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

大きな問題:「全か無か」の成績付け

想像してみてください。あなたは生徒(AI)に、非常に長く複雑な数学の問題を解く方法を教えています。生徒は50ステップの解答を書き上げました。

  • ステップ1から49までは、見事な論理に基づいた正しい内容です。
  • ステップ50(最終的な答え)は、ほんのわずかな計算ミスによって間違っています。

現在の主流な手法(GRPOなど)では、教師は最終的な結果だけを見て、答えが間違っていると判断すると、50ステップに及ぶエッセイ全体に不合格(0点)をつけます。

  • その結果: 生徒は「ああ、ステップ1から49も役に立たなかったんだな」と考えてしまいます。彼らは良かった部分を忘れ、次回は全く別の、ランダムなアプローチを試そうとしてしまいます。
  • 欠点: これは**「粗い粒度のクレジット割り当て(coarse-grained credit assignment)」**と呼ばれます。思考の連鎖全体を一つの塊として扱ってしまい、その大部分が実は完璧であったという事実を無視してしまうのです。

解決策:「エントロピー」というコンパス

この論文の著者たちは、生徒に成績をつける新しい方法を提案しています。彼らは**「ポリシー・エントロピー(Policy Entropy)」**という概念を導入しました。

エントロピーとは、**「一生懸命考えている度合い」「不確実性」**の尺度だと考えてください。

  • 低いエントロピー: 生徒は非常に自信を持っています。すでに知っていることをただ打ち出している状態です(例:「1 + 1 = 2」)。
  • 高いエントロピー: 生徒は立ち止まり、複数の選択肢を検討し、難しい決断と格闘しています。彼らは異なる経路を探索しています。

論文では、「正しい時には高いエントロピーは良いことである」(それは注意深く正しい経路を探索したことを意味する)一方で、「間違っている時には高いエントロピーは悪いことである」(それは間違った方向に自信を持って突き進んでいたことを意味する)と主張しています。

2つの新しいアルゴリズム

論文では、このエントロピーのコンパスを使ってより良いフィードバックを与える、2つの新しい「教師(アルゴリズム)」を紹介しています。

1. GTPO (Group Token Policy Optimization)

比喩: 「ハイライター(蛍光ペン)」の先生
エッセイ全体を一度に採点するのではなく、GTPOは単語(トークン)一つひとつを個別に採点します。

  • エッセイが正しい場合: 教師は、生徒がためらったり、さまざまな選択肢を検討したりした箇所(高いエントロピー)を見つけ出し、そこにボーナスポイントを上乗せします。これは生徒に「その特定のステップについて、深く考えたことは素晴らしい!」と伝えます。
  • エッセイが間違っている場合: 教師は、生徒が自信過剰だったが間違っていた箇所(低いエントロピー)を探します。そして、これらの単語に対して重いペナルティを与えます。これは生徒に「ここでは自信を持ちすぎていたけれど、結果は間違いだった。次はそんなに自信満々にならないように」と教えるのです。

なぜ役立つのか: 正しい推論の部分を救い出し、失敗を招いた特定の「自信過剰な瞬間」を的確に罰することができるからです。

2. GRPO-S (Sequence-Level GRPO)

比喩: 「通知表」の先生
単語ごとに採点することは、計算コストが高すぎたり時間がかかったりする場合があります。GRPO-Sは、より軽量なバージョンです。

  • 個々の単語を見る代わりに、エッセイ全体の**平均的な「思考の努力」**を見ます。
  • エッセイが正しい場合: 「生徒は全体として、しっかりと深く考え、探索しただろうか?」を確認します。もしそうであれば、エッセイ全体にブーストを与えます。
  • エッセイが間違っている場合: 「自信満々に間違っていなかっただろうか?」を確認します。もしそうであれば、エッセイ全体により大きなペナルティを与えます。

なぜ役立つのか: 従来の「全か無か」の手法よりもスマートでありながら、より高速に動作します。特に、非常に長い推論タスクにおいて生徒の安定性を保つのに優れています。

結果:何が起きたのか?

著者たちは、これらの新しい教師を、難しい数学ベンチマーク(AIMEやMATHなど)でテストしました。

  • 従来の方法 (GRPO/DAPO): 生徒はしばしば行き詰まりました。すぐに諦めてしまったり、自信満々だが間違った答えのループに陥ったり(ポリシー崩壊)することがありました。
  • 新しい方法 (GTPO/GRPO-S):
    • 探索: 正解した時に「深く考えること(高いエントロピー)」が報酬として与えられるため、生徒はより長く異なる経路を試し続けることができました。
    • 精密さ: 生徒は「自信満々に間違える」ことを学習しました。
    • パフォーマンス: 難しい数学の問題において、以前よりも高いスコアを記録し、より複雑な思考の連鎖を解くことができるようになりました。

一文でのまとめ

この論文は、AIモデルに対し、長い思考の連鎖を単なる「合格か不合格か」の成績として扱うのではなく、**「正しい時には深く考え、間違っている時には謙虚であること」**を評価する詳細な通知表を与える方法を教えるものです。これにより、より賢い推論が可能になります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →