RC-GRPO: Reward-Conditioned Group Relative Policy Optimization for Multi-Turn Tool Calling Agents
本論文は、離散的な報酬トークンを注入することで軌跡生成を条件付け、ロールアウトを多様化させ、それによってグループ内の報酬の変動の低さに起因する更新の消失問題を克服することで、LLMにおけるマルチターン・ツールコーリングを強化する新しいフレームットであるRC-GRPOを提案し、BFCLv4ベンチマークにおいて最先端の性能を達成している。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、非常に賢いけれど融通の利かないロボット助手に対し、複雑で多段階のパズルを解くために一連のツール(計算機、カレンダー、検索エンジンなど)を使う方法を教えていると想像してください。
問題: 「完璧な優等生」の罠
通常、このロボットに教える際、まず最初に「完璧な解決策」の例を見せます(教師あり微調整、またはSFT)。ロボットはこれらを完璧に学習し、「成績優秀な優等生」になります。
次に、さらに優れたものにするために、GRPO(Group Relative Policy Optimization)と呼ばれる手法を用いて教えようとします。GRPOは、生徒のグループを集め、同じパズルを与え、それぞれに異なる解決策を試させるコーチのようなものです。コーチは結果を比較します。「君はよくやった」「君は失敗した」「君は平均的だ」。より優れた結果を出した生徒にはブーストを与え、成績が悪かった生徒には別の方法を試すよう促します。
落とし穴: ロボットが「完璧な」例をあまりにも完璧に学習してしまったため、グループに試行を命じるたびに、彼らは全員と全く同じ解決策を提示してきます。彼らは皆、同じ退屈なほど「完璧」なのです。
- コーチはグループを見てこう言います。「おや、全員が10点満点だ。」
- 全員に差がないため、コーチは誰に改善を促すべきか判断できません。学習信号が消えてしまうのです。ロボットは、すでに知っている「完璧な道」から外れることを恐れすぎてしまい、パズルを解くための新しい方法を探索できず、行き詰まってしまいます。
解決策: RC-GRPO(「ムードリング」戦略)
著者らは、この問題を解決するためにRC-GRPOと呼ばれる新しい手法を提案しています。ロボットがランダムに異なることを試すのを待つのではなく、作業を開始する前に、ロボットに「ムードリング」や特定の指示トークンを与えるのです。
ステップ1:指示に従って異なる動きをするようロボットに教える(RCTP)
まず、成功した物語(高報酬)と失敗した物語(低報酬)が混ざった袋小路の物語を用いて、ロボットを訓練します。決定的なのは、各物語に <|High Reward|> や <|Low Reward|> といった特別なタグを付けていることです。
- ロボットはこう学びます。「
<|High Reward|>タグを見たら、完璧になろうとするべきだ。<|Low Reward|>タグを見たら、異なる、おそらくよりリスクが高い、あるいはより単純な道を試すべきだ。」 - これにより、ロボットは単なる硬直した生徒ではなく、見ているタグに基づいて振る舞いを切り替えられる「カメレオン」になります。
ステップ2:コーチの新しいゲーム(Reward-Conditioned GRPO)
さて、コーチ(RLアルゴリズム)がパズルを解くためにグループを集める時、単に「行け!」と言うだけではありません。
- 彼らは各生徒に異なるタグを手渡します。
- 生徒Aは
<|High Reward|>を受け取り、完璧になろうとします。 - 生徒Bは
<|Low Reward|>を受け取り、異なる、おそらく無秩序なアプローチを試みます。 - 生徒Cは再び
<|High Reward|>を受け取りますが、おそらく少し異なる完璧な道を試します。 - 生徒たちはタグに基づいて異なる動きをするよう条件付けられているため、グループには多様性が生まれます。
- コーチはこれで明確に確認できるようになります。「生徒Aは10点、生徒Bは2点、生徒Cは9点だ。」
- これで明確な差が生じました!コーチは有益なフィードバックを与えられるようになります。「生徒B、生徒Aのようになれるよう努力しなさい。」
- これにより、学習エンジンがスムーズに回り続けます。
なぜ機能するのか(比喩)
古い方法では、ロボットは全員が全く同じ音符を完璧に歌う合唱団のようでした。全員が同一であったため、指揮者は誰がより良く歌っているかを判断できませんでした。
新しい RC-GRPO メソッドでは、指揮者が各歌手に異なる楽譜(高報酬 vs 低報酬のタグ)を渡します。突然、合唱団は多様な響きを持ちます。指揮者はその違いを聞き取り、最高の音を選び出し、歌手たちを導いて向上させることができるのです。
結果
論文では、AIエージェントがツールを使用するための厳しい試験である BFCLv4 というベンチマークでテストを行いました。
- 従来の方法: ロボットは行き詰まり、あまり改善しませんでした。
- 新しい方法(RC-GRPO): ロボットはより速く学習し、より多くのパズルを正しく解きました。
- 大きな勝利: 特定のテストモデル(Qwen-2.5-7B)において、この新しい手法により、オープンソースのロボットが、通常これらの試験で勝利する有名な高価な「クローズドソース」のロボット(大手企業のモデルなど)を打ち負かすことができました。
まとめ
この論文は、AIが例をコピーすることに習熟しすぎて学習が止まってしまうという問題を解決しています。単純な「報酬タグ」に基づいてAIに意図的に異なる動きをするよう教えることで、AIに異なる経路を探索させ、より速く、より賢くツールを使いこなせるようにしているのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。