EnvRL: Learn from Environment Dynamics in Agentic Reinforcement Learning
原著者: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
原著者: Zhitong Wang, Songze Li, Hao Peng, Shuzheng Si, Yi Wang, Maosong Sun, Juanzi Li
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術サマリー: ENVRL - エージェント型強化学習における環境ダイナミクスからの学習
1. 問題提起
強化学習(RL)は、複雑で長期的なタスク(例:ウェブナビゲーション、ソフトウェア操作)を遂行できる自律エージェントとして、大規模言語モデル(LLM)を訓練するための標準的なパラダイムとなっています。しかし、既存のエージェント型RLアルゴリズム(GRPOやRLOOなど)は、主に**結果ベースの報酬(outcome-based rewards)**に依存しており、そこではエピソードの終了時にのみ環境からバイナリのフィードバックが提供されます。
長期的なマルチターン(多段階)のコンテキストにおいて、このような疎な(sparse)フィードバックは深刻な学習上の課題をもたらします。著者らは、このアプローチが、ロールアウトの相互作用軌跡に含まれる豊かな環境ダイナミクスの情報を見落としていると主張しています。エージェントが環境と相互作用する際、その経験には、アクションに応じて環境がどのように変化するかを記述し、潜在的な遷移メカニズムを明らかにする、密な信号が暗黙的に含まれています。既存の手法はこの暗黙的な教師信号を活用できておらず、それがエージェントによる正確な環境内部モデルの構築と堅牢な意思決定の能力を制限しています。
2. 手法: ENVRLフレームワーク
本論文では、エージェント型RLに環境ダイナミクスの学習を組み込むために設計されたフレームワークであるENVRLを提案しています。核心となるアイデアは、相互作用の経験を、主要なRL目的関数を補完する自己教師あり信号へと変換することです。ENVRLは、以下の2つの補助的な目的関数を導入します。
A. 状態予測 (State Prediction: SP)
この目的関数は、順方向の環境ダイナミクスをモデル化します。現在の状態 st と選択されたアクション at が与えられたとき、エージェントは次の環境状態 st+1 を予測するように訓練されます。
- メカニズム: テキスト環境において、st+1 は次のステップのテキスト観測値です。この目的関数は、予測された状態と実際の次の状態の間のクロスエントロピー損失を最小化します。
LSP(θ)=−E(st,at,st+1)∼Dπθ[logpθ(st+1∣st,at)] - 目的: アクションがその後の観測をどのように形作るかについて、エージェントに内面化させることです。
B. 逆ダイナミクス (Inverse Dynamics: ID)
この目的関数は、逆方向の因果関係をモデル化します。連続する2つの状態 (st,st+1) が与えられたとき、エージェントは遷移を引き起こしたアクション at を推論するように訓練されます。
- メカニズム: この目的関数は、アクションを復元するためのクロスエントロピー損失を最小化します。
LID(θ)=−E(st,at,st+1)∼Dπθ[logpθ(at∣st,st+1)] - 目的: 自身の行動と環境の変化との間の因果関係に関する理解を強化し、環境の余計な詳細情報をフィルタリングする能力を高めます。
C. 減衰を伴う結合オンライン最適化
全学習目的関数は、主要なRL損失 (LRL) と補助的な損失 (LSP および LID) を組み合わせたものです。
L(θ;t)=LRL(θ)+λSP(t)LSP(θ)+λID(t)LID(θ)
ダイナミクス学習の初期段階と、報酬最大化への後期段階の必要性のバランスを取るために、著者らは係数減衰メカニズムを採用しています。重み λSP(t) と λID(t) はコサイン減衰スケジュールに従い、高い値から始まり、トレーニングが進むにつれて徐々にゼロへと減少します。これにより、エージェントは初期段階でダイナミクスに関する密な指導を受け、その後、主要なタスク報酬へとスムーズに焦点を移行させることができます。
計算効率: ENVRLは、標準的なRLプロセス中に生成されたロールアウトデータを再利用します。補助損失を計算するために、更新ごとに1回の追加のフォワードパスを必要とするだけであり、計算オーバーヘッドは無視できる程度です。
3. 主な貢献
- フレームワークの提案: 環境ダイナミクスの予測と逆ダイナミクスを補助的な目的関数としてエージェント型RLに統合する、軽量なフレームワークであるENVRLの導入。
- 暗黙的教師信号の活用: 相互作用の経験を、独立した密な教師信号のソースとして扱う新しいアプローチであり、長期的なタスクにおける報酬の疎性を解決します。
- 減衰メカニズム: 環境ダイナミクスの学習とタスク報酬の最適化を動的にバランスさせる、時間依存の係数スケジュール。
- 効率性: 追加のサンプリングや個別のモデル訓練を行うことなく、これらの改善が達成されることを実証。
4. 実験結果
著者らは、2つの長期的なエージェント・ベンチマークであるALFWorld(テキストベースの家庭内タスク)とWebShop(eコマースの商品検索)を用いてENVRLを評価しました。実験は、Qwen2.5モデル(1.5Bおよび7B)を用い、GRPOおよびGiGPOを用いて行われました。
- 性能向上:
- ALFWorld (1.5B, GRPO): 成功率が 72.8% から 77.4% へ増加(+4.6ポイント)。
- WebShop (1.5B, GRPO): 成功率が 56.8% から 67.0% へ増加(+10.2ポイント)。
- 7B モデル: GRPOおよびより強力なGiGPOベースラインの両方で一貫した向上が観察されました(例:GiGPO + ENVRLはALFWorldで94.5%に到達)。
- サンプル効率: ENVRLは、平均してRLベースラインの最終的な性能レベルに、合計トレーニングステップの約 68.5% で到達しました。これは収束が速いことを示しています。
- 行動の改善: 成功したエピソードでは、相互作用のターン数とレスポンスの長さが短くなっており、より精密な意思決定と冗長な探索の減少を示唆しています。
- 汎化性能: 標準的なタスクで訓練されたENVRLモデルは、新しい部屋の構成や未知のオブジェクトタイプを含む分布外(OOD)テストセットにおいても、堅牢性が向上していることが示されました。
- アブレーション研究:
- SPまたはIDのいずれかを取り除くと性能が低下し、順方向と逆方向のダイナミクスモデリングの相補的な性質が確認されました。
- 減衰メカニズムを取り除くと性能が低下し、時間の経過とともにダイナミクスから報酬へと焦点を移す必要性が浮き彫りになりました。
- 補助的な学習に使用される経験データの割合に応じて、性能が正の相関を持って向上しました。
5. 意義と主張
本論文は、ENVRLがLLMエージェントにとって、環境ダイナミクスから学習するための汎用的かつ軽量なアプローチを提供すると主張しています。自己教師あり目的関数を通じて環境の遷移メカニズムを内面化することで、エージェントは報酬が疎な長期タスクにおいて、より効果的な意思決定を行うことができます。
著者らは、本研究を、きめ細かなクレジット割り当て(credit assignment)や中間報酬のシェイピングに焦点を当てた既存の手法とは**直交する(orthogonal)**ものとして位置付けています。代わりに、ENVRLは相互作用の経験を、豊かで独立した情報源として扱います。このフレームワークは、計算コストを大幅に増やすことなく、サンプル効率と汎化性能を高めるために、様々な方策最適化アルゴリズム(GRPOやGiGPOなど)に統合できる補完的な戦略として提示されています。本研究は、エージェント型RLのメカニズムに新しい視点を提供し、より堅牢で自律的なエージェントの開発に寄与することを目指しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の machine learning 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。