Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories
Agentic-DPOは、エキスパートの軌跡を状態条件付きのアクション選好へと変換することで、LLMエージェントが単なる模倣を超えた最適な意思決定を学習することを可能にする、軽量なオフライン方策最適化手法であり、環境へのロールアウトや報酬モデルを必要とすることなく、オンライン強化学習に匹敵する性能を実現します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、ロボット執事に散らかった部屋の掃除方を教えていると想像してください。かつてのやり方である**教師あり微調整(SFT)**は、人間に掃除をしているビデオを見せ、「見たままを正確にコピーしなさい」と伝えるようなものです。ロボットは一連の動きの「シーケンス」を学習します:靴下を拾い、それをハンパーに入れ、塵取りを掴む、といった具合です。しかし、ここに落とし穴があります。ロボットは、なぜそれらの動きが選ばれたのかという「理由」を実際には学んでいないのです。もし靴下が実はゴミだったとしても、ロボットは単にビデオをコピーしているだけなので、自分が犯したかもしれない間違いについて考えることなく、依然として靴下を拾い上げてしまうかもしれません。
この論文は、これを解決するための、より軽量な手法であるAgentic-DPOを紹介しています。単にコピーするのではなく、ロボットが自分自身の潜在的な失敗を見つけられるように、学習データを「選択型アドベンチャーゲーム」へと変えるのです。
コアとなる考え方:「ただコピーするのではなく、比較せよ」
著者らは、エキスパートの経路を単に暗記すべき一本のテキストの列として扱うのではなく、あらゆるステップを一つの意思決定ポイントとして見るべきだと提案しています。どの瞬間においても、ロボットはエキスパートの正しい動きを選択することもできれば、「もっともらしい間違い」を選択することもできるのです。
Agentic-DPOは次のように機能します:
- セットアップ: エキスパートの履歴における特定の瞬間(「状態」)をロボットに見せます。
- テスト: 「今、あなたならどうしますか?」とロボットに問いかけます。
- 比較: もしロボットがエキスパートとは異なる行動を提案した場合、「エキスパートの動き(正解)」対「ロボットの推測(不正解)」というペアを作成します。
- レッスン: ロボットに対し、自分の起こりうる間違いよりも、エキスパートの動きを好むように教えます。
これは大きな転換です。論文では、従来の手法は単にコピーするか(SFT)、あるいは実際に環境の中で何度もゲームをプレイして学習しようとする(強化学習)かのどちらかであり、後者は時間がかかり、コストが高く、複雑なスコアリングシステムを必要とすると述べています。Agentic-DPOは、実際にゲームをプレイしたり、あらゆる動きに対して人間の判定者を雇ったりすることなく、間違いから学ぶメリットを得られることを示唆しています。
「魔法のトリック」:ルールを明確に保つ
ロボットを教える際には、厄介な問題があります。ロボットは、意味の内容ではなく「どのように書かれているか」によって混乱してしまう可能性があるのです。例えば、「ツールを呼び出す(Call the tool)」という指示が、call_tool() と書かれることもあれば、{"tool": "call"} と書かれることもあるでしょう。もしロボットが単にエキスパートのテキスト形式を好むように学習してしまうと、形式が変わったときに失敗してしまいます。
これを解決するために、著者らは巧妙なテクニックである**ポリシー保存型拡張(PPA)**を導入しています。数学の問題を解いている生徒に教えている場面を想像してください。同じ問題を英語で、次にスペイン語で、次にコミック風のスタイルで見せますが、*解法(数学的な内容)*は全く同じままです。PPAはこれをロボットに対して行います。つまり、核心となる決定は同一に保ったまま、エキスパートの行動を多くの異なる「方言」やフォーマットへと書き換えるのです。これにより、ロボットは特定の言葉遣いではなく、選択の「論理」を学ぶよう強制されます。
数字が示すもの
著者らは、ロボットがツール、ユーザー、またはウェブサイトと相互作用する必要がある3つの異なる「遊び場」でこのアイデアをテストしました:
- StableToolBench: ツール使用をテストする場所。
- τ-bench (tau-bench): ロボットが顧客とチャットを行う小売シミュレーション。
- Mind2Web: ロボットが実際のウェブサイトをナビゲートするタスク。
結果は、Agentic-DPOがさまざまなサイズのロボットにおいて、標準的な「コピー」手法(SFT)を一貫して上回っていることを示しています:
- τ-bench の小売タスクにおいて、90億パラメータのモデルは、標準的なコピーによる**21.7%の成功率から、Agentic-DPOによって41.4%**へと跳ね上がりました。
- StableToolBenchでは、より小さな20億パラメータのモデルが**57.1%から90.9%**へと向上しました。
- Mind2Webでは、ステップの平均成功率は**45.6%から64.4%**へと上昇しました。
興味深いことに、論文では、Agentic-DPOが、ロボットに実際に何千回もゲームをプレイさせて学習させるGRPOと呼ばれるはるかに高価な手法と同等の性能を発揮したと指摘しています。しかも、Agentic-DPOは学習ステップ中に実環境と一度も相互作用することなくこれを実現しました。
この手法が「できないこと」
この手法が解決できると主張していないことも知っておくことが重要です。論文では、この手法がエキスパートが見たことのない「新しい状況」を発見できるという考えを明確に否定しています。なぜなら、これはエキスパートの既存のビデオに存在する「状態」からのみ学習するため、エキスパートが入ったことのない部屋を探索することはできないからです。これはトレードオフであることを示唆しています。つまり、既知の決定ポイントに対しては非常にうまく機能する、より安価で高速な学習手法を得る代わりに、既定のルートを外れて新しい解決策を見つけ出す能力は失われるということです。
まとめ
著者らは、エキスパートのデモンストレーションをあらゆるステップにおける「正解 vs 不正解」の選択へと変え、さらに「フォーマットのシャッフル」というトリック(PPA)を用いることで、ロボットを(単なる内容ではなく)論理に集中させることで、以前よりもずっと安価に、より賢いエージェントを訓練できると示唆しています。それは、ロボットを単なる「オウム返しをする物知り」から、「なぜ自分が間違っている可能性があるのか」を実際に考える学生へとアップグレードするようなものです。しかも、膨大なコンピューティングパワーを投じて果てしないシミュレーションを実行することなく実現できるのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。