← 最新の論文
🤖 machine learning

Offline Reinforcement Learning with Generative Trajectory Policies

本論文は、連続時間 ODE ベースの軌道解マップを学習することで、遅い拡散モデルと高速な整合性モデルの間のギャップを埋める統合されたオフライン強化学習フレームワークである生成軌道方策(GTPs)を導入し、D4RL ベンチマークにおいて最先端の性能を達成し、特に AntMaze タスクにおいて完璧なスコアを記録した。

原著者: Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Xinsong Feng, Leshu Tang, Chenan Wang, Haipeng Chen

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な迷路を歩く方法をロボットに教えることを想像してみてください。他のロボットがこのタスクに挑戦する巨大なビデオライブラリは手元にあるものの、新しいロボットを実際に世界で練習させることはできません。このロボットは、これらの古いビデオを見ることだけで完全に学習しなければならないのです。これがオフライン強化学習の課題です。

問題は、これらのビデオには移動のさまざまな方法が映し出されていることです。ロボットが左に曲がることもあれば、右に曲がることもあり、つまずくこともあれば、完璧に滑らかに動くこともあります。単純なロボット脳は混乱し、これらの動きを「平均化」しようとして、結果としてロボットがその場でくるくると回るだけの状態になってしまうかもしれません。ロボットには、これらすべての異なる可能性を同時に理解できる脳が必要です。

古いジレンマ:遅い vs 愚か

過去、研究者たちはこれらの「賢い脳」を構築するために主に 2 種類のツールを使用しようとしましたが、苛立たしいトレードオフに直面しました。

  1. 遅い芸術家(拡散モデル): 空白のキャンバスに静的なノイズが覆いかぶさった状態から始め、一歩一歩、徐々に洗練させて完璧な画像が現れるまで描き上げる芸術家を想像してください。この方法は、複雑な詳細や多様なスタイル(マルチモーダルな行動)を捉えるのに非常に優れています。しかし、1 枚の絵を描くのに非常に時間がかかります。ロボットが 1 秒ごとに意思決定を行う必要がある場合、この遅いプロセスは実用的すぎるほど遅すぎます。
  2. 速いスケッチャー(一貫性モデル): 次に、最終的な絵を 1 回か 2 回の素早いストロークで描こうとするスケッチャーを想像してください。これは信じられないほど速いですが、洗練のステップをスキップするため、描画はしばしばぼやけていたり、間違っていたりします。ロボットは素早く動きますが、世界の理解が単純すぎるため、壁に衝突してしまいます。

新しい解決策:「生成軌道方策(GTP)」

この論文の著者であるフェン・シンソン氏と共同研究者たちは言います。「なぜ遅いものと速いものの間で選ばなければならないのでしょうか?両方であるロボット脳を構築しましょう。」

彼らは生成軌道方策(Generative Trajectory Policies: GTP)と呼ばれる新しい手法を導入しました。その仕組みを理解するために、ロボット的运动を点 A から点 B への単一のジャンプではなく、その旅の連続した映画として想像してみてください。

  • 統合された視点: 著者たちは、「遅い芸術家」と「速いスケッチャー」の両方が、実際には異なる角度から同じ映画を見ていることに気づきました。彼らはどちらも、ロボットが混沌(ノイズ)から秩序(完璧な行動)へと移動する方法を記述する数学的方程式(常微分方程式、ODE)を解こうとしています。
  • マジックトリック: 映画をフレームごとに視聴する(遅い)か、即座に結末を推測する(速い)のではなく、GTP は映画全体のマップを一度に学習します。それは「解のマップ」を学習し、何ステップかかろうとも、ノイズのどの点から完璧な行動へ至るかを正確に示すのです。

どのように機能させたか(2 つのハック)

この「映画全体のマップ」をゼロから学習するのは困難です。ロボットが早期に誤った推測をすると、混乱し、より悪い推測を繰り返し続けてしまいます。著者たちは、これを現実的なものにするために 2 つの巧妙な「ハック」を追加しました。

  1. 「チートシート」(スコア近似):
    通常、映画のマップを学習するには、ロボットは作業を確認するために映画全体を何度もシミュレーションする必要があります。これは計算コストがかかります。

    • アナロジー: 正しい音階を当てたか確認するために、交響曲全体を演奏して曲を学ぼうと想像してください。著者たちは、「いいえ、楽譜を見ればよいのです」と言います。彼らは、映画全体をシミュレーションすることなくロボットの進捗を確認するための、シンプルで直接的な公式(「チートシート」)を見つける方法を見つけました。これにより、トレーニングが高速かつ安定し、ロボットが混乱の渦に巻き込まれるのを防ぎます。
  2. 「コーチのホイッスル」(価値駆動ガイダンス):
    単にビデオをコピーするだけでは不十分です。ロボットは、ビデオ内のものよりも優れた動きを学ぶ必要があります。

    • アナロジー: コーチがビデオライブラリを見ていると想像してください。ビデオ内のロボットが高得点につながる動きをしたとき、コーチはホイッスルを吹き、「それをもっとやれ!」と言います。ロボットが悪い動きをしたときは、「それをやるな」と言います。
    • 著者たちは、「クリティック(コーチ)」がロボットのトレーニングを観察し、教訓に重み付けを行うシステムを構築しました。これにより、ロボットはビデオ内の高得点の動きに特に注意を払うよう指示され、単なるコピーを超えて改善することを効果的に学びます。

結果

チームは、2 足歩行や複雑な迷路のナビゲーション(AntMaze)などのタスクを含む、有名な一連の課題であるD4RLで、この新しいロボット脳をテストしました。

  • 結果: GTP はほぼすべての他の手法を凌駕しました。実用的であるのに十分な速さでありながら、最も困難で多段階の難問を処理するのに十分な賢さを持っていました。
  • ハイライト: 有名な難易度の高い「AntMaze」タスク(ロボットが巨大で曲がりくねった迷路をナビゲートしなければならないもの)において、GTP はいくつかのレベルで完全なスコアを達成しました。これは、以前の手法では困難だったことです。

要約

要するに、著者たちは「遅いが賢い」と「速いが愚か」の間の溝を埋めました。ロボット運動を連続した旅として捉え、それを効率的に学習するために「チートシート」を使用することで、彼らは表現力が高く(複雑で多様な選択肢を持つ行動を処理できる)かつ計算効率の高い方策を作成しました。オフライン学習において、速度を犠牲にして知性を手に入れる必要はないことを証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →