Ground-JEPA: Learning Physically Grounded Latent World Models for Zero-Shot Dynamics Generalization of Legged Robots
Ground-JEPAは、タスク固有の報酬に依存することなく、高自由度環境における脚式ロボットに対してゼロショットのダイナミクス汎化と優れた制御性能を実現する、最小限かつ物理に根ざした潜在世界モデルを導入しており、それによって、複雑なロボットシステムにおいて報酬なしの学習は本質的に劣るという仮定に異を唱えている。
原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットの内なるコンパス
岩だらけの野原を歩くようにロボットに教えようとしている場面を想像してみてください。「足を正確に10センチ持ち上げろ」といった厳格なルールを与えることはできるでしょう。しかし、現実の世界は混沌としています。石は動き、地面は滑りやすく、ロボットの足が予想よりも少し重いこともあるかもしれません。これが「脚式ロボット制御(legged robot control)」の課題です。つまり、予測不可能な環境において、機械にいかにスムーズかつ安全に動いてもらうかという問題です。長い間、科学者たちは「ダイナミクス・モデル」、本質的には、「このように動いたら次に何が起こるか」を予測するロボット内部のメンタルマップを構築することで、この問題を解決しようと試みてきました。
従来、これらのメンタルマップは、(直立しているなどの)良い行動に対して報酬を与え、(転倒などの)悪い行動に対して罰を与えることで構築されていました。これは「報酬ベース学習(reward-based learning)」と呼ばれます。しかし、落とし穴があります。もしロボットの予測にわずかな間違いが生じると、その間違いは雪崩のように時間の経過とともに積み重なり、最終的にロボットのメンタルマップが完全に狂ってしまい、衝突に至ることがあります。また、「結合埋め込み予測アーキテクチャ(Joint-Embedding Predictive Architectures: JEPA)」と呼ばれる別のアプローチでは、現実世界の煩雑な詳細をスキップしようとします。カメラの全ピクセルが将来どのように変化するかを正確に予測する代わりに、未来の圧縮された「要約」や「潜在的(ラテント)」なバージョンを予測するのです。これは、空気の正確な振動を計算するのではなく、リズムを感じ取ることで音楽の次の音符を予見するミュージシャンのようなものです。科学者が問い続けてきた大きな疑問は、「ロボットは、『よくできました』とか『もう一度やってみて』といった教師による絶え間ない指導なしに、この内なるリズムを理解するだけで完璧に歩行することを学べるのか?」ということです。
Ground-JEPA:ビートを感じて歩行を学んだロボット
ある研究チームが、新しいシステムである「Ground-JESA」を発表しました。これは、複雑な動きを学ぶために、ロボットには常に称賛や罰が必要ではない可能性を示唆しています。その代わりに、彼らの内的な「感覚」が現実と一致し続けるように努めることによって、学習ができる可能性があるのです。
ロボットが「転ぶな」と言われるのではなく、「自分がどこへ向かっているか」という内的な感覚が実際の動きと一致するように努力することを通じて、歩き方を学ぶ様子を想像してみてください。この新システムにおいて、ロボットは未来の完全なビデオを再構成しようとはしません。代わりに、経験を小さく効率的な「潜在空間(latent space)」――一種の抽象的な思考のショートハンド(簡略記法)――へと圧縮します。ここでの核心となるトリックは、「物理学に基づいたプローブ(探針)」です。ロボットの内部マップは抽象的ですが、このプローブは翻訳機のように機能し、それらの抽象的な思考を位置、速度、方位といった現実世界の物理量へと変換します。それはまるで、純粋な概念で考えるけれど、その概念が依然として重力や運動量の法則に従うことを保証する組み込みの翻訳機を持っているロボットのようなものです。
研究者たちが発見した成功の鍵は、単なる翻訳ではなく、「プランニング・ホライゾン(計画地平線/先読みの範囲)」でした。これまでの試みが失敗したのは、ロボットが数ステップ先しか見ていなかったためです。それは、自分のつま先だけを見て歩こうとするようなものです。Ground-JEPAシステムは、ロボットにより遠くまで、具体的には12ステップ先を見据えるよう強制します。これは極めて重要です。なぜなら、一回の歩行サイクル(ゲイト/歩容)はおよそそれくらいの時間を要するからです。サイクル全体を見ることで、ロボットは次の一歩を最適化するだけでなく、自身の動きの「大局観」を捉えることができます。これにより、外部からの報酬なしに、自らの内的予測が一貫しているかどうかを確認するという「自己教師あり学習(self-supervision)」のみを通じて、安定した歩行パターンを学習することが可能になります。
シミュレーションの結果は非常に驚くべきものでした。模擬的な四足歩行ロボットを用いた実験では、この報酬を用いないシステムは性能スコア510 ± 68を達成しましたが、これは従来の報酬ベースのシステムが得たスコア450 ± 234よりも優れた数値でした。さらに印象的なことに、彼らはこれを初めて模擬的なヒューマノイド(人間型の体を持つロボット)にも適用し、何の報酬信号も与えずに350 ± 50というスコアを達成しました。従来のメソッドはこの設定におけるヒューマノイドに対しては完全に失敗していました。
最もエキサイティングな知見の一つは、このシステムがいかに「極端な」変化に対処できるかという点です。研究者は、物理条件が劇的に変化するシナリオでテストを行いました。ロボットの質量を**±30%変更し、地面の摩擦係数を2.5倍にする、あるいは0.4倍に減少させ、モーターに50ミリ秒の遅延を生じさせました。これらすべての変化が同時に発生する複合的なシナリオにおいても、Ground-JEPAモデルは元のパフォーマンスの78%を維持しました。対照的に、ランダムな変動を含めて訓練された従来の報酬ベースのモデルは、わずか21%**のパフォーマンスしか維持できませんでした。これは、動きの根本的な「多様体(マニフォールド)」、すなわち形状を学習することで、ロボットが世界の変化に対して非常に堅牢になることを示唆しています。
また、チームはモデルのサイズが巨大である必要はないことも突き止めました。このシステム全体はノートPCのGPU上で動作し、使用されるパラメータ数はわずか約130万個であり、数十億ものパラメータを必要とする他の大規模AIモデルと比較すると極めて小さいものです。彼らは、過去の研究で見られた「崩壊(学習が止まってしまう現象)」は、手法自体に欠陥があったからではなく、ロボットが誤ったタイプの内部マップ(特にSimNormと呼ばれる正規化されたマップ)を使用していたこと、および適切な構造を持たないまま先読みを行いすぎていたことが原因であることを明らかにしました。生の潜在表現と正しいプランニング・ホライゾンを用いることで、システムは見事に機能したのです。
ただし、著者らは、これらの結果が現時点ではシミュレーションに基づくものであると注意深く述べています。ロボットは仮想世界内の極端な変化の中で歩行を学びましたが、実世界の物理的なロボットに対してテストされたわけではありません。加えて、ヒューマノイドを静止させることは解決できても、片足でのバランスを取る複雑な物理特性があるため、二足でダイナミックに歩行させることは依然として挑戦すべき課題となっています。
究極的に、Ground-JEPAはロボット工学への新たな道を提示しています。ロボットに歩かせ方を教えるために、完璧な報酬関数を設計することに数ヶ月を費やす代わりに、私たちはただ、内なるリズムを物理法則と一致させる方法を教えればよいのかもしれません。これは高度なロボット制御を民主化し、標準的なノートPCを備えた小さな研究所であっても、膨大なスーパーコンピュータや果てしない試行錯誤による報酬を必要とせず、現実世界に適応できるロボットを作り出すことを可能にするでしょう。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。