JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
JEPA-WAMは、事前学習済みV-JEPA空間上に構築された潜在世界行動モデルを導入しており、共通の予測器を通じて空間的に構造化された未来予測と連続的な行動生成を統合することで、大規模な方策の事前学習を必要とすることなく、ロボット操作のベンチマークにおいて最先端の性能を達成しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットに料理を教える場面を想像してみてください。シェフが玉ねぎを切っている動画を見せて、「これと同じことをして」と言うだけで済みます。しかし、もしロボットがその特定の動画の見た目だけを記憶してしまうと、シェフが違う帽子を被ったり、キッチンの照明が変わったりしただけでパニックに陥ってしまうかもしれません。これが、Vision-Language-Action (VLA) モデルが直面している課題です。これらのモデルは、慣れ親しんだ環境での指示に従うことには長けていますが、学習時とは少し異なる世界に直面すると、しばれてつまずいてしまいます。
これを解決するために、科学者たちはロボットに「予測器」であることを教えようとしてきました。単に反応するのではなく、ロボットが次に何が起こるかを想像させるのです。「もしこのカップを押したら、テーブルから滑り落ちるだろう」と予測できれば、より優れた計画を立てることができます。しかし、ロボットに高精細な未来のビデオを生成させることは、次に何をすべきかを決めるためだけに、学生に小説を一冊書き上げるよう求めるようなものであり、膨大な時間と計算能力を必要とします。そこで研究者たちは、ショートカットとなる「潜在的(latent)」なモデル、つまり、絵全体を描くことなく「未来の概念」を予測する方法を探しました。しかし、ここには落とし穴があります。多くのショートカット手法は、詳細を失いすぎるか、あるいは予測と行動を別々の、切り離されたタスクとして扱ってしまうのです。
これが、JEPA-WAM という新しいアプローチです。これは、ロボットに、一コマ一コマの絵を描くことに固執することなく、時間の流れを「感じる」ことを教えようとする試みです。それは、シンプルな問いを投げかけます。「世界の変わり方を理解し、その理解を利用して、一つの滑らかな動きの中でより良く動くことができるか?」
ロボットの「時間感覚」のショートカット
JEPA-WAM をご紹介しましょう。これは、現在の写真を見て次の写真を推測するだけのロボットではありません。代わりに、二つの間の「関係性」を学ぶロボットです。
手品を見ているところを想像してください。マジシャンが箱の中に赤いボールを入れ、その後で青いボールを取り出します。標準的なロボットは単に「赤ボール → 青ボール」と記憶するだけかもしれません。しかし、JEPA-WAMは、その「遷移(変化)」に注目する探偵のようなものです。「赤いボールが消え、箱が揺れ、青いボールが現れた」というプロセスを理解します。単なる前後関係ではなく、変化の物語を学ぶのです。
研究者たちは、V-JEPA と呼ばれる事前学習済みの「視覚脳」の上にこのシステムを構築しました。V-JEPAは、すでに何百万もの動画を視聴し、物体がどのように動き、相互作用するかを学んだロボットだと考えてください。JEPA-WAMはこの脳を利用し、そこに特別な「タイムトラベル」モジュールを追加します。
ここからが魔法のトリックです。将来のぼやけたビデオを生成させる(これは遅くてコストがかかる)代わりに、JEPA-WAMはロボットに**ジョイント・マップ(結合マップ)**を予測させます。今現在のキッチンの写真と、5秒後のキッチンの写真を想像し、それらを重ね合わせるとします。JEPA-WAMは、未来の写真をゼロから描こうとはしません。代わりに、重ね合わされた二つの写真の「差分」に注目し、ピクセルがどのように移動したかを正確に予測することを学びます。「カップが左に2インチ動いた」「引き出しが開いた」といったことを学び、物事が「どこで」起きたかという微細な詳細を保持するのです。
共有された脳:一つの予測器、二つの仕事
JEPA-WAMの最も巧妙な点は、その脳の使い方にあります。従来のシステムの多くでは、未来を予測する部分とロボットの腕を動かす部分が、壁越しに会話している二人の別々の人物のようでした。一方が未来を推測し、もう一方がそれに聞き取ろうとするのです。
JEPA-WAMは**共有予測器(Shared Predictor)**を使用します。想像してみてください、テストを受けている一人の非常に賢い学生を。
- タスクA: 学生は現在のシーンを見て、世界がどのように変化するかを予測します(「時間感覚」)。
- タスク B: その同じ理解を用いて、ロボットの腕をどう動かすかを決定します(「行動」)。
学生がこれら両方のタスクを同時に行っているため、未来を予測することを学ぶことが、直接的に「どのように動くか」の決定を形作ります。この密接な結合が、ロボットをより賢くすることを論文は示唆しています。それは、単にステップを暗記するだけでなく、音楽のリズムを理解しているダンサーのようなものです。予測と行動が同じ理解から生まれているため、動きが自然に流れるのです。
それは本当に機能するのか?
研究者たちは、3つの異なる環境でこのアイデアをテストしました:標準的なビデオゲームのシミュレーション、ランダムな物体が存在するより混沌としたシミュレーション、そして研究室の実物のロボットアームです。
シミュレーションにおいて:
環境の変化(照明の変化や物体の位置の変化など)への対応力をテストする LIBERO-Plus というベンチマークにおいて、JEPA-WAMは 79.2% を記録しました。これは、大量のロボットデータで事前学習されていないロボットの中では最高の結果でした。さらに印象的なことに、この「時間感覚」のトリックを、すでに強力なロボット脳である π0.5 に適用したところ、スコアは 84.5% から 86.3% へと上昇しました。これは、たとえ賢いロボットであっても、時間の流れを予測することを学べばさらに賢くなれることを示唆しています。
実世界において:
チームは、デュアルアーム(二本の腕が連携して動く構成)を備えた実物のラボにロボットを持ち込みました。ブロックを積み重ねる、果物を皿に置く、引き出しを開けるといったタスクを行わせました。
- セットアップが想定通りであった場合(In-Distribution)、JEPA-WAMは約 59.8% のスコアを出しました。
- 背景をいじったり物体を動かしたりした場合(Out-of-Distribution)、JEPA-WAMは依然として 54.2% を維持しました。
- これに対し、標準的なロボット(π0)は、環境が変化すると 51.8% から 22.5% という不安定な数値まで低下しました。
この結果は、JEPA-WAMが非常に堅牢であることを示しています。特定のシーンを暗記するのではなく、物体が動く「論理」を学んでいるため、予期せぬ事態にも対処できるのです。
それが「何ではないか」(および、それが否定するもの)
論文では、JEPA-WAMが「何ではないか」についても注意深く指摘しています。
- それはビデオ生成器ではありません。未来の高精細なビデオを新しく作成しようとはしません。著者らは、すべてのピクセルを生成しようとすることはコストがかかりすぎ、ロボットの制御には必ずしも必要ではないと主張しています。
- それは単に「最終的な状態」を予測するだけのものでもありません。研究者たちは、「現在」の画像なしに「未来」の画像のみを見るバージョンをテストしましたが、その結果は(77.3%に対し79.2%と)劣っていました。これは、「今」と「後」の関係性を理解することが、単に結末を推測することよりも重要であることを証明しています。
- それはあらゆることに対する万能薬ではありません。もし同じ視覚的シーンに対して、特定の指示(例:「カップを押す」対「カップを引く」)に基づいて全く異なる結果が生じる場合、モデルは言語固有の目標よりも視覚的な変化に焦点を当てているため、苦戦する可能性があると著者らは述べています。
結論
JEPA-WAMは、ロボットをより適応力のあるものにするための秘訣は、単に多くのデータや大きな脳を与えることではなく、行動に直接結びつく形で「時間の流れ」を理解させることにあると示唆しています。共有された脳を使用して、世界の変わり方を予測し、どのように動くかを決定することで、ロボットは、混乱したキッチンの中でもパニックに陥ることなく適応できる熟練した人間のようになります。
シミュレーションと実世界の試行によって測定された結果は、この「結合予測」のアプローチが、予測不可能な現実世界に対処できるロボットを構築するための強力な方法であることを示しています。あらゆる可能なタスクに対する解決策にはまだなり得ませんが、単に従順であるだけでなく、真に適応力を持つロボットを作るための有望な新しい道を提示しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。