← 最新の論文
🤖 AI

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

CLAPは、異種混在するインターネット規模のビデオを用いた学習を通じて、多様なロボットおよび人間のエンボディメント間でのゼロショット物理シミュレーションを可能にし、カリキュラムベースの学習レシピによって異なるアクションスペースを調和させることで、少ショット適応および汎用的な物理理解において最先端の性能を達成する新しいフレームワークである。

原著者: Kechen Liu, Ola Shorinwa

公開日 2026-08-28
📖 1 分で読めます☕ さくっと読める

原著者: Kechen Liu, Ola Shorinwa

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットは、人間と同じように物理的な世界を理解することに長い間苦労してきました。子供は、コップをテーブルから押せば落ちることや、タオルの角を引けば畳めることを学びますが、ロボットがこうした単純なルールを学ぶには、数千もの具体的な事例を必要とすることがよくあります。この困難さは、ほとんどのロボット学習システムが、単一の種類の機械からのデータに基づいて訓練されていることに起因しています。細長い腕を持つロボットは、グリッパーや人間の手を持つロボットとは異なる物理法則を学習するため、あるロボットが得た知識を他のロボットと簡単に共有することを妨げる障壁が生じてしまいます。これを克服するために、科学者たちはビデオ生成モデル、つまり、シーンの次に何が起こるかを想像できるコンピュータプログラムに着目し始めました。もしロボットがビデオを見て、物体の将来の動きを予測することができれば、実際に試行錯誤することなく、行動を計画できるようになります。しかし、これらの予測モデルは歴史的に単一のロボットタイプに限定されており、インターネット上に存在する膨大な多様な人間やロボットのビデオから学習することを妨げてきました。

プリンストン大学の研究チームは、このギャップを埋めるためのCLAPと呼ばれる新しいフレームワークを開発しました。彼らの研究は、単一のビデオモデルが、人間と多種多様なロボットが登場する膨大な混合ビデオを用いて訓練されることで、普遍的な物理法則を学習できることを示しています。核心となる考え方は、人間の手、ロボットの腕、そしてグリッパーは見た目は異なっても、物体を動かす際にはすべて同じ物理法則に従うという点です。誰が、あるいは何がその動作を行っているかにかかわらず、シーンの未来を予測するようにコンピュータを教えることで、研究者たちは、特定の機械の特定の動きではなく、世界の根底にあるメカニズムを理解するシステムを作り上げました。このアプローチにより、モデルは指示が提供されていないラベルなしのインターネットビデオからも、詳細なロボットデータからも学習することができ、物の動きや相互作用に関するより豊かな理解を生み出すことができました。

研究者たちは、使用したいデータが乱雑で一貫性に欠けるという大きな障害に直面しました。人間のビデオには、手がどのように動いたかという指示が付いていませんし、異なるロボットはそれぞれ異なる方法で動きを記述します。これを解決するために、チームはこれらすべての異なる「動きの言語」を共通の形式に翻訳する方法を考案しました。彼らは主に3つのツールを使用しました。それは、ロボットの手の正確な位置、動きに関する単純なテキストによる記述、そしてコンピュータが自ら導き出す学習された潜在的なアクション表現です。最も効果的な戦略は、段階的な学習プロセスでした。まず、モデルは潜在的なアクション表現を用いてラベルなしのビデオを観察することで、物理学の基本ルールを学習しました。基礎的なダイナミクスを理解した後、研究者はラベル付きの動きを持つロボットからの精密なデータを用いて、その知識を洗練させました。この2段階のアプローチにより、システムは膨大な量のインターネットビデオを利用して規模を拡大しながら、実際のロボットを制御するのに十分な精度を維持することができました。

この研究の結果は、新しいシステムが、単一のタイプのロボットのみで訓練された既存の最良のモデルと同等、あるいはそれ以上の性能を発揮することを示しています。困難なテスト環境において、モデルはビデオの将来のフレームを高い精度で予測し、物体がどのように落下するか、滑るか、あるいは操作されるかを正しくシミュレートできました。決定的なことに、このシステムは、新しいロボットごとに再訓練することなく、この知識を現実世界のタスクへと一般化することができました。単腕ロボットを用いたテストでは、システムはテープ、魚、あるいはロブスターといった様々な物体を拾い上げるための行動計画を立てることに成功し、標準的なロボット・ポリシーを上回る成果を出しました。さらに印象的なことに、システムは、それらの特定の機械のデータで訓練されたことがないにもかかわらず、二本腕のロボットや異なる身体構造を持つヒューマノイドロボットにも適用することができました。新しいロボットの動きに合わせてモデルの最終層を調整するだけで、システムは深い物理学的理解を保持し、正確な予測を継続することができたのです。

この研究は、より有能なロボットへの道が、新しい機械ごとに独自の脳を構築することではないことを示唆しています。代わりに、多様なデータの混合物を用いて訓練することで、単一のモデルが、ほぼあらゆるエージェントに適用可能な一般的な物理原則を学習できるのです。研究者たちは、相対的な動き(位置ではなく変化を表すもの)はテキストベースの指示には適している一方で、ロボットアームによる精密な制御には絶対的な位置が必要であることを発見しました。また、人間のビデオはモデルに物理学の基礎を教えるのには優れているものの、その知識を実際の成功するアクションへと変換するためには、実際のロボットからのデータが不可欠であることも明らかにしました。この研究は、隔離された単一目的のシステムから、一つの形態(エンボディメント)からの学習が他の形態に直接利益をもたらすような、より統一されたアプローチへと、ロボットの訓練方法を移行させる新しい道を確立しました。このシステムは完璧ではなく、予測においてエラーを起こすこともありますが、観察と想像を通じて物理的世界を理解させるための、重要な一歩を刻んでいます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →