AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
本論文は、行動、カメラ、およびエンボディメント(身体性)の各要素を分離することで、単一の人間による一人称視点ビデオから多様なクロスエンボディメントのロボット体験を合成する、因数分解されたワールドモデル・フレームワークであるAnyWorldを紹介しており、これにより、シミュレーションおよび実世界のヒューマノイドロボットの両方における操作ポリシーを大幅に向上させる制御可能なデータ生成を可能にしている。
原著者: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu
原著者: Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
技術要約:AnyWorld: クロスエンボディメント汎化のための因子分解された一人称視点ワールドモデル
1. 問題定義
汎用的なロボット操作における中心的なボトルネックは、大規模で接触を伴うロボット経験の不足である。現代のロボット学習は大規模な視覚・行動データセットの恩恵を受けているが、物理的なロボットによるそのようなデータの収集は高価であり、ハードウェアに依存し、多様なシーンやエンボディメント(形態)間でスケールさせることが困難である。人間の一人称視点ビデオは豊富な物理的相互作用を提供しているが、それらは特定の身体、カメラの軌跡、および環境に紐付いており、経験の極めて限定的な一部しか表していない。
本研究が取り組む核心的な課題は、**ゼロショット経験再構成(zero-shot experience recomposition)**である。すなわち、ペアとなる人間とロボットのデモンストレーションを必要とせずに、単一の人間の一人称視点の相互作用ビデオを、多様なロボットネイティブの視覚体験へと変換することである。目標は、記録された人間の相互作用を、基礎となる相互作用のダイナミクスを維持しながら、動作する身体、視点、およびシーンのコンテキストを変化させることで、複数のロボットドメインのロールアウトへと拡張可能な「再利用可能な種(seed)」として扱うことである。
2. メソドロジー:AnyWorld
AnyWorldは、相互作用をアクション(Action)、カメラ(Camera)、**エンボディメント(Embodiment)**という3つの独立した要素に因子分解する、クロスエンボディメント・ワールドモデリング・フレームワークである。
2.1 因子分解戦略
本モデルは、生成プロセスを以下の3つの制御可能な因子に分解する:
- アクション制御 (A1:T): ピクセル空間におけるレンダリングされたスケルトン制御ビデオとして表現される。これは画像平面の「どこ」で動きが発生するかを指定するものであり、関節コマンドや特定の行動ベクトルよりも、人間とロボットの身体間で共有しやすい、エンボディメントに依存しないインターフェースを提供する。
- カメラ制御 (C1:T): カメラの内部パラメータおよび外部パラメータから構築され、**Plückerレイ・エンベディング(Plücker ray embeddings)**に変換される。これにより、モデルはアクターの動きとカメラの動きを分離することができ、アクションとは独立した視点の進化を可能にする。
- エンボディメント・コンテキスト: 初期フレーム (I~0e) と テキストタグ (τe) によって指定される。初期フレームは、ロールアウト開始時におけるターゲットとなる身体の外観、シーンのレイアウト、オブジェクトの配置、および相互作用の幾何学構造を定義する。テキストタグは、特定のエンボディメント(例:人間、RoboCasa GR1、IRON)を識別する。
2.2 モデルアーキテクチャ
AnyWorldは、潜在拡散ビデオモデル(latent diffusion video model)(DiTブロックに基づく)として実装されている。
- 入力コンディショニング:
- アクション制御ビデオはエンコードされ、ノイズを含むビデオ潜在変数とチャネル次元で結合される。
- カメラ制御は軽量なアダプターを通過し、加法的な幾材信号としてパッチエンベディングに加算される。
- エンボディメントタグとキャプションはテキストエンベディングとしてエンコードされ、クロスアテンションを通じてトランスフォーマーブロックに注入される。
- 学習レジメン:
- ステージ1(事前学習): 強力なアクション・カメラ条件付きプライアを学習するために、大規模な一人称視点の人間相互作用データ(EgoDex)を用いて事前学習を行う。
- ステージ2(ファインチューニング): 人間、RoboCasa GR1、およびIRONロボットからの非ペアデータを使い、混合エンボディメントによるファインチューニングを行う。極めて重要な点は、ペアとなる人間とロボットのクリップを一切使用していないことである。モデルは、共有された因子分解インターフェースを通じて、異なるエンボディメントの外観を互換性のある相互作用ダイナミクスに関連付けることを学習する。
2.3 推論と再構成
推論時、モデルはゼロショット再構成をサポートする。ソースとなる人間ビデオから、アクションとカメラの制御を抽出する。初期フレームを編集して新しいターゲットとなる視覚的コンテキスト(身体、シーン、またはその両方の変更)を指定し、エンボディメントタグを更新する。その後、モデルは元の相互作用構造を保持しつつ、新しいエンボディメントと視点に適応したターゲットドメインのロールアウト (V^1:Te) を生成する。
ダウンストリームのポリシー学習のために、システムは**結合視覚・行動経験再構成(Joint Visual–Action Experience Recomposition)**を実行する。これは、視覚的な観察を再エンボディメントするだけでなく、アクション較正モジュールを使用して、人間の手首の軌跡をターゲットロボットの相対的なエンドエフェクタ・アクション空間にマッピングし、ペアとなる (observation,action) データを作成する。
3. 主な貢献
- 定式化: 本論文は、クロスエンボディメントの経験再構成をワールドモデリング問題として定式化し、ペアとなるデモンストレーションなしで、単一の人間の相互作用を複数のロボットネイティブなロールアウトへと拡張することを可能にした。
- モデルアーキテクチャ: 制御可能なロールアウト生成のために、アクション制御、カメラ制御、およびターゲット・エンボディメント・コンテキストの条件付けを組み合わせた、因子分解されたビデオ拡散モデルであるAnyWorldを導入した。
- 実証的検証: 生成されたロボットドメインのロールアウトが、シミュレーション(RoboCasa GR1)および実世界(IRON)の両方の設定において、ダウンストリームの視覚・言語・行動(VLA)適応を向上させることを示した。さらに、制御された介入を用いることで、生成されたデータが特定のポリシーの失敗(例:不適切な完了プライア)を修正できること、および言語に基づいた空間ターゲット選択の転移が可能であることを示した。
4. 実験結果
著者らは、ワールドモデリングの制御性と、ダウンストリームのVLA適応という2つの観点からAnyWorldを評価している。
4.1 制御性と品質
- 制御性: 60本のビデオを用いたベンチマークにおいて、AnyWorldはActionAlign、CameraAlign、およびEmbodAcc(エンボディメント精度)において、ベースライン(Cosmos-Predict2.5およびWAN Fun-Control)を上回った。この因子分解アプローチは平均スコア0.778を達成しており、ベースラインよりも有意に高く、アクション、視点、および身体に対する優れた制御を実現している。
- ビデオ品質: VBenchメトリクスを使用すると、AnyWorldは強力な被写体の一貫性、背景の一貫性、および動きのスムーズさを維持しており、平均スコア0.971を達成している。これはベースラインと同等か、あるいはわずかに優れている。
4.2 ダウンストリームVLA適応
- シミュレーション (RoboCasa GR1): AnyWorldで生成されたデータをUniTベースラインに加えることで、18のピック・アンド・プレイス・タスクにおける成功率が**49.8%から54.6%**に向上した。
- 実機ロボット (IRON): 背景が変化する20回のバナナ把持試行において、成功率は**20.0%から55.0%**に向上した。
- データ比率のアブレーション: ファインチューニング中に人間とロボットのデータを2:1の割合で混合した際、アクションの多様性とロボットドメインへの接地性の間で最良のバランスが得られた。
4.3 標的化された能力転移
本論文は、再構成されたデータが特定のポリシーのギャップをターゲットにできることを示している:
- 状態条件付き修復(State-Conditional Repair): ベースラインのポリシーは、「部分的完了」状態(オブジェクトが既に一部配置されている状態)で停止した。これらの欠落した状態に対して人間のデモンストレーションを再シーン化し、較正されたアクションとペアにすることで、ポリシーを再開させ、タスクを完了させることができた。
- 反事実的接地(Counterfactual Grounding): 言語に基づいた空間選択をテストするために、著者らは相反する指示を持つデュアルターゲットの観察を作成した。「アクションのみ」の介入(アクションを変更するが、元の片側のみの観察を維持する)では、安定した指示追従を学習できなかった。結合視覚・行動再構成(視覚的状態とアクションの両方を変更する)を行った場合にのみ、言語に基づいてターゲットを確実に切り替えることが可能となった。
5. 意義と主張
本論文は、AnyWorldがロボット学習のためのスケーラブルな経験エンジンとして機能すると主張している。その主な意義は、コストのかかるペアとなる人間とロボットのデモンストレーションを必要とせずに、豊富で非ペアな人間との相互作用ビデオを、有用なロボットネイティブのトレーニングデータへと変換できる点にある。
著者らは以下を強調している:
- 視覚的再構成の必要性: アクションのみの反事実的介入の失敗は、単にアクションをラベル付けし直すだけでは不十分であることを証明している。ロボットは、アクションおよび指示と一致する、ロボットネイティブな視覚状態に接地していなければならない。
- 汎用性: このフレームワークにより、単一のモデルが身体、視点、およびシーンを横断して制御可能な再構成をサポートすることができ、人間ビデオを多様なロボット経験のための再利用可能な種へと効果的に変えることができる。
- 実用的影響: 生成されたデータは、実世界のロボットポリシーの堅牢性と能力を直接的に向上させ、接触を伴う操作におけるデータ不足のボトルネックに対処する。
6. 限界
著者らはいくつかの限界を認めている:
- 触覚フィードバック: 視覚的なロールアウトは、精密な制御に必要な触覚フィードバックや接触力を完全には捉えることができない。
- 抽出の信頼性: 本手法は、信頼性の高いアクションおよびカメラの抽出に依存している。深刻な遮蔽、高速な動き、トラッキングエラー、またはカメラの揺れは、制御性を低下させる可能性がある。
- 範囲: 現在の評価は3つのエンボディメント(人間、GR1、IRON)のみを対象としており、他の形態や長期的なタスクへの広範な汎用性については今後の課題である。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。