あなたがロボットに家事を教えることを想像してみてください。この論文は、これらのロボットをより賢く、柔軟にし、これまで見たことのない状況にも対処できるようにするための新しい手法「UniJEPA(Unified Joint Embedding Prediction and Action:統合的結合埋め込み予測と行動)」を紹介しています。
以下に、簡単なアナロジーを用いた仕組みの解説を示します。
課題:「二つの頭」を持つロボット
現在、ロボットの頭脳は通常、2 つの派閥に分かれており、どちらも弱点を持っています。
- 「話者」(視覚言語モデル): これらのロボットは言語や画像の理解に優れています。「赤いカップを持って」と言われれば、カップが何か、そして「赤」が何を意味するかを理解します。しかし、物理的な予測が苦手です。カップを強く掴んだらどう揺れるか、テーブルの上をどう転がるかを直感的に理解していません。
- 「予測者」(生成モデル): これらのロボットは次に何が起こるかを推測するのが得意です。ボールが転がっているのを見れば、1 秒後にどこにいるかを予測できます。しかし、「常識」や言語理解が欠如していることが多いです。どのように動くかは知っていても、なぜ動いているのか、あるいは人間に何を頼まれたのかを理解していない可能性があります。
ほとんどのロボットは、どちらか一方を使用するか、あるいは両者の長所を失うような方法で無理やり組み合わせようとしています。
解決策:「バイリンガルの夢見る者」(UniJEPA)
UniJEPA は、2 つの言語を話し、2 つの形で夢を見ることを同時に学ぶようなロボットです。これは「話者」と「予測者」を 1 つの頭脳に統合したものです。
車を運転することを学ぶ学生に例えてみましょう。
- 離散学習(「話者」): これは交通規則や語彙を学ぶことに相当します。「一時停止標識は止まることを意味する」「緑は進むことを意味する」などです。ロボットは複雑な指示を理解し、言葉を使って自分が何を見ているかを説明することを学びます。
- 連続学習(「夢見る者」): これは車の「感覚」を学ぶことに相当します。規則だけでなく、動きの滑らかな流れを予測することです。ハンドルを少し切ると、車はどのように横滑りするか?UniJEPA は、ぼやけた動画としてではなく、次に何が起こるかの高位の「感覚」や地図として、未来の視覚シーンを予測することを学びます。
訓練方法(2 段階のプロセス)
第 1 段階:「図書館と映画館」フェーズ(事前学習)
ロボットが実際に物体に触れる前に、膨大な量のデータを「読み」、「見る」ことを許可します。
- 彼らはロボットに、人間やロボットがタスク(引き出しを開ける、おもちゃを拾うなど)を行っている100 万本以上の動画を与えました。
- トリック: 彼らはロボットに同時に 2 つのことを行わせました。
- 質問に答える: 「ロボットは何をしているか?」(これにより言語と理解が鋭くなります)。
- 未来を予測する: 「ロボットが腕をこのように動かしたら、1 秒後の画像はどう見えるか?」(これにより物理と運動の理解が鋭くなります)。
- 両方を行うことで、ロボットは言葉と物理的な動きが完璧にリンクしたメンタルモデルを構築します。
第 2 段階:「運転学校」フェーズ(微調整)
ロボットが一般的な知識を得た後、彼らはロボットが自らの身体を動かす方法を具体的に教えます。
- 実際のロボットアームやハンドからのデータを見せます。
- ロボットは、その「夢」(未来の予測)と「理解」(言語指示)を直接行動トークン(モーターを動かす具体的なコマンド)に変換することを学びます。
- 衝突することなく実際の腕を動かすための複雑な数学処理を処理するために、特別な「専門家」システム(専門家チームのようなもの)を使用します。
結果:なぜ優れているのか
この論文は、このロボットを 2 つの方法でテストしました。
- ビデオゲーム内(シミュレーション): 彼らは、特定の物体を特定の方法で動かすなど、これまで見たことのないタスクを与えました。UniJEPA は、他のすべてのトップロボットを大幅に上回る成績(約 9〜12% 優位)で打ち破りました。
- 現実世界: 彼らはそれを実際のロボットアームと、精巧な 12 本指のロボットハンドに搭載しました。
- 魔法: 彼らがロボットにこれまで見たことのない全く新しい物体(例えば、見たことのないおもちゃや奇妙な色)のタスクを与えたとき、UniJEPA は混乱しませんでした。特定の画像を単に暗記するのではなく、「把持」や「移動」という概念を学んでいたため、競合他社よりもはるかに優れた方法で、これらの「分布外(奇妙な)」状況に対処することができました。
結論
UniJEPA は、単に指示を暗記するだけ、あるいは物理を推測するだけのロボット頭脳ではありません。それは言語を通じて世界を理解すると同時に、運動を通じて未来をシミュレートすることを学びます。この二重のアプローチにより、それは「汎用性」を持つことができます。つまり、毎回ゼロから再学習する必要なく、新しいタスクや新しい物体に適応できるロボットです。
技術概要:UniJEPA
問題定義
オープンエンドな環境において多様なタスクを処理できる汎用ロボットポリシーの開発は、具現化された AI(Embodied AI)における中心的な課題のままです。既存のアプローチは、通常、意味理解のための視覚言語モデル(VLM)または視覚ダイナミクスのための生成モデルのいずれかに依存しています。しかし、これらの手法は重大な限界に直面しています。
- VLM ベースのアプローチは、希少で不均質なロボットデータセットで微調整された際に、基盤となる能力の低下をしばしば経験します。これらは、静的な視覚言語タスクと動的なロボット動作タスクとの間の根本的な不一致を見落としがちです。
- 生成ベースのアプローチ(例:動画予測)は動的表現学習を促進しますが、事前学習済み VLM に内在する重要な視覚言語の整合性を維持できないことがよくあります。
- 現在の統一モデルは、離散トークン予測フレームワーク内で理解と生成を統一しようとする傾向があり、これにより視覚言語の整合性の堅牢性と、連続的な物理的ダイナミクスを効果的にモデル化する能力が損なわれる可能性があります。
本論文は、ロボットポリシー学習には、離散的なタスク理解(理解)と連続的未来状態表現学習(計画とダイナミクス)を統合するパラダイムが必要であると主張しています。
手法:UniJEPA
著者は、2 段階のトレーニング戦略を通じて離散表現学習と連続表現学習を統合する視覚言語動作(VLA)フレームワークであるUniJEPAを提案します。このアーキテクチャは、モダリティ特化型エキスパートを備えた混合トランスフォーマー(MoT)設計を採用しています。
1. 統一視覚言語埋め込みモデリング(ステージ 1:事前学習)
第一段階では、クロス具現化の事前学習パラダイムを確立し、テキストと画像の結合表現を学習します。
- アーキテクチャ: モデルは事前学習済み VLM(具体的には Paligemma)で初期化され、MoT フレームワーク内にジェネレーターエキスパートと(後続のステージにおける)アクションエキスパートを導入します。
- 離散表現学習: モデルは、大規模な視覚言語データセットと、VQA 形式に注釈付けされた具現化タスク記述でトレーニングされ、シーンや指示を理解するための微細な言語表現を学習します。
- 連続世界モデリング: 生画像ピクセルを予測する先行研究とは異なり、UniJEPA は連続的な高次元視覚特徴を予測します。凍結された視覚エンコーダ(例:SigLIP)が未来の観測を符号化し、モデルはこれらの連続特徴(o^t+h)と離散テキストトークン(l^)の両方を予測することを学習します。
- トレーニング目的: モデルは、言語ブランチに対するクロスエントロピー損失と、連続視覚予測ブランチに対する平均二乗誤差(MSE)損失を組み合わせた結合損失関数を使用します。
2. 統一動作モデリング(ステージ 2:微調整)
第二段階では、モデルを具現化固有のデータで微調整し、予測表現を動作トークンにマッピングします。
- アクションエキスパート: 動作空間を処理するために、ゼロから訓練された独立したエキスパートが用意されます。これは、動作の連続的かつ本質的に多モーダルな分布を捉えるためにフローマッチングを利用します。
- 結合最適化: モデルは、未来の連続視覚状態の予測と動作シーケンスの実行を同時に予測するようにトレーニングされます。目的関数は、動作生成のためのフローマッチング損失と連続視覚予測損失を組み合わせます。
- データ戦略: 事前学習には、ロボット動画(サブタスク記述付き)、人間のデモンストレーション動画、および一般的な視覚言語 QA データの混合が使用されます。微調整は、シミュレーションおよび実世界のロボットからの VLA データのみに限定して行われます。
主要な貢献
- 新規 VLA アーキテクチャ: 理解のための離散トークン予測と、ダイナミクスのための連続視覚予測を、統一された MoT アーキテクチャ内で統合する VLA フレームワークの導入。
- 2 段階トレーニングフレームワーク: 大規模事前学習中に学習された中間表現を維持しつつ動作表現を整合させる戦略により、インターネット規模のデータからロボットタスクへの知識転移を効果的に実現。
- 連続特徴予測: 生ピクセルや離散トークンではなく、連続視覚特徴を予測することが、動作生成に不可欠な動的情報を学習するためのより効果的なシグナルとなることを実証。
実験結果
UniJEPA は、2 つのシミュレーションベンチマークと 2 つの実世界ロボットプラットフォーム(7 自由度の Franka Emika Panda アームと 12 自由度の器用な手)で評価されました。
- シミュレーションベンチマーク:
- Calvin ベンチマーク: UniJEPA は平均サブタスクシーケンス長4.11を達成し、以前の最高記録(UP-VLA の 4.08)を上回り、GR-1(3.06)などのベースラインを大幅に凌駕しました。
- SimplerEnv: WindowX および Google Robot プラットフォームにおいて、UniJEPA はそれぞれ**71.0%および78.4%**の最先端の成功率を達成しました。他の手法に見られる「スパイク状」のパフォーマンスプロファイルではなく、すべてのサブタスクで一貫して高いパフォーマンスを示しました。
- 実世界実験:
- Franka Panda アーム: UniJEPA は、新しい物体を含む未見のタスクを含め、4 つのタスクカテゴリ(ピック&プレース、ボタン押し、ケーブル配線、引き出し)すべてで最高成功率を達成しました。
- 12 自由度の器用な手: モデルは 9 つのスキルカテゴリ全体で平均成功率が最も高く、ベースラインと比較して未見のタスクで12% の改善を示しました。
- アブレーション研究:
- 事前学習を除去すると、実世界のピック&プレースタスクにおける成功率が約 16% 低下しました。
- 予測に連続視覚特徴を使用すると、このコンポーネントを持たないモデルと比較して約 20% のパフォーマンス向上が見られました。
- 連続エンコーディング手法の中では、SigLIP特徴が VLM バックボーンとの整合性が最も高く、DINO や蒸留ベースのアプローチを上回りました。
意義と主張
本論文は、UniJEPA がロボットポリシー学習における意味理解と動的予測のトレードオフを成功裏に解決したと主張しています。ロボットおよび人間のデモンストレーションデータの両方における大規模事前学習を活用することで、モデルは堅牢な汎化能力を獲得します。
著者は、このアプローチにより、既存の手法よりも完全に新しい物体や分布外(OOD)をより効果的に処理できることを強調しています。連続的未来表現学習の統合により、ポリシーは物理的ダイナミクスをよりよく予測できるようになり、維持された視覚言語の整合性は複雑な指示の正確な解釈を確保します。これらの結果は、理解、計画、連続表現学習を組み合わせた統一アプローチが、汎用ロボットポリシーへの実現可能な道であることを示唆しています。
毎週最高の AI 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録