← 最新の論文
💻 computer science

Imagine2Real: Towards Zero-shot Humanoid-Object Interaction via Video Generative Priors

Imagine2Real は、ロボットと物体の動きを 4 次元点軌道に統合し、行動基盤モデルの潜在空間を活用して疎なキーポイント追跡を行うことで、データ不足とリターゲティングの複雑さを克服し、柔軟かつ幾何学情報に依存しない物理的展開を可能にする、全身型ヒューマノイド - 物体相互作用のためのゼロショットフレームワークである。

原著者: Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

公開日 2026-05-22
📖 1 分で読めます☕ さくっと読める

原著者: Jiahe Chen, ZiRui Wang, Feiyu Jia, Xiao Chen, Xiaojie Niu, Weishuai Zeng, Tianfan Xue, Xiaowei Zhou, Jiangmiao Pang, Jingbo Wang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに箱を拾わせたり、ドアを押させたり、アイアンマンのように柱を殴らせたりしたいと想像してみてください。しかし、ロボットがこれらの特定の動作を行っている数千本の動画のライブラリを持っていないとしましょう。実際には、ロボットが物体とどのように相互作用するかについてのデータがほとんどないと言っても過言ではありません。これが、論文「Imagine2Real」が解決しようとしている問題です。

彼らがどのようにこれを行ったかの物語を、簡単な概念とアナロジーに分解して紹介します。

大きな問題:「欠落したマニュアル」

通常、ロボットに何か複雑なことを教えるには、ロボットが望む通りに正確に動く完璧なデジタルツインのような、大量の高品質な 3D データが必要です。しかし、このデータは極めて希少で、作成には莫大なコストがかかります。

このデータがなければ、ロボットは立ち往生します。歩行は上手にできても、物体に触れたり動かしたりしようとする瞬間、混乱してしまいます。既存の手法は 2D 動画を使ってこれを修正しようとしますが、2 つの大きな頭痛の種に直面します:

  1. 幾何学の罠: 動画を理解するために、古い手法は物体の完璧な 3D 設計図(CAD モデル)を必要とします。設計図がなければ、ロボットは道に迷ってしまいます。
  2. 「伸縮するスーツ」の問題: 人間の動画をロボット用に機能させるには、数学的に人間の体をロボットの体に「変形(モーフィング)」させる必要があります。これは、人間用のスーツをロボットに無理やり伸ばして着せようとするようなもので、よく破れたり歪んだり、不自然でぎこちない動きを生み出したりします。

解決策:Imagine2Real

著者たちは、Imagine2Realと呼ばれる新しい方法を提案しています。これは「夢から現実へ」のパイプラインと考えることができます。完璧な 3D マニュアルを必要とする代わりに、ロボットにまず動作を「想像」させ、その後、どのように実行するかを判断させます。

ここには 3 つのステップのプロセスがあります:

1. ドリーマー(動画生成)

まず、システムにロボットと物体の画像、そして「箱を拾って」といったテキスト指示を与えます。

  • 魔法: 動画生成 AI(動画を作る AI)が、ロボットがまさにその動作を行っている短いクリップを作成します。
  • 欠点: この動画は単なるピクセルの集まりであり、ロボットの関節や物理法則を知りません。それは単なる視覚的な夢に過ぎません。

2. トラッカー(「スパース」な目)

次に、ロボットはその動画を実際の動きに変換する必要があります。

  • 古い方法: ロボットと物体のすべての関節を追跡しようとします。これは、すべての指とつま先を見てダンスを追おうとするようなものです。それは散漫であり、前述の「伸縮するスーツ」(リターゲティング)を必要とします。
  • Imagine2Real の方法: 彼らは3 つの重要な点のみを追跡します。ロボットの足(ベース)、左手、そして右手です。また、物体も追跡します。
  • アナロジー: 霧の部屋でダンサーを追いかけることを想像してください。全身を見ようとする代わりに、鼻の先と手だけを追えばよいのです。それらが正しく動けば、残りの体は自然に追随するものです。これにより、「伸縮するスーツ」の問題を完全に回避できます。

3. ブレイン(行動基盤モデル)

ここが秘密のソースです。ロボットに単に「手をここに動かして」と指示するだけでは、バランスの取り方を知らないため、足がバタバタして転倒する可能性があります。

  • 解決策: ロボットは、**行動基盤モデル(BFM)**と呼ばれる事前学習済みの「ブレイン」を使用します。
  • アナロジー: BFM を、何年も歩行とバランスの練習を積んだマスターダンサーだと考えてください。ロボットは歩き方を再学習する必要はありません。BFM は自然な動きのための「安全網」を提供します。ロボットは BFM に、「手をこのように動かす必要がありますが、その間どうバランスを保てばよいですか?」と尋ねるだけです。
  • これにより、ロボットはそれら少数の「点」(スパースなキーポイント)を使用して、転倒することなく滑らかで自然な全身運動を生成できます。

学習プロセス:層を学んでいく

「箱を拾う」という特定のタスクのための十分なデータがないため、彼らはロボットをビデオゲームでレベルアップするように、3 つの段階で訓練します:

  1. レベル 1(歩行者): 彼らは BFM を何千時間もの一般的な人間の歩行データで訓練します。ロボットは自然に歩くことを学びます。
  2. レベル 2(トラッカー): 彼らはロボットに、歩きながらその 3 つの「点」(手と足)を追跡することを教えます。ロボットはそれらの目標を達成するために体を協調させることを学びます。
  3. レベル 3(相互作用者): 最後に、彼らは箱を保持することに関するわずかな特定のデータを与えます。ロボットは、レベル 1 と 2 のスキルを基盤として、実際に物体を掴むために動きに少しの「ひねり」を加えることを学びます。

実世界でのテスト

彼らは、モーションキャプチャ室(動きを完璧に追跡するカメラがある部屋)内で、実在のロボット(Unitree G1)でこれをテストしました。

  • 結果: ロボットは生成された動画を視聴し、手と足をどこに置くべきかを判断し、実際に箱を拾い上げ、押し、さらに柱を殴ることに成功しました。これらはすべて、最初に人間が実際にそれを行っているのを見たことがない状態で行われました。これはゼロショットであり、つまり、ロボットは動画からそれを「想像する」だけで特定のタスクを学習したことを意味します。

限界(細かい注記)

論文は、まだ改善が必要な 2 つの主要な点を認めています:

  1. 「盲点」: 現在のシステムは、実世界でのロボットの位置を知るためにモーションキャプチャ室を必要としています。ロボットが箱を押し、カメラがマーカーを見えなくした場合(箱がそれを遮っているため)、ロボットは混乱します。
  2. 「一方通行」: このプロセスは現在、オープンループです。ロボットは動画に基づいて計画を立て、実行します。「箱は実際に動いているか?」を常に確認し、リアルタイムで調整することはありません。ロボットと動画生成器が絶えず対話する真のクローズドループシステムを作成することが、次の大きな課題です。

まとめ

Imagine2Realは、以下の方法でロボットが物体と相互作用することを学ぶことを可能にするフレームワークです:

  1. 動画生成を通じて動作を夢見ること。
  2. 複雑な数学を避けるために、最も重要な部分(手/足)のみを観察すること。
  3. バランスを保ち、自然に動くために、事前学習済みの「ダンスインストラクター」(BFM)に依存すること。

これにより、ロボットは事前に記録された膨大なロボットデータのライブラリを必要とすることなく、新しいタスクを即座に学習できるようになります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →