← 最新の論文
💻 computer science

EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning

EgoInfinityは、任意のインターネット動画をメトリックな手と物体の相互作用表現および実行可能なロボット軌道へと変換し、多様な形態や視点にわたるスケーラブルなヒューマン・イン・ザ・ループ・フリーのロボット学習とリターゲティングを可能にする、モジュール式のウェブスケール4Dデータエンジンである。

原著者: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

公開日 2026-06-17
📖 1 分で読めます☕ さくっと読める

原著者: Gaotian Wang, Kejia Ren, Andrew Morgan, Yiting Chen, Howard H. Qian, Podshara Chanrungmaneekul, Kaiyu Hang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 ✨ これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、箱を開ける、スープを注ぐ、果物を切る、テーブルを拭くといった、日常的な作業を行うYouTube動画の膨大なライブラリを持っていると想像してください。現在、ロボットはこれらの動画から「学習」することがあまりできません。なぜなら、映像は単なる平坦な2Dの画像だからです。ロボットには、箱がどれくらいの重さなのか、スープがどれくらい離れた場所にあるのか、あるいは人間の指が正確にどのようにハンドルに触れたのかが分かりません。それは、白黒映画を見て車の運転を学ぼうとするようなものです。動きは見えますが、ステアリングホイールや路面の感触は分かりません。

EgoInfinityは、これらの平坦で乱雑なインターネット動画を、ロボットのための3Dで物理法則に基づいた「指示書」へと変換する、新しい「魔法のエンジン」です。その仕組みを、シンプルなステップに分けて説明します。

1. 「探偵」フェーズ(手がかりを見つける)

まず、エンジンは数百万ものビデオクリップ(具体的にはAction100Mと呼ばれる巨大なデータセット)をスキャンします。これは、良い部分を探し出す探偵のように機能します。退屈な部分は無視し、実際に手が何かを行っている瞬間にのみ焦点を当てます。

  • 比喩: これは、100時間の生映像を素早くスキャンして、俳優が実際に話している5分間だけを見つけ出し、沈黙している時間を無視する映像編集者のようなものです。

2. 「3D翻訳機」(画像を幾何学データに変える)

良いクリップを見つけると、エンジンは2Dビデオを3Dデータへと翻訳し始めます。AIツールを使用して、以下のようなことを推測します:

  • 形状: その物体はどのような形をしているか?(丸いリンゴか、平らな箱か?)
  • 位置: 物体は空間のどこにあるのか?
  • 手: 人間の指はどのように動いているのか?
  • スケール: 全体の大きさはどのくらいか?(そのカップは高さ2インチなのか、それとも2フィートなのか?)

論文ではこれを「メトリック・キャリブレーション(計量校正)」と呼んでいます。

  • 比喩: コーヒーカップを持っている人の写真を見ていると想像してください。普通の人はサイズを推測するだけかもしれません。EgoInfinityは、超高性能な3Dスキャナーのようなもので、そのカップが正確に4インチであり、手が12インチ離れていることを瞬時に理解し、平坦な写真を、周囲を歩き回れる仮想3Dモデルへと変えてしまいます。

3. 「現実チェック」(間違いを修正する)

AIは時として混乱することがあります。手が物体を覆ってしまうと、AIは物体の位置を見失うことがあります。EgoInfinityには、特別な「インタラクション・アウェア・リファインメント(相互作用を考慮した精緻化)」ステップがあります。これは、手と物体の関係性を注視します。

  • 論理: もし手が物体を保持しているなら、物体は必ず手と共に動かなければなりません。もし手が止まっているなら、物体が浮いて動いてはいけません。
  • 比喩: これは、ビデオを見ているダンスのインストラクターのようなものです。もしビデオの不具合で、ダンサーのパートナーが突然宙に浮いてしまったら、インストラクターはこう言います。「それは間違いです。手を繋いでいるなら、一緒に動かなければなりません」。エンジンは、物理的に正しく見えるように、これらの不具合を修正します。

4. 「ユニバーサル・アダプター」(異なるロボットへの教育)

これが最も巧妙な部分です。このエンジンは、単に人間の体の動きをそのままコピーするのではありません。人間には長い腕と両手がありますが、ロボットは短い腕を持っていたり、車輪が付いていたり、手とは似ても似つかないグリッパーを持っていたりするかもしれません。

  • 解決策: EgoInfinityは、動きの「目的」(例:「カップを持ち上げる」)を理解し、その目的をロボット独自の言語へと翻訳します。そして、「この特定のロボットなら、どのようにして同じ結果を達成できるか?」と問いかけます。
  • 比喩: あなたが犬にボールを取ってくる練習をさせていると想像してください。あなたは犬に「人間のように走れ」とは教えません。「ボールを取りに行け」と伝え、犬は自分の足や脚を使ってどう行うかを自分で判断します。EgoInfinityはロボットに対してこれを行います。人間の「取ってこい」という動作を取り込み、ロボットの関節を使ってどのように「取る」かを指示するのです。

彼らは実際に何を作ったのか?

著者たちは単に理論を書いただけではありません。彼らは実際に動作するシステムを構築し、テストを行いました。

  • ウェブエンジン: 人間がすべてのフレームにラベルを付ける必要なく、これらのビデオを自動的に処理できるツールを作成しました。
  • データセット: Action100Mコレクションから106個のビデオを処理し、3Dの手と物体のライブラリを作成しました。
  • 実機ロボットによるテスト: 処理されたビデオを見るだけで、実際にロボット(Unitree G1ロボットや、デュアルアームのFrankaロボットなど)に、切る、注ぐ、拭くといったタスクを実行させることに成功しました。また、データに基づいたガイドを用いて、さまざまな物体(リンゴ、バナナ、スープの缶)を掴むようにロボットの手を訓練しました。

限界について

論文では、現時点でできないことについても正直に述べています。

  • カメラの動き: カメラがほぼ静止している(三脚に固定されている)場合に最もよく機能します。カメラが激しく揺れていたり、動いている手の中で保持されていたりすると、精度が落ちます。
  • 触覚: それらは「感じる」ことができません。手がどこにあるかは分かりますが、ロボットがどれくらいの強さで握っているのか、あるいは物体が滑りやすいのかどうかまでは分かりません。
  • 完璧な精密さ: 一般的なタスクには優れていますが、繊細な手術や、指先の正確な配置を必要とするタスクには、まだ精密さが足りない可能性があります。

要約すると: EgoInfinityは架け橋です。それは、整理されていない、構造化されていない人間のYouTube動画の世界を、ロボットが実際に読み取り、従うことができる、クリーンで3Dかつ物理的に正確な指示へと変換します。これにより、高価なセンサーや、あらゆる動きを記録するための人間の教師を必要とすることなく、ロボットが新しいスキルを学ぶことを可能にします。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →