ロボットにサンドイッチの作り方や、蛇口の修理の仕方、あるいはシャツの畳み方を教えることを想像してみてください。ただ教科書のライブラリを読み込ませるだけでは不十分です。ロボットには、私たち人間が行うように、実際に物事を行う様子を「見て」、そして「感じる」必要があるのです。これが「身体化された知能(embodied intelligence)」の世界です。ここでは、コンピュータは私たちと同じように、物理的な世界と相互作用することによって学習します。しかし、そこには落とし穴があります。ロボットは私たちとは異なる見方をするのです。もし棚に設置されたカメラからビデオを録画した場合(「三人称視点」)、ロボットは部屋全体は見えますが、指先の細かな動きを見逃してしまいます。もしロボット自身の目から録画した場合(「一人称視点/エゴセントリック視点」)、正しい視点を得られますが、学習に十分な高品質のデータを入手することは非常に困難で、コストもかかります。通常、人の頭に高価な専用カメラを取り付けるか、あるいは何が起きているのかをコンピュータに伝えるために、ビデオのあらゆる一秒に対して手動でラベル付けを行う必要があります。こうした「人間の目」によるビデオの、大規模で使いやすいライブラリがなければ、ロボットは日常生活の微妙なコツを学ぶことができません。
ここで、「Open-AoE」と呼ばれる新しいプロジェクトが登場します。これは、ロボットを教えるための巨大なオープンソースのツールキットのような役割を果たします。研究者たちは、誰もがすでにポケットの中に完璧なカメラを持っていることに気づきました。それはスマートフォンです。そこで彼らは、一般の人々をデータ収集者に変えるシステムを構築しました。彼らは、人々が自分のスマートフォンを使って、コーヒーを注いだりキーボードをタイピングしたりといった日常的なタスクを行っている様子を録画するアプリを作成しました。しかし、彼らは単に録画するだけで終わったわけではありません。録画された生の、整理されていないビデオを取り込み、それを高度に整理された、ロボットが学習可能なレッスンへと変える、クラウド上の巨大な自動化工場を構築したのです。
チームは、これらのビデオを合計2,000時間も集めました。これは、500人以上の異なる人々によって、400種類以上の異なるスマートフォンを使用して収集されたものです。これは膨大な時間です!ビデオは、キッチンからオフィスまで400以上の異なるシーンをカバーしており、8,000以上の異なるタスクが含まれています。このプロジェクトが特別なのは、その量だけでなく、システムが映像に加える「魔法」にあります。高度なAIを用いることで、システムは手がどこで動いているか(指の21個の関節レベルまで)、カメラがどのように動いているかを自動的に特定し、ビデオを意味のある小さなアクションの断片へと分解します。さらに、何が起きているのかについてのテキストによる説明文さえも作成します。
このように考えてみてください。以前は、ロボットに教えたいと思ったら、撮影クルーを雇い、高価な機材を購入し、何年もかけて映像を編集しなければなりませんでした。Open-AoEは、いわば全員にスマートフォンを渡し、「あなたの日常を撮影してください」と言い、その後、魔法のようなロボットエディターが、それらの映画をロボットが学習するための完璧な教科書へと瞬時に作り変えてくれるようなものです。論文は、このアプローチが有効であることを示しており、ロボットが単に「何をすべきか」だけでなく、「どのように手や目を動かしてそれを行うべきか」を理解するための、豊かで多様なデータセットを提供しています。
また、研究者たちは、科学者がこのデータを使って面白いことができる一連のツール(「ツールチェーン」)も構築しました。これにより、手の3Dの動きを可視化したり、人間の動きを異なるロボットの体に「リターゲティング(適合)」させたり(例えば、人間の腕をロボットの腕に変えるなど)、異なる種類のAIモデルを訓練したりすることができます。彼らは、この多様なスマートフォンベースのデータを使用することで、100万ドルの設備を必要とせずに、ロボットが現実世界から学習するためのより強力な基盤を作ることができることを見出しました。これは、ロボットが私たちの日常の雑用を実際にこなせるようになるための大きな一歩です。なぜなら、今や彼らは、人間が経験してきた膨大なオープンライブラリを研究できるようになったからです。
技術サマリー: Open-AoE
問題提起
身体知能(Embodied Intelligence)の研究は、現在、現実世界のインタラクションデータの規模と品質によって制約を受けている。インターネット規模のテキストを活用できる言語モデルとは異なり、ロボット学習には、人間の知覚、手の動き、物体への接触、および時間的に延長されたタスク完了を捉えた物理的なデモンストレーションが必要となる。一人称視点(egocentric)のビデオは、この目的のためのスケーラブルなモダリティを提供するが、既存のリソースには決定的な断片化が存在する:
- ハードウェアの制限: 高品質なデータセットは、専用のヘッドマウントデバイスやAR/VRハードウェアに依存することが多く、一般的なスマートフォンと比較してアクセシビリティが低い。
- データとモデルのギャップ: 大規模な受動的ビデオコレクション(Ego4D、EPIC-KITCHENSなど)には、ロボット学習に必要な構造化されたアノテーション(手のポーズ、カメラの軌跡、アクション境界)が欠けている。
- パイプラインの断片化: 手のポーズを統合したり、人間からロボットへの転移を可能にしたりする最近の取り組みは、データセット固有のものに留まっている。生のスマートフォンによるキャプチャ、体系的な処理、そして直接的なモデル訓練を橋渡しする統一されたインフラストラクチャは存在しない。
コミュニティには、研究者が独自のプライベートな後処理スタックを再構築する必要なく、継続的に収集、体系的に処理し、直接モデルの訓練をサポートできるオープンなデータインフラストラクチャが必要である。
メソドロジー
Open-AoEは、AoEコンシューマースマートフォン収集フレームワークに基づいた、データセットとツールチェーンからなる完全なエンドツーエンドのエコシステムをリリースすることで、このギャップに対処する。
1. データセット
最初のリリースには、自然な環境で収集された約2,000時間のegocentric操作ビデオが含まれている。
- 規模と多様性: データは、400以上のシーンおよび8,000以上のタスクにわたり、400以上のスマートフォンモデルを使用し、500人以上のコントリビューターによって収集された。
- アノテーション: データセットは、以下の構造化された信号を提供する:
- テキスト記述(アトミックなアクション)。
- MANOベースの3D手のポーズ(21関節)。
- カメラの軌跡(6自由度)。
- 時間的に局在化したアトミックアクションのセグメント。
2. データ処理パイプライン
パイプラインは、4つのステージを通じて、生のスマートフォン録画を構造化されたトレーニングサンプルへと変換する:
- ステージ1: エッジ側オンライン処理: 軽量なオンデバイスモデルが、リアルタイムの検出と制御を行う。これらは手の可視性に基づいて録画を制御し、装着・操作の遵守事項(安定性、フレーミングなど)を強制し、照明を調整する。これにより、有効でプライバシーを保護するクリップのみがアップロードされることが保証され、帯域幅とストレージが節約される。
- ステージ2: オフライン品質チェックおよびシーンラベル付け:
- 画像ベースの検出: ルールベースの検出器がビデオの品質(アスペクト比、露出、ジッター)をフィルタリングし、非egocentricなクリップや手が含まれないクリップを除去する。機密情報(顔、個人識別情報)はマスクまたは消去される。
- ビデオのスライシング: ビデオは、固定フレームレートを持つ意味的に独立したセグメント(「Parts」)に分割される。
- 大規模モデルによる検出: ビジョン言語モデル(Qwen3.7-Plus)が、意味的なコンプライアンスチェックを行い、アクションを検証し、階層的なラベル(ドメイン、シーン、タスク、オブジェクト)を割り当てる。
- ステージ3: 再構成およびアノテーション:
- カメラの軌跡: 激しい手振れに対処するため、ハンドヘルドキャプチャ用に再チューニングされたDROID-Wを使用して推定される。
- 手の再構成: 2本の手の検出器とHaWoRを使用し、時間的一貫性を確保するためにSLAMとグローバル・バンドル調整によって最適化された、メトリックスケールの3D MANOメッシュを復元する。
- アトミックアクション: ビデオは英語のラベルが付与されたアトミッククリップに分割され、ヒューマン・イン・ザ・ループによるレビューによって検証される。
- ステージ4: 品質検査およびデリバリー: 3段階の検査ゲート(完全性、正確性、一貫性)により、再構成の妥当性、逆運動学(IK)の失敗率、および軌跡の滑らかさに基づいてデータをフィルタリングする。最終的なデリバリーの前に、エッジケースを除去するための人間による検査ステップが行われる。
3. ツールチェーン
Open-AoEは、コーパスを特定の学習アセットに変換するためのダウンストリーム・ツールチェーンを提供する:
- AoE-Visualization: MANOメッシュ、スケルトン、および軌跡をビデオ上にオーバーレイして、エラー(例:SLAMのドリフト、再投影エラー)を診断するための同期された検査ツール。
- AoE-Reconstruct-Retarget: エゴセントリックな観察を以下に変換する:
- 4D Hand-Object Assets: 時間的に変化するジオメトリおよびインタラクションアセット。
- ロボット実行可能な軌跡: IKベースおよび物理ベースの手法を用いた、クロスエンボディメント・リターゲティング(例:Unitree G1、Galbot、Sharpaへの適用)。
- ロボット化されたビデオ: 人間の腕をインペイントし、シミュレーションされたロボットをオーバーレイして視覚的ドメイン転移を実現する。
- AoE-Training-Ready: 同期された信号を、以下の3つのパラダイムに対するモデル固有のアクション表現にマッピングする:
- VLAポリシー: 密なMANO状態または手首・指先のターゲット。
- World Action Models (WAMs): アクション条件付きビデオ予測のための、手+カメラのダイナミクス。
- World Models: 潜在的なアクション発見および制御可能な生成。
主な結果と分析
本論文は、4つの次元においてOpen-AoEをOpenEgo、EgoDex、EgoXtremeと比較した分析結果を提示している:
- 視覚的多様性: CLIP埋め込みを使用すると、Open-AoEは比較対象のデータセットの中で最高の有効ランク(Effective Rank: 97.4)、参加比率(Participation Ratio: 40.5)、および**kNNドメイン混合(kNN Domain Mixing: 0.078)**を達成した。これは、Open-AoEがより多くの活動的な特徴方向をカバーしており、広範なデバイスとシーンのカバー範囲に起因する、多様な視覚ドメインへの強いローカルな結合性を維持していることを示している。
- 意味的な広がりと時間的な完全性:
- Open-AoEは32,407個の異なる自然言語アクション記述を提供し、ビデオタイムラインの99.99%の時間的カバレッジを達成している。
- 対照的に、OpenEgoはタイムラインの50.1%しかカバーしておらず、EgoDexははるかに小さなカテゴリ語彙(111クラス)に依存している。
- Open-AoEは、オープンボキャブラリーの広範さを提供しながら、高いアノテーション密度(13.97セグメント/分)を維持している。
- 画像・アノテーションの一貫性: Idefics2を介した評価において、Open-AoEはシーケンス・マクロ一貫性スコア4.58/5を達成し、OpenEgo (3.03)、EgoDex (2.92)、EgoXtreme (2.02)を大幅に上回った。Open-AoEのシーケンスの85.4%がスコア4以上であり、視覚的内容とアノテーションの強力な整合性を示している。
- トレーニングサンプル収量: Open-AoEは、1時間あたり1,760個の候補履歴・未来ウィンドウ(理論上の上限の97.8%)を生成しており、優れた時間的連続性を実証している。これは、5つの主要な監督モダリティ(アクション、バウンディングボックス、信頼度、手のポーズ、カメラのポーズ)すべてがほぼ普遍的なカバレッジと共に利用可能である唯一の評価対象データセットである。
意義と主張
本論文は、Open-AoEが単なるビデオコレクションではなく、再利用可能な**「キャプチャ・プロセス・再構成・訓練」のデータ生産ループ**であることを主張している。その意義は以下の点にある:
- 障壁の低下: コンシューマースマホを活用し、完全なパイプラインを提供することで、データの提供およびそれを利用した訓練の両方におけるコストと複雑さを軽減する。
- 統一されたインフラストラクチャ: 生のデータとモデル訓練の間のギャップを埋め、研究者がカスタムの処理スタックを構築する必要なく、VLA、WAM、およびWorld Model学習のための標準化されたインターフェースを提供する。
- 機能としての多様性: カメラドメイン(400以上のモデル)およびシーンの自然なバリエーションを活用することで、視覚的転移およびクロスドメイン操作学習の堅牢性を向上させる。
- オープンなエコシステム: 著者らは、Open-AoEを、研究者、ロボット開発者、およびデータコントリビューターからの貢献を通じて進化することを意図したコミュニティ指向のインフラストラクチャとして位置づけており、エゴセントリックなデータを身体知能のための「最も障壁の低い」基盤にすることを目指している。
毎週最高の computer science 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録