← 最新の論文
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoEは、2,000時間の構造化された操作データとともに、様々なロボット学習モデルの処理、リターゲティング、および学習のための包括的なパイプラインを提供することで、スマートフォンベースのスケーラブルな一人称視点ビデオキャプチャとエンボディドAIトレーニングの間の溝を埋める、オープンでコミュニティ主導のデータセットおよびツールチェーンです。

原著者: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットにサンドイッチの作り方や、蛇口の修理の仕方、あるいはシャツの畳み方を教えることを想像してみてください。ただ教科書のライブラリを読み込ませるだけでは不十分です。ロボットには、私たち人間が行うように、実際に物事を行う様子を「見て」、そして「感じる」必要があるのです。これが「身体化された知能(embodied intelligence)」の世界です。ここでは、コンピュータは私たちと同じように、物理的な世界と相互作用することによって学習します。しかし、そこには落とし穴があります。ロボットは私たちとは異なる見方をするのです。もし棚に設置されたカメラからビデオを録画した場合(「三人称視点」)、ロボットは部屋全体は見えますが、指先の細かな動きを見逃してしまいます。もしロボット自身の目から録画した場合(「一人称視点/エゴセントリック視点」)、正しい視点を得られますが、学習に十分な高品質のデータを入手することは非常に困難で、コストもかかります。通常、人の頭に高価な専用カメラを取り付けるか、あるいは何が起きているのかをコンピュータに伝えるために、ビデオのあらゆる一秒に対して手動でラベル付けを行う必要があります。こうした「人間の目」によるビデオの、大規模で使いやすいライブラリがなければ、ロボットは日常生活の微妙なコツを学ぶことができません。

ここで、「Open-AoE」と呼ばれる新しいプロジェクトが登場します。これは、ロボットを教えるための巨大なオープンソースのツールキットのような役割を果たします。研究者たちは、誰もがすでにポケットの中に完璧なカメラを持っていることに気づきました。それはスマートフォンです。そこで彼らは、一般の人々をデータ収集者に変えるシステムを構築しました。彼らは、人々が自分のスマートフォンを使って、コーヒーを注いだりキーボードをタイピングしたりといった日常的なタスクを行っている様子を録画するアプリを作成しました。しかし、彼らは単に録画するだけで終わったわけではありません。録画された生の、整理されていないビデオを取り込み、それを高度に整理された、ロボットが学習可能なレッスンへと変える、クラウド上の巨大な自動化工場を構築したのです。

チームは、これらのビデオを合計2,000時間も集めました。これは、500人以上の異なる人々によって、400種類以上の異なるスマートフォンを使用して収集されたものです。これは膨大な時間です!ビデオは、キッチンからオフィスまで400以上の異なるシーンをカバーしており、8,000以上の異なるタスクが含まれています。このプロジェクトが特別なのは、その量だけでなく、システムが映像に加える「魔法」にあります。高度なAIを用いることで、システムは手がどこで動いているか(指の21個の関節レベルまで)、カメラがどのように動いているかを自動的に特定し、ビデオを意味のある小さなアクションの断片へと分解します。さらに、何が起きているのかについてのテキストによる説明文さえも作成します。

このように考えてみてください。以前は、ロボットに教えたいと思ったら、撮影クルーを雇い、高価な機材を購入し、何年もかけて映像を編集しなければなりませんでした。Open-AoEは、いわば全員にスマートフォンを渡し、「あなたの日常を撮影してください」と言い、その後、魔法のようなロボットエディターが、それらの映画をロボットが学習するための完璧な教科書へと瞬時に作り変えてくれるようなものです。論文は、このアプローチが有効であることを示しており、ロボットが単に「何をすべきか」だけでなく、「どのように手や目を動かしてそれを行うべきか」を理解するための、豊かで多様なデータセットを提供しています。

また、研究者たちは、科学者がこのデータを使って面白いことができる一連のツール(「ツールチェーン」)も構築しました。これにより、手の3Dの動きを可視化したり、人間の動きを異なるロボットの体に「リターゲティング(適合)」させたり(例えば、人間の腕をロボットの腕に変えるなど)、異なる種類のAIモデルを訓練したりすることができます。彼らは、この多様なスマートフォンベースのデータを使用することで、100万ドルの設備を必要とせずに、ロボットが現実世界から学習するためのより強力な基盤を作ることができることを見出しました。これは、ロボットが私たちの日常の雑用を実際にこなせるようになるための大きな一歩です。なぜなら、今や彼らは、人間が経験してきた膨大なオープンライブラリを研究できるようになったからです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →