← Derniers articles
💻 computer science

Open-AoE: An Open Egocentric Manipulation Dataset and Toolchain for Embodied Learning

Open-AoE est un ensemble de données et une chaîne d'outils ouverts, pilotés par la communauté, qui comblent le fossé entre la capture de vidéos égocentrées à grande échelle sur smartphone et l'entraînement de l'IA incarnée en fournissant 2 000 heures de données de manipulation structurées ainsi qu'un pipeline complet pour le traitement, le réadressage et l'entraînement de divers modèles d'apprentissage robotique.

Auteurs originaux : Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo W
Publié 2026-07-21
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Zishuo Li, Bowen Yang, Changtao Miao, Kai Zhu, Hao Chen, Qingze Guan, Zhengxing Wu, Wanke Zhan, Yang Sun, Zhiyi Huang, Zitong Shan, Zhenchao Jin, Jiadong Hong, Taowen Wang, Yushi Feng, You Liu, Yibo Wang, Yifan Yang, Zhaowen Zhou, Man Luo, Hao Cheng, Bo Zhang, Jianshu Li, Jiansheng Cai, Guocai Yao, Jize Zhang, Chenhao Lin, Renjing Xu, Lequan Yu, Chao Shen, Chunhua Shen, Zhe Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez d'apprendre à un robot comment faire un sandwich, réparer un robinet qui fuit ou plier une chemise. Vous ne pouvez pas simplement lui fournir une bibliothèque de manuels scolaires ; il doit voir et ressentir comment les humains font ces choses. C'est le monde de l'intelligence incarnée, où les ordinateurs apprennent en interagissant avec le monde physique, tout comme nous le faisons. Mais il y a un piège : les robots voient le monde différemment de nous. Si vous enregistrez une vidéo à partir d'une caméra posée sur une étagère (une vue en « troisième personne »), le robot voit toute la pièce mais manque les minuscules mouvements des doigts. Si vous enregistrez depuis les propres yeux du robot (vue « égocentrée »), il obtient la bonne perspective, mais obtenir suffisamment de données de haute qualité pour l'instruire est incroyablement difficile et coûteux. Généralement, vous avez besoin de caméras spéciales et onéreuses fixées sur la tête des gens, ou vous devez étiqueter manuellement chaque seconde de vidéo pour dire à l'ordinateur ce qui se passe. Sans une bibliothèque massive et facile d'utilisation de ces vidéos « à hauteur d'œil humain », les robots ont du mal à apprendre les subtilités de la vie quotidienne.

C'est là qu'intervient un nouveau projet appelé Open-AoE, agissant comme une boîte à outils open-source massive pour enseigner aux robots. Les chercheurs derrière ce projet ont réalisé que tout le monde possède déjà la caméra parfaite dans sa poche : un smartphone. Ils ont donc construit un système qui transforme des milliers de personnes ordinaires en collecteurs de données. Ils ont créé une application qui enregistre des vidéos de gens accomplissant des tâches quotidiennes — comme verser du café ou taper sur un clavier — en utilisant leurs propres téléphones. Mais ils ne se sont pas arrêtés à l'enregistrement ; ils ont construit une immense usine automatisée dans le cloud qui prend ces vidéos brutes et désordonnées et les transforme en leçons super organisées et prêtes pour les robots.

L'équipe a rassemblé un nombre stupéfiant de 2 000 heures de ces vidéos, collectées par plus de 500 personnes différentes utilisant plus de 400 types de smartphones différents. C'est beaucoup de temps ! Les vidéos couvrent plus de 400 scènes différentes (des cuisines aux bureaux) et plus de 8 000 tâches différentes. Ce qui rend cela spécial, ce n'est pas seulement le volume, mais la « magie » que le système ajoute aux images. En utilisant une IA avancée, le système détermine automatiquement exactement où les mains bougent (jusqu'aux 21 articulations des doigts), où la caméra se déplace, et découpe la vidéo en petits segments d'action significatifs. Il rédige même des descriptions textuelles de ce qui se passe.

Pensez-y de cette façon : avant, si vous vouliez enseigner à un robot, vous deviez engager une équipe de tournage, acheter du matériel coûteux et passer des années à monter les images. Open-AoE, c'est comme donner un smartphone à tout le monde, dire « Filmez votre journée », puis avoir un éditeur robotique magique qui transforme instantanément ces films en un manuel parfait pour qu'un robot puisse apprendre de ces images. L'article montre que cette approche fonctionne, fournissant un ensemble de données riche et diversifié qui aide les robots à comprendre non seulement quoi faire, mais aussi comment bouger leurs mains et leurs yeux pour le faire.

Les chercheurs ont également construit un ensemble d'outils (une « chaîne d'outils ») qui permet aux scientifiques de prendre ces données et de faire des choses géniales avec. Ils peuvent visualiser le mouvement 3D des mains, « retranscrire » (retargeting) les mouvements humains pour les adapter à différents corps de robots (comme transformer un bras humain en bras de robot), et entraîner différents types de modèles d'IA. Ils ont découvert qu'en utilisant ces données diverses basées sur les smartphones, ils peuvent créer une base bien plus solide pour que les robots apprennent du monde réel, sans avoir besoin d'un équipement valant des millions de dollars. C'est un grand pas vers la création de robots capables de nous aider réellement dans nos tâches quotidiennes, car ils disposent désormais d'une immense bibliothèque ouverte d'expériences humaines à étudier.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →