← Derniers articles
💻 computer science

AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization

Le document présente AnyWorld, un cadre de modélisation du monde factorisé qui synthétise des expériences robotiques diverses et inter-incarnations à partir de vidéos égocentrées humaines uniques en découplant les facteurs d'action, de caméra et d'incarnation, permettant ainsi une génération de données contrôlable qui améliore significativement les politiques de manipulation sur des robots humanoïdes, tant simulés que réels.

Auteurs originaux : Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Publié 2026-09-02
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Cheng Chen, Jerry Bai, Jiacheng Wei, Boyu Chen, Xiaoji Zheng, Fan Wu, Minghao Yang, Tianrun Chen, Ruibo Li, Xiaoyu Yue, Xiaoyang Guo, Yixiao Ge, Guosheng Lin, Fayao Liu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les robots apprennent à faire plus que simplement se déplacer en ligne droite ; ils apprennent à manipuler le monde qui les entoure, à ramasser des objets, à ouvrir des portes et à assembler des pièces. Pour acquérir ces compétences, un robot a besoin d'expérience. Il doit voir des milliers d'exemples de la façon dont une main tend la main vers une tasse, dont un préhenseur presse une éponge et dont un outil glisse sur une table. Pendant longtemps, la seule façon d'obtenir cette expérience était de faire effectuer la tâche par un robot, encore et encore. C'est lent, coûteux et limité par le nombre de robots qu'un laboratoire peut s'offrir et par le nombre d'heures qu'ils peuvent fonctionner sans se casser.

Une alternative prometteuse a émergé d'une source inattendue : les vidéos humaines. Chaque jour, les gens s'enregistrent en train de cuisiner, de nettoyer et de construire des choses. Ces vidéos sont riches en interactions physiques que les robots pourraient apprendre. Cependant, il y a un problème majeur. Une vidéo d'un humain qui cuisine montre une main humaine, un corps humain et un point de vue humain. Un robot n'a pas un corps humain, et il ne voit pas le monde depuis une tête humaine. Si un robot essaie de copier directement une vidéo humaine, il pourrait échouer parce que le bras de l'humain est plus long, que la caméra du robot est située à un endroit différent ou que le préhenseur du robot fonctionne différemment. Le défi pour les scientifiques est de comprendre comment prendre l'« histoire » utile de ce qui se passe dans une vidéo humaine et la raconter à nouveau d'une manière qui fasse sens pour un robot.

Une équipe de chercheurs a développé un nouveau système appelé AnyWorld pour résoudre ce problème. Au lieu d'essayer de copier exactement une vidéo humaine, le système décompose la vidéo en trois ingrédients distincts : l'action en cours, la façon dont la caméra bouge et le corps et la scène qui font le travail. Considérez l'action comme le script de ce qui se passe, le mouvement de la caméra comme la direction de la prise de vue, et le corps et la scène comme les acteurs et le décor. En séparant ces éléments, les chercheurs peuvent prendre une seule vidéo d'un humain effectuant une tâche et recombiner ces ingrédients pour créer une toute nouvelle vidéo. Dans cette nouvelle vidéo, l'« acteur » est un robot, le « décor » est l'environnement d'un robot, et la « caméra » est l'œil d'un robot, mais le « script » de l'action reste le même.

Les chercheurs ont entraîné leur système en utilisant une collection massive de vidéos humaines où des personnes interagissaient avec des objets. Ils ont appris au modèle à comprendre la différence entre le mouvement de la tâche et le corps spécifique qui l'exécute. Une fois que le modèle a appris cela, ils l'ont testé en lui fournissant une vidéo humaine et en lui demandant de générer une version de cette même tâche réalisée par un robot. Ils n'ont eu besoin d'aucune vidéo montrant un humain et un robot effectuant la même tâche côte à côte. Le système a simplement pris les mouvements de l'humain et le chemin de la caméra, puis a remplacé l'acteur par un corps de robot et une scène de robot. Le résultat était une vidéo qui ressemblait à un robot effectuant la tâche, complète avec la perspective et les contraintes physiques de cette machine spécifique.

L'équipe a testé cette capacité à changer le corps, l'angle de la caméra et la scène. Ils ont montré que le système pouvait prendre une vidéo humaine et générer une version où un robot nommé RoboCasa GR1 effectuait la tâche, ainsi qu'une autre version où un robot différent nommé IRON l'effectuait. Ils ont également montré qu'ils pouvaient garder le robot et la tâche identiques, tout en changeant l'angle de la caméra, créant ainsi une vue depuis une perspective différente. Crucialement, le système a préservé la logique de l'interaction. Si un humain dans la vidéo originale ramassait une tasse et la déplaçait vers une étagère, la vidéo du robot générée montrait le robot effectuant exactement la même séquence de mouvements, simplement adaptée à sa propre forme corporelle et à sa position de caméra.

Pour prouver que ces vidéos générées étaient réellement utiles, les chercheurs les ont utilisées pour entraîner de vrais robots. Ils ont pris un système d'apprentissage de robot standard et lui ont donné un entraînement supplémentaire en utilisant les vidéos créées par AnyWorld. Ils ont testé cela sur une simulation d'un bras robotique et sur un véritable robot humanoïde physique. Dans la simulation, le taux de réussite du robot pour ramasser et placer des objets s'est considérablement amélioré après l'entraînement sur les données générées. Sur le vrai robot, l'amélioration était encore plus spectaculaire. Un robot qui n'était capable de saisir une banane avec succès que dans 20 % des tentatives est passé à un taux de réussite de 55 % après avoir été entraîné sur les vidéos de l'humain au robot. Cela a montré que le système ne faisait pas seulement de jolies images ; il créait des données d'entraînement valides qui aidaient le robot à mieux apprendre.

Les chercheurs ont également cherché à comprendre exactement pourquoi cela fonctionnait. Ils voulaient savoir si le simple fait de dire au robot quelle action entreprendre était suffisant, ou si la vision de la scène visuelle était également nécessaire. Ils ont mené un test où ils ont donné au robot les commandes d'action correctes mais ont conservé les données visuelles d'entraînement provenant des vidéos originales non modifiées du robot. Cette approche a échoué à enseigner au robot comment suivre des instructions spécifiques, telles que choisir la banane de gauche plutôt que celle de droite. Cependant, lorsqu'ils ont utilisé le système complet pour générer à la fois la nouvelle scène visuelle et l'action correcte, le robot a appris à suivre les instructions de manière fiable. Cela a prouvé que la recomposition visuelle était essentielle. Le robot avait besoin de voir le monde de sa propre perspective pour comprendre comment appliquer l'action.

L'étude suggère que cette méthode de décomposition des interactions en facteurs distincts permet à une seule expérience humaine d'être réutilisée de nombreuses fois. Une vidéo humaine qui était autrefois limitée à un corps humain et une caméra humaine peut devenir une source de données d'entraînement pour de nombreux types de robots différents, dans de nombreux environnements différents. Les chercheurs ont noté que bien que le système soit puissant, il présente des limites. Il ne peut pas encore capturer la sensation du toucher ou la force exacte nécessaire pour presser un objet mou, car cela nécessite des capteurs physiques que la génération de vidéo ne fournit pas. De plus, le système dépend de la capacité à suivre clairement les mouvements humains ; si la vidéo est trop tremblante ou si la personne est cachée derrière un objet, le système éprouve des difficultés.

Malgré ces limites, ce travail offre une nouvelle voie pour l'apprentissage des robots. Il suggère que la vaste bibliothèque de vidéos humaines sur Internet, qui a été difficile à utiliser pour les robots en raison des différences de corps et de points de vue, peut désormais être exploitée. En utilisant un modèle qui comprend comment séparer l'action de l'acteur, les scientifiques peuvent transformer les expériences humaines en expériences robotiques sans avoir besoin d'enregistrer chaque tâche avec chaque robot. Cela pourrait permettre aux robots d'apprendre des compétences complexes beaucoup plus rapidement, en utilisant l'abondance des données de la vie quotidienne humaine comme fondation pour leurs propres capacités.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →