WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
Le document présente WholeBodyWAM, un modèle monde-action humanoïde qui exploite un corpus de mouvements hétérogène à grande échelle (UniMotion-4K) pour pré-entraîner un a priori de mouvement transférable, ce qui améliore considérablement l'efficacité des données et les performances de manipulation en aval lorsqu'il est intégré avec des experts de vidéo et d'action via une attention de type mélange de transformateurs asymétrique.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Pour fabriquer un robot qui se déplace comme un humain, les ingénieurs sont confrontés à un problème fondamental : enseigner à une machine comment coordonner l'ensemble de son corps est incroyablement difficile. Un humain ne pense pas à bouger chaque muscle individuellement lorsqu'il tend la main pour saisir une tasse ou traverse une pièce ; le corps se déplace comme une unité unique et fluide. Pour les robots, cependant, chaque articulation et chaque membre doit être commandé séparément, et collecter les millions d'heures de données d'entraînement nécessaires pour enseigner cette compétence à un robot spécifique est lent, coûteux et souvent impossible. Bien que les scientifiques aient construit des modèles puissants capables de comprendre le langage et de voir le monde, ces systèmes ont souvent du mal à prédire comment le propre corps d'un robot va bouger dans le futur, se reposant plutôt sur la réaction à ce qui se passe en ce moment même. Cette limitation rend difficile l'exécution par les robots de tâches complexes qui nécessitent de planifier à l'avance, comme porter une boîte lourde tout en naviguant sur un terrain accidenté ou s'agenouiller pour ramasser un objet sans perdre l'équilibre.
Une équipe de chercheurs a abordé ce défi en apprenant à un robot à tirer parti de la vaste bibliothèque gratuite de mouvements humains disponible sur Internet, plutôt que de compter uniquement sur des démonstrations coûteuses provenant du robot lui-même. Ils ont créé un nouveau système appelé WHOLEBODYWAM, qui agit comme un moteur prédictif pour le corps du robot. Au lieu de simplement regarder une vidéo et de deviner la suite, ce système apprend la physique sous-jacente de la manière dont les corps se déplacent au fil du temps. Il a été entraîné sur une collection massive de données de mouvement appelée UniMotion-4K, qui comprend plus de 4 100 heures de mouvements enregistrés à partir de vidéos humaines, de jeux de données spécialisés de capture de mouvement 3D et d'autres robots humanoïdes. En convertissant toutes ces sources différentes en un langage de mouvement unique et partagé, le système a appris une « intuition » générale de la manière dont un corps doit passer d'une pose à une autre. Cette intuition a ensuite été transférée à un véritable robot humanoïde, permettant à celui-ci d'anticiper ses propres mouvements futurs et d'exécuter des tâches corporelles complexes avec une compétence et une efficacité bien supérieures aux méthodes précédentes.
Le cœur de ce travail réside dans un processus d'entraînement en deux étapes qui sépare l'apprentissage des règles générales du mouvement de l'apprentissage de leur application à une machine spécifique. Dans la première étape, le système a étudié le vaste ensemble de données de mouvements humains et robotiques sans jamais voir un seul exemple des commandes réelles du robot cible. Il a appris à prédire ce qu'un corps ferait ensuite en se basant sur une simple description textuelle d'une tâche, telle que « ramasser le jouet » ou « s'agenouiller ». Cela a créé un fondement puissant, un a priori prédictif qui comprenait la danse coordonnée des membres et l'équilibre requis pour un mouvement de type humain. Dans la seconde étape, ces connaissances pré-entraînées ont été combinées avec un module de compréhension vidéo et un générateur d'actions. Le système a ensuite reçu un petit nombre de démonstrations du robot spécifique, le TianGong 3.0, pour apprendre à traduire sa compréhension générale du mouvement en commandes motrices spécifiques que les articulations de ce robot doivent exécuter. Crucialement, le système ne se contente pas de réagir à la scène actuelle ; il utilise sa connaissance apprise pour imaginer l'état futur de son propre corps, utilisant cette prédiction pour guider ses actions en temps réel.
Lors des tests sur six tâches difficiles du monde réel, les résultats ont été frappants. Le robot a dû accomplir des actions telles que ramasser des jouets, charger du linge dans une machine à laver, transférer un oreiller sur un canapé et transporter une boîte vers une table. Ces tâches exigeaient que le robot se plie, marche, s'agenouille et manipule des objets, tout cela simultanément. Le nouveau système a surpassé les meilleures méthodes existantes, atteignant un taux de réussite nettement plus élevé sur toutes les tâches. Par exemple, dans la tâche de transfert de boîte, où le robot devait soulever une boîte, marcher vers une table latérale et la poser, le nouveau système a réussi 73,3 % du temps, contre des taux beaucoup plus bas pour les autres approches. Les chercheurs ont constaté que plus ils utilisaient de données de mouvement pour entraîner l'« expert en mouvement » initial, plus le robot performait, suggérant que le système a réellement appris une compétence évolutive plutôt que de simplement mémoriser des exemples spécifiques. Plus important encore, le système s'est avéré extrêmement efficace en termes de données ; lorsque les chercheurs ont réduit de moitié la quantité de démonstrations spécifiques au robot disponibles pour l'entraînement, le robot ayant été pré-entraîné sur le vaste ensemble de données de mouvement performait toujours mieux que d'autres robots entraînés sur l'ensemble complet des démonstrations.
Cette approche a également démontré une capacité remarquable à gérer les changements dans l'environnement. Lorsque les chercheurs ont légèrement déplacé le panier cible ou modifié la couleur et la forme des jouets que le robot devait ramasser, le système s'est adapté rapidement, maintenant une performance élevée là où les autres modèles peinaient. Le système a réussi cela sans avoir besoin de générer une vidéo du futur, ce qui serait coûteux en calcul et lent. Au lieu de cela, il a prédit directement les positions futures de ses propres articulations, ce qui lui a permis de prendre des décisions en environ 363 millisecondes, une vitesse suffisante pour un contrôle en temps réel. L'étude confirme que, bien qu'un robot ne puisse pas simplement copier les mouvements humains parce que son corps est différent, il peut apprendre des vasts motifs de mouvement humain pour développer une compréhension prédictive et robuste de la manière de déplacer son propre corps. En tirant parti de l'abondance de données de mouvement humain disponibles dans le monde, cette méthode ouvre une nouvelle voie vers la création de robots humanoïdes qui sont non seulement capables de tâches complexes, mais qui peuvent également les apprendre avec beaucoup moins de démonstrations que ce qui était pensé auparavant.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.