GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation
GE-Act 2.0 est un nouveau modèle d'action-monde entraîné à partir de zéro sur des données de manipulation qui intègre un auto-encodeur orienté contrôle, un planificateur visuel à étape unique et un modèle de dynamique inverse avec une optimisation sélective alignée sur les connaissances, atteignant un succès zero-shot significatif à travers diverses tâches et incarnations grâce à une mise à l'échelle étendue et un transfert inter-incarnations.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots ont longtemps été les maîtres des usines, répétant le même mouvement précis des milliers de fois sans erreur. Mais placez-les dans une cuisine, un salon ou un atelier encombré, et ils se figent souvent. Le défi n'est pas seulement de déplacer une main ; c'est de comprendre comment le monde change lorsque cette main touche quelque chose. Pour naviguer dans cette complexité, une nouvelle génération d'intelligence artificielle apprend à imaginer l'avenir. Au lieu de simplement réagir à ce qu'elle voit à l'instant présent, ces systèmes tentent de prédire ce qui se passera ensuite si une action spécifique est entreprise. Cette approche, connue sous le nom de modèle monde-action, permet à un robot de simuler une séquence d'événements dans son esprit avant de bouger le moindre muscle, vérifiant si le résultat correspond à son objectif. Pendant des années, les chercheurs ont tenté de construire ces systèmes en utilisant des générateurs de vidéos existants — des programmes entraînés pour créer de faux films — et en les forçant à comprendre les mouvements robotiques. Cependant, cette méthode laisse souvent le robot avec une compréhension vague de la physique, car le générateur de vidéo n'a jamais été véritablement conçu pour contrôler un corps physique.
Une équipe d'AgiBot a maintenant introduit une approche différente, qui construit l'imagination du robot à partir de zéro en utilisant uniquement des données d'interaction du monde réel. Ils ont créé un système appelé GE-Act 2.0, qui apprend à prédire l'avenir et à décider d'actions simultanément, mais avec une nuance cruciale : chaque partie du système est entraînée de toutes pièces sur des données collectées à partir de robots et d'humains manipulant des objets. Les chercheurs ne se sont pas appuyés sur des modèles vidéo pré-établis. Au lieu de cela, ils ont enseigné au système un langage compressé du mouvement, une façon de voir le monde qui élimine les détails inutiles pour se concentrer sur ce qui importe pour le contrôle. Cela a permis au robot d'apprendre à partir d'une bibliothèque vaste et variée de données, incluant des heures de démonstrations réussies, de tentatives ratées, et même des vidéos d'humains travaillant sans aucune instruction enregistrée. En combinant ces différents types d'apprentissage, le système a appris à généraliser, ce qui signifie qu'il peut appliquer ce qu'il a appris dans une situation à une toute nouvelle situation qu'il n'avait jamais vue auparavant.
Le cœur de cette réussite réside dans la manière dont les chercheurs ont géré la réalité désordonnée du monde physique. Lorsqu'un robot tente d'apprendre, il est souvent confronté à un problème déroutant : la même instruction peut être accomplie de nombreuses manières différentes. Un robot pourrait recevoir l'ordre de « ramasser la tasse rouge », et il pourrait s'en approcher par la gauche, par la droite, ou la saisir par l'anse ou par le bord. Si les données d'entraînement ne montrent qu'une seule méthode, mais que l'imagination du robot en prédit une autre, les deux parties du système peuvent se désynchroniser. Les chercheurs ont identifié ce décalage comme un « écart de validité », où la prédiction du futur par le robot ne s'aligne pas avec l'action qu'il est censé effectuer. Pour y remédier, ils ont développé un processus de sélection qui agit comme un filtre. Avant qu'un robot n'apprenne d'un futur prédit, il vérifie si ce futur est compatible avec l'action qu'il doit réaliser. Il génère plusieurs futurs possibles, les teste par rapport à l'action requise, et n'apprend que de ceux qui font sens ensemble. Cela garantit que le robot ne brouille pas sa compréhension de la manière dont différentes actions mènent à différents résultats.
Les résultats de cet entraînement sont frappants, particulièrement lorsqu'ils sont testés sur des tâches que le robot n'a jamais pratiquées. Les chercheurs ont évalué le système sur cent tâches de manipulation distinctes, allant de l'empilement de blocs et du versement de liquides au pliage de serviettes et à l'insertion de prises. Ces tests ont été menés sur de vrais robots dans des environnements présentant des éclairages, des arrière-plans et des agencements d'objets différents de ceux utilisés pendant l'entraînement. Lorsque le système a été entraîné sur un petit ensemble de données de 300 heures, il a réussi seulement 17,1 % des tâches sur un modèle de robot. Cependant, à mesure que les chercheurs augmentaient l'échelle des données d'entraînement pour atteindre 30 000 heures, le taux de réussite a grimpé régulièrement jusqu'à 44,1 %. Cette amélioration s'est produite sans aucun ajustement spécifique pour les tâches individuelles ; le robot a simplement appliqué les compétences générales qu'il avait acquises aux nouveaux défis. Plus surprenant encore, le système a montré de fortes capacités sur un second modèle de robot différent, qui représentait moins de 2 % des données d'entraînement, suggérant que les compétences apprises à partir du plus grand ensemble de données se sont transférées efficacement à une nouvelle forme physique.
La capacité du système à suivre des instructions a également été testée dans des conditions difficiles. Dans de nombreux essais, le robot a été invité à effectuer une action qui entrait en conflit avec ce qu'il aurait pu attendre en se basant sur la scène ou sur une habitude précédente. Par exemple, si un robot était au milieu d'un mouvement, il pouvait tout de même s'arrêter et suivre une nouvelle commande explicite pour changer de trajectoire. Dans plus de 90 % de ces essais, le robot a correctement identifié l'objet, la couleur, la forme ou la position mentionnés dans l'instruction, même lorsque ces détails étaient subtils ou que le contexte était confus. Les chercheurs ont trouvé un lien étroit entre la variété des compétences apprises par le robot et sa capacité à réussir de nouvelles tâches. Plus les données d'entraînement étaient diverses, plus le robot était susceptible de gérer une situation inédite. Cela suggère que la voie vers des robots plus capables ne réside pas seulement dans de meilleurs algorithmes, mais dans le volume et la variété pure des données qu'ils consomment.
Ce travail marque une étape importante vers des robots capables d'apprendre à partir des mêmes données riches et non structurées que celles que les humains utilisent pour comprendre le monde. En construisant un système qui prédit l'avenir et planifie les actions de manière unifiée, et en lui apprenant à sélectionner les bonnes prédictions parmi de nombreuses possibilités, les chercheurs ont créé un modèle robuste et adaptable. Les conclusions suggèrent qu'avec suffisamment d'expérience diversifiée, un robot peut développer une compréhension profonde et intuitive du comportement des objets et de la manière d'interagir avec eux, passant d'une programmation rigide vers une forme d'intelligence plus flexible. Le succès de cette approche sur du matériel réel, sans nécessiter de réentraînement pour chaque nouvelle tâche, laisse entrevoir un avenir où les robots pourront être déployés dans des environnements dynamiques et imprévisibles, et apprendre à y prospérer.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.