GigaBrain-0.7: Scaling Embodied Foundation Models to Emergent Capabilities with a Three-System Architecture
Le document présente GigaBrain-0.7, un modèle de fondation incarné qui exploite une nouvelle architecture à trois systèmes et qui est entraîné sur plus de 37 000 heures de données hétérogènes pour atteindre une généralisation zero-shot, une exécution d'instructions et des taux de réussite de tâches supérieurs à travers diverses incarnations robotiques par rapport aux modèles de l'état de l'art précédents.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où un robot peut regarder une table de cuisine encombrée, comprendre une requête vocale telle que « mets la pomme rouge dans le bol », et ensuite déterminer exactement comment bouger son bras pour le faire sans rien renverser. C'est la promesse de l'intelligence artificielle incarnée : des machines qui ne se contentent pas de traiter l'information, mais qui interagissent avec le monde physique. Pendant des années, les chercheurs ont tenté d'enseigner aux robots en leur montrant des milliers de vidéos de mains humaines manipulant des objets, espérant que la machine apprendrait les règles de la physique et de la cause à effet. Cependant, un obstacle majeur est resté présent. Les robots sont construits différemment ; l'un peut avoir deux bras, un autre un simple préhenseur, et un troisième peut rouler sur des roues. Les données collectées à partir d'un type de robot confondent souvent un autre. De plus, le simple fait de regarder une vidéo n'apprend pas à une machine comment prédire ce qui se passera ensuite si elle commet une erreur, ou comment se rétablir lorsqu'une tâche tourne mal. La question était de savoir si nous pouvions construire un cerveau unique et intelligent qui comprenne le langage, voie le monde et contrôle n'importe quel type de corps robotique, tout en apprenant d'un mélange massif de différentes expériences.
Une équipe de chercheurs a maintenant présenté une avancée significative avec un système appelé GigaBrain-0.7. Il ne s'agit pas seulement d'un programme unique, mais d'un système coordonné conçu pour gérer la complexité de l'interaction dans le monde réel. Au lieu d'essayer de forcer un robot à tout apprendre en une seule explosion chaotique, les chercheurs ont organisé le processus d'apprentissage en trois parties distinctes mais connectées qui travaillent ensemble. La première partie agit comme les mains et les réflexes, prenant le contrôle immédiat des moteurs du robot pour exécuter les actions. La deuxième partie agit comme le planificateur et l'observateur, regardant la scène, comprenant l'instruction linguistique et décomposant un grand objectif comme « nettoyer la table » en étapes plus petites et gérables comme « ramasser la tasse » et « la déplacer vers l'évier ». La troisième partie est l'ajout le plus novateur : elle agit comme un prédicteur et un juge. Elle imagine à quoi ressemblera la scène dans quelques secondes si le robot poursuit sa trajectoire actuelle, et elle attribue un score à ce futur pour décider si le robot progresse ou se dirige vers un échec.
Pour entraîner ce système, les chercheurs ne se sont pas appuyés sur une source de données unique. Ils ont rassemblé une bibliothèque massive de plus de 37 000 heures d'expérience. Cette collection comprenait des vidéos de vrais robots travaillant dans des usines et des maisons, des enregistrements de mains humaines manipulant des objets en perspective à la première personne, et des données générées par des simulations informatiques. Ils ont également utilisé l'intelligence artificielle pour créer de nouveaux scénarios d'entraînement, élargissant ainsi efficacement la variété des situations dont le robot pourrait apprendre. En injectant ce mélange diversifié de données dans le système, les chercheurs ont permis au modèle d'apprendre les principes généraux du mouvement et de l'interaction plutôt que de simplement mémoriser des astuces spécifiques pour un robot particulier. Le système a été entraîné pour gérer 16 types différents de corps de robots, des machines à deux bras aux figures humanoïdes, lui apprenant à adapter sa compréhension de « gauche » et « droite » ou « saisir » et « relâcher » en fonction du corps spécifique qu'il contrôlait.
Les résultats de cette approche ont été testés sur de vrais robots, tant dans des contextes industriels que domestiques. Lorsqu'on lui demandait d'accomplir des tâches qu'il n'avait jamais vues auparavant, le système montrait une capacité de généralisation remarquable. Dans un test, un robot a été chargé de plier un vêtement qui avait été jeté en un tas désordonné, une tâche qui nécessite que la machine ajuste constamment sa prise à mesure que le tissu se déforme et change de forme. Sans avoir besoin d'être réentraîné pour ce vêtement spécifique, le système a manipulé l'objet déformable avec succès. Dans un autre scénario, le robot a dû ramasser une cuillère d'une couleur spécifique parmi un groupe d'ustensiles mélangés, démontrant qu'il pouvait comprendre des instructions linguistiques subtiles et les appliquer à de nouveaux objets. Le système a également prouvé sa capacité à gérer de longues séquences d'actions, telles que l'organisation d'un bureau ou le balayage de riz, où le robot devait maintenir un sens de l'objectif global tout en exécutant de nombreux petits mouvements.
Une conclusion clé fut que la capacité du système à prédire l'avenir et à évaluer ses propres progrès faisait une différence tangible dans les taux de réussite. Lorsque les chercheurs ont supprimé la partie prédictive du système, le robot a éprouvé plus de difficultés avec les tâches complexes, se retrouvant souvent bloqué dans des boucles de mouvements répétitifs ou échouant à se rétablir après des erreurs mineures. Avec la composante prédictive active, le robot pouvait anticiper qu'un certain mouvement mènerait à une collision ou à une chute, et il ajustait sa course avant que l'erreur ne se produise. Cette capacité a permis au robot de mener à bien des tâches difficiles, comme emballer un cadeau ou trier des cubes, avec une fiabilité bien plus élevée que les modèles précédents. Les chercheurs ont constaté qu'en augmentant la quantité de données d'entraînement, les performances du robot s'amélioraient de manière constante, suggérant que le système apprenait véritablement de la masse et de la variété de ses expériences.
L'étude a également souligné l'importance de la manière dont les différents types de données sont combinés. Le système a obtenu les meilleurs résultats lorsqu'il apprenait à partir d'un mélange d'essais de robots réels, de démonstrations humaines et d'environnements simulés. Chaque source apportait une leçon différente : les robots réels ont enseigné au système les contraintes physiques de machines spécifiques, les vidéos humaines lui ont montré comment les gens interagissent naturellement avec les objets, et les simulations lui ont permis de pratiquer des scénarios rares ou dangereux en toute sécurité. En mélangeant ces sources, le système a développé une compréhension robuste du fonctionnement du monde qui pouvait être appliquée à différents corps de robots. Les chercheurs ont noté que, bien que le système ne soit pas parfait et éprouve encore des difficultés avec certaines des interactions physiques les plus complexes, il représente un passage de la construction de robots spécialisés pour des tâches uniques vers la création d'une intelligence à usage général capable de s'adapter à de nouveaux défis.
En fin de compte, GigaBrain-0.7 démontre que l'augmentation de l'échelle et de la diversité des données d'entraînement, combinée à une architecture structurée qui sépare la planification, l'action et la prédiction, peut conduire à des robots plus capables et adaptables. Le système ne se contente pas de suivre un script ; il comprend le contexte d'une tâche, anticipe les conséquences de ses actions et apprend de sa propre expérience pour s'améliorer au fil du temps. Bien qu'il reste du travail à faire avant que de tels systèmes ne puissent gérer toutes les situations possibles dans un foyer ou une usine, cette recherche offre une voie claire à suivre. Elle suggère que l'avenir de la robotique ne réside pas seulement dans la construction d'un meilleur matériel, mais dans la création de logiciels plus intelligents et plus flexibles qui peuvent apprendre de la vaste et variée expérience du monde physique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.