Beyond Data Scaling: Representation-Centric Continued Pre-training for Vision-Language-Action Models
L'article introduit VLAct, une approche de pré-entraînement continu centrée sur la représentation pour les modèles Vision-Langage-Action qui exploite des données multi-incarnations hétérogènes afin d'atteindre une transférabilité et des performances supérieures à travers diverses tâches et robots inédits, même avec des budgets de calcul modestes et des données en aval limitées.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots ont longtemps lutté pour apprendre de l'expérience comme le font les humains. Alors qu'un enfant peut regarder un parent verser un verre d'eau et comprendre le mouvement, un robot nécessite généralement des milliers d'instructions spécifiques et codées à la main pour accomplir la même tâche. Pendant des années, les scientifiques ont tenté de résoudre ce problème en nourrissant les robots avec des quantités massives de données, espérant que le simple volume leur apprendrait comment bouger. Cette approche repose sur des modèles Vision-Langage-Action, qui sont des systèmes informatiques capables de voir une image, de comprendre une phrase et de décider d'un mouvement physique. La croyance prédominante était que si l'on collectait simplement assez de mouvements de robots, le système deviendrait naturellement assez intelligent pour gérer n'importe quelle situation. Cependant, la collecte de données robotiques est extrêmement difficile et coûteuse ; contrairement aux photos ou au texte sur Internet, les mouvements des robots doivent être enregistrés dans le monde physique réel, souvent par des humains guidant les machines. Cette rareté signifie que même les plus grands ensembles de données robotiques sont minuscules et clairsemés par rapport à l'immensité du monde physique.
Une équipe de chercheurs a maintenant proposé une autre voie à suivre, suggérant que la qualité de ce qu'un robot apprend est plus importante que la quantité de données qu'il voit. Ils soutiennent qu'au lieu de simplement mémoriser des mouvements spécifiques, le cerveau d'un robot doit apprendre une compréhension profonde et flexible de la manière dont les objets et les actions sont liés les uns aux autres. En se concentant sur cette « représentation » — la carte interne que le robot construit du monde — ils ont créé une nouvelle méthode d'entraînement qui permet aux robots de mieux généraliser. Leur travail démontre qu'avec une manière plus intelligente d'enseigner le cerveau central du robot, un système peut apprendre à effectuer des tâches complexes sur des robots qu'il n'a jamais vus auparavant, en utilisant seulement une fraction des données précédemment jugées nécessaires.
Les chercheurs, travaillant sous le nom de VLAct, sont partis d'une question fondamentale : pourquoi les robots échouent-ils à généraliser ? Lorsqu'un robot est entraîné sur un ensemble spécifique de mouvements, il devient souvent trop spécialisé, apprenant à imiter les motifs exacts qu'il a vus plutôt qu'à comprendre la physique sous-jacente de la tâche. Pour étudier cela, l'équipe a examiné comment différentes façons d'enseigner à un robot affectaient sa compréhension interne. Ils ont découvert que si un robot est entraîné à prédire des actions en utilisant une seule méthode spécifique, il se retrouve « verrouillé » dans cette méthode. C'est comme un étudiant qui apprend à résoudre des problèmes mathématiques en utilisant une seule formule spécifique ; si l'examen change le format de la question, l'étudiant échoue car il n'a jamais appris le concept lui-même. Les chercheurs ont découvert que ce « verrouillage » se produit lorsque le cerveau du robot est forcé de faire entrer ses connaissances dans une structure unique et rigide pendant l'entraînement.
Pour corriger cela, l'équipe a développé une nouvelle recette d'entraînement qui garde le cerveau du robot flexible. Ils ont commencé par un puissant modèle vision-langage, un type d'intelligence artificielle déjà entraîné sur de vastes quantités d'images et de textes provenant d'Internet, ce qui lui donne une compréhension large du monde. Au lieu de laisser l'entraînement du robot écraser cette connaissance large, ils ont protégé les couches inférieures du cerveau qui gèrent la reconnaissance visuelle de base. Ils ont ensuite introduit une technique d'entraînement unique où l'on demandait au robot de prédire les mêmes mouvements physiques en utilisant simultanément trois méthodes mathématiques différentes. En forçant le robot à satisfaire les trois méthodes à la fois, les chercheurs ont empêché le robot de se spécialiser dans une seule méthode. Cette approche a permis de s'assurer que le robot apprenait une compréhension universelle de l'action, plutôt qu'une compétence étroite liée à une seule façon de calculer le mouvement.
De plus, l'équipe a abordé le problème des différents corps de robots. Un robot avec deux bras bouge différemment d'un robot avec un seul bras, et un robot avec une pince se déplace différemment d'un robot avec une main. Les méthodes précédentes traitaient souvent ces différences comme des problèmes distincts, entraînant un cerveau unique pour chaque type de robot. L'équipe VLAct a plutôt créé un langage partagé pour le mouvement. Ils ont enseigné au robot que l'ouverture d'une pince sur une machine est le même concept que l'ouverture d'une pince sur une autre, même si les mécaniques physiques diffèrent. Ils ont réussi cela en alignant les parties de l'action qui sont physiquement similaires, comme l'ouverture et la fermeture d'une main, tout en laissant les parties uniques de chaque corps de robot séparées. Cela a permis au robot de transférer ce qu'il a appris sur un type de machine à un type de machine complètement différent qu'il n'avait jamais rencontré.
Les résultats de cette approche ont été frappants. Testé sur une large gamme de tâches, le nouveau système a systématiquement surpassé les modèles existants, y compris ceux entraînés sur des ensembles de données beaucoup plus importants. Dans un test de référence en simulation appelé LIBERO-Plus, qui teste la capacité d'un robot à gérer les changements d'éclairage, d'angles de caméra et de placement d'objets, le nouveau système a atteint un taux de réussite de 82,6 pour cent. C'était nettement plus élevé que les autres systèmes de pointe, prouvant que le robot avait appris une compréhension robuste de la tâche plutôt que de simplement mémoriser un scénario spécifique. Sur un autre test de référence appelé RoboTwin 2.0, qui implique deux bras robotiques travaillant ensemble, le système a atteint un taux de réussite de 92,5 pour cent, dépassant les systèmes industriels à grande échelle qui reposent sur des données propriétaires et une puissance de calcul massive.
La preuve la plus convaincante de la puissance de cette méthode est venue d'un test impliquant un robot humanoïde totalement nouveau par rapport aux données d'entraînement. Les chercheurs ont entraîné leur système sur des données provenant de bras robotiques standards, puis lui ont demandé de contrôler un robot humanoïde avec des jambes et un torse, une machine qu'il n'avait jamais vue auparavant. En utilisant seulement 20 pour cent des données habituellement requises pour entraîner un robot pour ce corps spécifique, le système a obtenu de meilleurs résultats qu'un modèle de base entraîné avec 100 pour cent des données. Cela suggère que le robot avait appris un concept fondamental de « comment bouger » qui pouvait être appliqué à n'importe quel corps, plutôt que de simplement mémoriser les mouvements spécifiques des bras sur lesquels il a été entraîné.
Les chercheurs ont également testé leur système dans le monde réel, en utilisant des bras robotiques physiques pour effectuer des tâches telles que empiler des blocs, nettoyer des tables et plier des vêtements. Dans ces expériences en conditions réelles, le système a continué à surpasser le modèle de base, montrant une plus grande stabilité et une plus grande précision. Il a géré avec succès des objets nouveaux qu'il n'avait jamais vus, comme ramasser un poivron au lieu d'une carotte, et a géré des tâches complexes à plusieurs étapes, comme puiser des haricots et les verser dans un bol sans sauter d'étapes. Le système a également excellé dans la coordination de deux bras travaillant ensemble, comme tenir une douille tout en tirant une fiche, démontrant un niveau de synchronisation que les modèles précédents peinaient à atteindre.
Ce qui rend ce travail particulièrement significatif, c'est qu'il a été réalisé en utilisant uniquement des données open-source et une quantité modeste de puissance de calcul, spécifiquement une configuration avec 16 processeurs graphiques (GPU). Cela contraste avec de nombreux systèmes les plus performants du domaine, qui dépendent de jeux de données propriétaires et de ressources de calcul à l'échelle industrielle massive. Les chercheurs ont montré qu'en se concentrant sur la manière dont le robot représente le monde en interne, plutôt qu'en augmentant simplement la quantité de données, il est possible de construire des robots plus capables et plus adaptables. Leurs conclusions suggèrent que l'avenir de l'apprentissage robotique ne réside pas dans la collecte de flux de données interminables, mais dans la conception de méthodes d'entraînement qui aident le robot à construire une compréhension plus profonde et plus flexible du monde physique.
L'étude conclut que la manière dont un robot est enseigné est aussi importante que ce qu'on lui enseigne. En préservant la connaissance large d'un cerveau pré-entraîné et en encourageant le robot à apprendre des actions de manière à ce qu'elles ne soient pas liées à une seule méthode ou à un seul type de corps, les chercheurs peuvent créer des systèmes bien plus capables de gérer la nature imprévisible du monde réel. Cette approche offre une voie prometteuse vers des robots à usage général capables d'apprendre de nouvelles tâches rapidement et de s'adapter à de nouveaux environnements sans nécess avoir besoin de quantités massives de nouvelles données. Le travail a été rendu public, permettant à d'autres scientifiques de s'appuyer sur ces découvertes et d'explorer davantage comment enseigner aux machines à bouger avec la même flexibilité et la même compréhension que les êtres vivants.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.