REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
REFACTOR-VLA est un cadre d'éveil/sommeil qui apprend des programmes moteurs typés et réutilisables en regroupant des fragments d'actions via un noyau d'équivalence comportementale et un modèle de monde latent, atteignant des performances de pointe sur les tâches LIBERO à long horizon grâce à un décodeur conditionné par une bibliothèque et un objectif d'entraînement qui privilégie la qualité du regroupement sur la capacité du modèle.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots s'améliorent dans leur capacité à voir le monde et à se déplacer, mais ils éprouvent encore des difficultés avec les tâches complexes et multi-étapes que les humains accomplissent avec aisance. Lorsqu'une personne prépare un sandwich, elle ne réfléchit pas à chaque micro-mouvement musculaire requis pour saisir le pain, étaler le beurre ou trancher la tomate. Au lieu de cela, elle s'appuie sur une bibliothèque mentale d'actions familières — saisir, étaler, couper — qu'elle peut enchaîner dans différents ordres. Les modèles d'intelligence artificielle actuels pour les robots manquent souvent de cette capacité à organiser le comportement. Ils ont tendance à générer des commandes brutes, instant par instant, sans les regrouper en compétences réutilisables et bien définies. Cela rend difficile pour eux de planifier des tâches de longue durée ou d'expliquer ce qu'ils ont appris. Les chercheurs tentent désormais d'enseigner aux machines à construire leurs propres bibliothèques de compétences internes, leur permettant de décomposer des tâches compliquées en morceaux plus petits et gérables qui peuvent être réutilisés et combinés.
Une équipe de chercheurs chez Apple a développé un nouveau système appelé REFACTOR-VLA qui tente de résoudre ce problème en apprenant à un robot à découvrir ses propres compétences sans étiquetage humain. Le système fonctionne en deux phases alternées, un peu comme un humain qui pratiquerait un nouveau mouvement puis se reposerait pour laisser le cerveau organiser la mémoire. Dans la première phase, le robot apprend à prédire ce qui se passera ensuite s'il exécute une certaine séquence de mouvements. Il construit un modèle mental du monde, comprenant comment ses actions modifient l'environnement. Dans la seconde phase, le système examine la vaste quantité de données de mouvement qu'il a collectées et tente d'y trouver des motifs. Il pose une question simple mais difficile : est-ce que deux séquences de mouvements différentes produisent le même résultat ? Si un robot déplace son bras en cercle pour ramasser une tasse, ou le déplace en ligne droite pour faire la même chose, le système doit reconnaître que ces deux trajectoires atteignent le même objectif.
Pour répondre à cela, les chercheurs ont créé un outil spécial qui mesure le résultat des actions plutôt que leur simple apparence. Au lieu de regarder la vidéo brute du mouvement du robot, le système simule l'action dans son modèle mental appris pour voir où le robot finit et quel est le gain obtenu. Si deux chemins de mouvement différents mènent au même état final et à la même récompense, le système les considère comme équivalents. Il regroupe ensuite ces chemins similaires en une seule compétence réutilisable. Une fois qu'un groupe est formé, le système tente d'écrire un programme simple et structuré qui décrit le motif commun de cette compétence. Ce programme est ensuite ajouté à une bibliothèque. Le robot peut plus tard utiliser cette bibliothèque pour planifier de nouvelles tâches, en faisant appel à ces compétences pré-emballées plutôt que de calculer chaque minuscule mouvement à partir de zéro.
Les chercheurs ont testé cette approche sur un ensemble standard de tâches robotiques impliquant le déplacement d'objets dans un environnement simulé. Ils ont découvert quelque chose de surprenant sur la façon dont ces systèmes apprennent. Une croyance commune en intelligence artificielle est que rendre un modèle plus grand et plus complexe conduit toujours à de meilleures performances. Pourtant, lorsque les chercheurs ont augmenté la taille de leur modèle de monde, passant d'environ 188 millions de paramètres à 430 millions, le système a en réalité moins bien performé sur l'ensemble des tests. Le modèle plus grand a échoué à organiser correctement les compétences, suggérant que l'ajout de simple puissance de calcul n'est pas la solution.
Au lieu de cela, la clé du succès résidait dans la manière dont le modèle était entraîné. Les chercheurs ont découvert qu'ajouter un type spécifique d'objectif d'apprentissage lors de la phase d'entraînement initiale améliorait considérablement les résultats. Cet objectif aidait le système à distinguer plus clairement les différentes tâches, lui permettant de regrouper les mouvements similaires de manière beaucoup plus efficace. Avec ce changement, le système a surpassé les méthodes existantes les plus performantes sur les quatre principales suites de tests, améliorant son score moyen de manière significative. Le système a réussi à construire une bibliothèque de trois compétences distinctes et réutilisables pour une tâche spécifique, et un robot utilisant cette bibliothèque a été capable de réécrire chaque démonstration qu'il avait vue en utilisant ces nouvelles compétences.
L'étude a également révélé que la capacité du système à trouver ces compétences dépend fortement du type de données qu'il analyse. Bien que le système ait réussi à créer une bibliothèque d'instructions basées sur le langage, telles que « ramasser l'objet et le placer dans le panier », il a échoué à trouver des motifs réutilisables dans les commandes motrices brutes elles-mêmes. Cela suggère que le système est meilleur pour comprendre les objectifs de haut niveau d'une tâche que les détails physiques de bas niveau de la manière de bouger. Les chercheurs ont mesuré la cohérence de leurs résultats à travers de nombreuses sessions d'entraînement et ont constaté que le système découvrait de manière fiable des regroupements de compétences similaires, avec un degré élevé d'accord entre les différentes versions du modèle.
Ce travail démontre que la manière dont un robot organise ses expériences est plus importante que la taille pure de son cerveau. En se concentrant sur les résultats des actions et en utilisant une méthode structurée pour les regrouper, le système peut construire une bibliothèque de compétences qui l'aide à aborder des tâches complexes et de longue durée. Les conclusions remettent en question l'idée que « plus grand est toujours mieux » et ouvrent la voie à un avenir où les robots pourront apprendre à penser en termes d'actions réutilisables, tout comme les humains. Les chercheurs ont rendu leur code et leurs données disponibles, permettant à d'autres de vérifier ces résultats et de s'appuyer sur cette nouvelle approche de l'apprentissage robotique.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.