Measuring Language Transfer in Robot Policies: Adding Greek to a Cosmos3 Vision-Language-Action Policy
Cet article étudie l'ajout du grec à une politique de vision-langage-action pour robot en utilisant uniquement des instructions reformulées par machine, révélant qu'une évaluation robuste nécessite des références nulles et la réplication des graines pour éviter de fausses conclusions, tout en démontrant que l'entraînement bilingue produit des améliorations constantes par rapport aux contrôles malgré un surapprentissage de formulations spécifiques.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Les robots capables de voir, de comprendre et de se déplacer deviennent une réalité, mais ils ne parlent actuellement qu'une seule langue : l'anglais. Ces machines apprennent en regardant des vidéos d'humains accomplissant des tâches, où les instructions sont écrites en anglais. Le logiciel qui les aide à comprendre ces mots est entraîné sur de vastes quantités de textes anglais, ce qui le rend incroyablement performant dans cette langue spécifique. Pour quiconque parle le grec, ou toute autre langue, cela crée une barrière infranchissable. Il n'existe pas de bibliothèques vidéo de robots déplaçant des objets avec des instructions en grec, et en construire une à partir de zéro nécessiterait des mois de guidage manuel d'un bras robotique pour chaque action. La question que les chercheurs se sont posée était simple : pouvaient-ils prendre les données existantes en anglais, traduire les instructions en grec à l'aide d'un ordinateur, et apprendre au robot à comprendre la nouvelle langue sans reconstruire tout le système ?
La réponse s'est avérée plus complexe qu'une simple traduction. Une équipe de chercheurs de Sophea AI et de KIEFER SA à Athènes a pris un système robotique en open-source et l'a nourri de milliers d'instructions en grec générées par une machine. Ils n'ont pas modifié le cerveau du robot ni sa structure physique ; ils ont simplement remplacé le texte anglais par du texte grec. Le processus de traduction a été rapide et facile, ne prenant que quelques heures. Cependant, le véritable travail a commencé lorsqu'ils ont tenté de mesurer si le robot comprenait réellement ce qu'on lui disait. Dans le monde de la robotique, il est étonnamment facile de tromper un système pour qu'il semble réussir alors qu'il ne fait que deviner. Les chercheurs ont découvert que les tests standards, qui donnent habituellement un résultat clair de réussite ou d'échec, étaient complètement dupés. Ils ont découvert qu'un robot pouvait suivre une commande en grec avec des taux de réussite élevés même lorsque la commande était absurde, ou même lorsque le robot n'avait jamais appris le grec. Cela s'expliquait par le fait que le robot apprenait à reconnaître la scène et les objets plutôt qu'à lire les mots.
Pour résoudre ce problème, l'équipe a dû inventer de nouvelles façons de tester le robot. Ils ont construit un groupe témoin où ils donnaient délibérément de mauvaises instructions en grec pour voir si le robot tenterait tout de même d'accomplir la tâche. Ils ont constaté que sur un petit ensemble de dix tâches, un robot entraîné avec des instructions en grec générées par traduction automatique semblait réussir environ quatre-vingt-quatre pour cent du temps. Mais lorsqu'ils l'ont testé avec de mauvaises instructions, il réussissait encore environ quatre-vingt-deux pour cent du temps. Cela prouvait que le robot ne lisait pas le grec ; il réagissait simplement à la configuration visuelle. Le robot ignorait totalement la langue.
Les chercheurs ont ensuite essayé une approche différente. Ils ont utilisé un ensemble plus large de quatre-vingt-dix tâches où le robot devait choisir entre plusieurs objectifs possibles dans une même scène. Ici, la langue devenait le seul signal pour dire au robot quoi faire. Ils ont constaté qu'un robot entraîné à la fois sur des instructions en anglais et en grec pouvait suivre les commandes en grec environ vingt-sept pour cent du temps, ce qui est nettement supérieur au hasard. Cependant, un robot entraîné uniquement sur le grec, sans aucune donnée en anglais pour l'appuyer, s'améliorait à peine par rapport à une sélection aléatoire. Bien que l'entraînement bilingue soit plus performant en moyenne que l'entraînement uniquement en grec, les plages statistiques de leurs performances se chevauchent de manière significative, ce qui signifie que les données ne peuvent pas confirmer de manière définitive que l'entraînement en anglais agit comme un échafaudage nécessaire à l'apprentissage du grec. La conclusion la plus robuste est que les démonstrations dans la langue cible sont nécessaires, mais qu'elles sont souvent insuffisantes à elles seules ; une politique entraînée uniquement en grec suit à peine la langue, restant à trois points de son propre seuil d'échec lors de multiples essais.
L'étude a également révélé que le robot n'apprenait pas la langue grecque de la même manière qu'un humain. Au lieu de cela, il mémorisait la formulation spécifique utilisée par le traducteur automatique. Lorsque les chercheurs ont testé le robot avec des phrases en grec écrites par un autre programme informatique, les performances du robot ont chuté brutalement. Il avait appris le style du premier traducteur, et non la langue elle-même. Pour correr cela, ils ont enseigné la même tâche au robot en utilisant sept formulations grecques différentes. Ce changement simple a rendu le robot beaucoup plus robuste, réduisant de moitié la chute de performance lors des tests sur de nouvelles formulations. Cela a montré que la variété dans les données d'entraînement est essentielle pour que le robot puisse généraliser au-delà du style d'écriture d'une seule machine.
La découverte la plus surprenante fut peut-être que certaines améliorations de bon sens rendaient le robot moins performant. L'équipe a tenté de commencer l'entraînement du robot avec un modèle qui avait déjà été adapté au grec, pensant que cela lui donnerait une longueur d'avance. Au lieu de cela, le robot a moins bien performé, tant en anglais qu'en grec. Ils ont également essayé de laisser la partie du cerveau du robot qui traite le langage apprendre librement, plutôt que de la maintenir figée. Cela a également dégradé les performances. Les résultats suggèrent que pour ces systèmes spécifiques, la meilleure stratégie consiste à garder la partie de la compréhension du langage exactement telle qu'elle a été entraînée, et à n'enseigner au robot que comment se déplacer en utilisant les nouvelles instructions linguistiques.
Les chercheurs ont également tenté de tester ces méthodes sur une collection massive de données robotiques réelles, bien plus vaste que leurs tests simulés. Ils ont traduit plus de cinquante mille épisodes robotiques réels en grec. Cependant, ils n'ont pas pu mesurer le succès de ces données car ils manquaient du matériel robotique physique nécessaire pour effectuer les tests. Cela a mis en évidence un goulot d'étranglement majeur dans le domaine : traduire les données est peu coûteux et rapide, mais vérifier que le robot a réellement appris est lent, coûteux et nécessite des équipements physiques.
En fin de compte, l'article conclut que l'ajout d'une nouvelle langue à un robot est possible, mais que ce n'est pas aussi simple qu'une traduction. Cela nécessite un type spécifique de modèle de base qui comprend déjà la langue, un mélange de données d'entraînement en grec et en anglais, et un processus de test très rigoureux incluant des échecs délibérés pour s'assurer que le robot écoute réellement. Le robot n'apprend pas la langue de manière profonde, comme un humain ; il apprend à associer des schémas spécifiques de mots à des actions, et il a besoin de la stabilité de l'entraînement en anglais pour y parvenir, bien que le mécanisme exact par lequel l'anglais soutient le grec reste une question ouverte plutôt qu'une règle confirmée. Ce travail sert d'avertissement aux autres acteurs du domaine : ne faites pas confiance au taux de réussite d'un robot à première vue, et testez toujours avec un groupe de contrôle qui prouve que le robot n'est pas simplement en train de deviner. Le chemin vers un robot multilingue est pavé non seulement de données, mais aussi de la discipline rigoureuse consistant à prouver que les données ont été réellement comprises.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.