← Derniers articles
💻 computer science

ReLI: Cross-Lingual Language-to-Action Grounding for Human-Robot Interaction

RelI est un cadre translingue qui adapte les modèles de fondation à grande échelle pour permettre aux agents autonomes de comprendre les instructions en langage naturel, de raisonner sémantiquement et d'exécuter des tâches efficacement dans plus de 140 langues diverses, incluant des variétés de langues à faibles ressources et des créoles, surmontant ainsi les limites des systèmes existants limités aux langues à hautes ressources.

Auteurs originaux : Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Publié 2026-09-09
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Linus Nwankwo, Bjoern Ellensohn, Ozan Özdenizci, Elmar Rueckert

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où un robot peut comprendre une commande donnée dans n'importe quelle langue, des langues les plus parlées aux dialectes rares utilisés par de petites communautés. Pendant des décennies, le rêve d'une collaboration homme-robot naturelle a été freiné par une barrière simple : la langue. Alors que les robots modernes deviennent de plus en plus capables de percevoir leur environnement et de s'y déplacer, ils ont largement été entraînés pour ne comprendre qu'un petit nombre de langues majeures, comme l'anglais ou le mandarin. Cette limitation exclut des milliards d'utilisateurs potentiels qui parlent d'autres langues, dialectes ou créoles, les verrouillant de fait hors du futur de l'automatisation. Le domaine de l'interaction homme-robot repose sur la capacité de traduire une requête orale ou écrite en une action physique, un processus appelé ancrage (grounding). Jusqu'à présent, cette traduction était une voie à sens unique, fonctionnant bien uniquement pour ceux qui ont accès aux langues à hautes ressources, laissant le reste du monde en retrait.

Une équipe de chercheurs a développé un nouveau système appelé ReLI, conçu pour briser ces murs linguistiques. ReLI permet à des agents autonomes de converser naturellement, de raisonner sur leur environnement et d'exécuter des tâches, quelle que soit la langue dans laquelle l'instruction est donnée. Le système ne repose pas sur la traduction préalable du discours de l'utilisateur vers l'anglais, et ne nécessite pas que le robot soit réentraîné pour chaque nouvelle langue. Au lieu de cela, il tire parti de la capacité intrinsèque des modèles informatiques pré-entraînés à grande échelle à comprendre le sens des mots à travers des centaines de langues différentes simultanément. En combinant ces modèles de langage avec des capteurs visuels qui permettent au robot de « voir » les objets et les espaces, ReLI peut transformer une commande telle que « trouve la chaise rouge » prononcée dans un dialecte rare en un mouvement physique précis, le tout sans que l'utilisateur ait besoin de connaître un quelconque code technique ou de parler une langue dominante mondiale.

Les chercheurs ont testé ce système dans des environnements simulés et des contextes réels à l'aide de robots à roues et de machines quadrupèdes équipés de caméras et de capteurs de profondeur. Ils ont mis les robots au défi avec plus de 70 000 conversations multi-tours dans plus de 140 langues différentes. Ces langues ont été soigneusement sélectionnées pour représenter un large spectre de la diversité linguistique mondiale, incluant des langues à hautes ressources disposant de vastes données numériques, des langues à faibles ressources avec des données limitées, ainsi que des langues vulnérables ou des créoles qui sont souvent ignorés par la technologie. Les tâches allaient de commandes simples à étape unique, comme avancer d'une distance spécifique, à des missions complexes à étapes multiples exigeant que le robot navigue dans une pièce, identifie un objet basé sur une description et rende compte de ce qu'il a trouvé.

Les résultats ont montré que le système performait avec une constance remarquable à travers ce vaste paysage linguistique. Dans presque toutes les langues testées, le robot comprenait correctement l'intention de l'utilisateur et exécutait la tâche avec un taux de réussite supérieur à 83 %. Pour beaucoup des langues les plus courantes, le taux de réussite grimpait au-dessus de 97 %. Même pour les langues les plus vulnérables et les moins dotées en ressources, le système maintenait des niveaux d'exactitude élevés, analysant avec succès les instructions et guidant le robot vers son objectif. Le temps nécessaire au robot pour traiter une commande et commencer à se déplacer est resté stable, se situant en moyenne entre 2,1 et 2,6 secondes, qu'il s'agisse d'une instruction donnée dans une langue majeure mondiale ou dans un dialecte rare. Cette vitesse et cette fiabilité suggèrent que le système n'est pas seulement un concept théorique, mais un outil pratique capable de fonctionner en temps réel.

Pour s'assurer que la technologie était véritablement inclusive, les chercheurs ont également mené une étude avec des participants humains interagissant avec les robots dans leurs langues maternelles. Trente-quatre évaluateurs, maîtrisant 13 langues différentes, ont testé le système dans un cadre de laboratoire réel. Ils ont rapporté que les interactions semblaient naturelles et réactives, la grande majorité notant qu'ils ne percevaient aucune différence de performance basée sur la langue utilisée. Cette conclusion est cruciale, car elle indique que le système ne favorise pas une langue plutôt qu'une autre, ni ne crée un fossé caché où les utilisateurs de certaines langues recevraient une expérience de moindre qualité. Le système a géré avec succès l'alternance codique (code-switching), où un utilisateur peut mélanger des mots de deux langues différentes dans une seule phrase, et a géré un raisonnement spatial complexe, tel que naviguer vers un lieu décrit uniquement par sa fonction, comme « l'endroit où l'on cuisine ».

Le cœur de cette réussite réside dans la manière dont le système connecte le langage à l'action. Lorsqu'un utilisateur parle ou tape une commande, le système normalise d'abord l'entrée, convertissant la parole en texte si nécessaire, puis la transmet à un grand modèle de langage qui agit comme le cerveau du robot. Ce modèle interprète l'intention de la commande, la décomposant en une séquence d'étapes logiques. Il consulte ensuite les capteurs visuels du robot pour identifier les objets et les espaces mentionnés dans la commande. Si un utilisateur demande au robot d'aller vers une chaise spécifique, le système utilise la vision par ordinateur pour localiser cette chaise dans la pièce, déterminer sa position exacte dans l'espace tridimensionnel et calculer le chemin que le robot doit suivre pour l'atteindre. Enfin, le système génère un plan et, par mesure de sécurité, demande souvent la confirmation de l'utilisateur avant d'exécuter des mouvements complexes ou de longue distance. Tout ce processus se déroule de manière fluide, comblant le fossé entre la pensée humaine et l'action de la machine sans nécessole de traduction explicite ou d'entraînement spécialisé pour chaque nouvelle langue.

L'étude a également exploré les limites de cette technologie, révélant que si le système est robuste, il n'est pas infaillible. Les défis les plus importants sont apparus lorsque le robot devait identifier des objets qui se ressemblaient beaucoup ou lorsque l'environnement visuel était encombré, rendant difficile la distinction de la cible. De plus, les tâches nécessitant de naviguer à travers des séquences complexes à plusieurs étapes étaient légèrement plus sujettes à l'erreur que les commandes simples et directes, simplement parce qu'il y avait plus d'opportunités de commettre une erreur dans la chaîne de raisonnement. Cependant, même dans ces scénarios difficiles, la performance du système est restée forte, et les chercheurs ont noté que les erreurs étaient souvent liées aux limitations physiques des capteurs du robot ou à la complexité de l'environnement plutôt qu'à un échec de compréhension du langage.

En démontrant qu'un cadre unique peut gérer plus de 140 langues avec une grande précision, ce travail suggère une nouvelle voie pour l'interaction homme-robot. Il s'éloigne de l'idée que les robots doivent apprendre une langue spécifique pour être utiles, pour tendre vers un modèle où le robot s'adapte à la langue maternelle de l'utilisateur. Les chercheurs ont rendu leurs données et leur code publics, invitant d'autres à construire sur cette base. L'objectif ultime n'est pas seulement de faire en sorte que les robots puissent parler de nombreuses langues, mais de créer un avenir où la capacité de commander une machine est un droit universel, accessible à tous, partout, dans la langue qu'ils connaissent le mieux. Ce changement promet de démocratiser l'accès à l'automatisation, garantissant que les bénéfices de la robotique soient partagés par toute l'humanité, et non seulement par ceux qui parlent les langues de l'élite numérique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →