← Derniers articles
💻 computer science

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

Cet article présente HumanoidVLN, un simulateur et un banc d'essai fondé sur la physique et construit sur NVIDIA Isaac Sim, qui répond aux défis uniques de la navigation vision-langage pour divers robots humanoïdes en prenant en charge de multiples incarnations, en générant des ensembles de données d'instructions sensibles aux collisions et en démontrant de fortes capacités de transfert de la simulation à la réalité.

Auteurs originaux : Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Publié 2026-08-14
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Quan-Dung Pham, Anh Dao, The-Anh Nguyen, Minh Nguyen-Dinh, Phuong Nam Dang, Tri Pham, Hung Tran, Bach Dao, Tuyen P. Le, Truong Nguyen, Quan Nguyen

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les robots ne se contentent pas de rouler sur des roues comme des voitures télécommandées, mais apprennent à marcher, à trébucher et à garder l'équilibre sur deux jambes, tout comme nous. C'est la frontière de la « robotique humanoïde », un domaine qui tente de construire des machines capables de naviguer dans nos maisons et bureaux réels et désordonnés. Pour apprendre à ces robots comment se déplacer, les scientifiques utilisent un domaine appelé la Navigation Vision-Langage (VLN - Vision-Language Navigation). Voyez la VLN comme une partie de « Jacques a dit » pour les robots : un humain donne une instruction orale telle que « marche vers la cuisine et arrête-toi près du réfrigérateur », et le robot doit regarder autour de lui, comprendre les mots et se déplacer physiquement au bon endroit.

La partie délicate est que la plupart des robots d'aujourd'hui sont testés dans des jeux vidéo ou des simulations où ils peuvent simplement se « téléporter » d'un point à un autre, ignorant la gravité, l'équilibre et le fait que marcher est difficile. Mais la marche réelle est pleine de physique ; si un robot essaie de tourner trop vite, il peut tomber. Cet article s'attaque à la grande question : comment enseigner à ces robots marcheurs comment suivre des instructions lorsqu'ils doivent réellement marcher sans tomber, et comment les tester équitablement quand chaque robot est un peu différent dans son apparence et ses mouvements ?


L'article : HumanoidVLN

Les chercheurs derrière cet article, HumanoidVLN, ont réalisé que les anciennes méthodes de test de navigation robotique étaient comme tester une voiture de Formule 1 sur un chemin de terre pour ensuite prétendre qu'il s'agit d'un vélo. Ils ont construit un tout nouveau « terrain de jeu » ultra-réaliste (un simulateur) spécifiquement conçu pour les robots marcheurs. Au lieu de laisser les robots se téléporter, leur système les force à obéir aux lois de la physique. Si un robot tente de faire un pas trop grand ou de tourner trop brusquement, il trébuchera et tombera réellement, tout comme une vraie personne pourrait le faire.

Ils ont installé ce terrain de jeu avec quatre types différents de robots « humanoïdes ». Ceux-ci ne sont pas tous identiques ; ils vont d'un robot court de 1,17 mètre (environ la taille d'un adolescent grand) à un géant de 1,80 mètre. Ils possèdent également un nombre différent d'articulations dans les jambes, ce qui signifie que certains sont plus flexibles que d'autres. L'équipe a créé un système de « contrôle hiérarchique » pour les gérer. Vous pouvez voir cela comme une équipe de deux personnes : un « coach de locomotion » (une politique d'apprentissage par renforcement) qui apprend au robot comment garder l'équilibre et marcher sans tomber, et un « navigateur » (un traqueur de trajectoire) qui dit au coach où aller en fonction de la commande vocale de l'humain. Cette configuration garantit que chaque test est un véritable défi physique, et non un simple tour de magie de jeu vidéo.

Pour rendre le test équitable et réaliste, l'équipe n'a pas seulement utilisé des modèles 3D cartoonesques. Ils ont construit 87 environnements différents, allant de salons chaleureux à des lieux de travail animés. Ils se sont assurés que chaque pièce soit assez grande (au moins 100 mètres carrés) pour que les robots ne se retrouvent pas coincés dans des coins minuscules et impossibles. Certaines pièces ont été dessinées par des artistes, tandis que d'autres ont été scannées à partir de la vie réelle grâce à une technologie cool appelée « 3D Gaussian Splatting », qui transforme des photos en mondes 3D. Ils ont même veillé à ce que la vue de la caméra tremble et oscille exactement comme elle le ferait si un vrai robot marchait, capturant l'oscillation d'une démarche bipède.

Les instructions données aux robots ont également été soigneusement élaborées. Au lieu de simplement taper des phrases aléatoires, ils ont utilisé un système d'« Annotation Multi-Agents ». Imaginez une équipe de rédacteurs, d'éditeurs et de vérificateurs de faits IA travaillant ensemble. Deux générateurs d'IA créent un itinéraire basé sur une vidéo du robot en train de marcher, une IA « réviseuse » vérifie si l'itinéraire est cohérent avec la carte, et un « paraphrasateur » réécrit les instructions dans trois styles différents : Formel (comme un patron), Naturel (comme un ami) et Décontracté (comme un SMS). Enfin, de vrais humains ont vérifié le travail pour s'assurer que les instructions étaient sûres et précises. Cela a abouti à 933 épisodes de test uniques.

Lorsqu'ils ont lancé les tests, ils ont découvert des choses surprenantes. Ils ont testé quatre modèles de navigation par IA différents pour voir lequel était le meilleur pour suivre les instructions sans tomber. Le modèle nommé JanusVLN a obtenu les meilleurs résultats, atteignant l'objectif avec succès environ 43,55 % du temps et suivant de près le chemin. Cependant, les résultats ont montré que le corps du robot compte énormément. Le robot plus grand (Unitree H1) a beaucoup plus de mal que les autres, tombant dans près de 70 % des tentatives avec certains modèles, tandis que les robots plus courts et plus stables tombaient beaucoup moins souvent. Cela prouve que vous ne pouvez pas simplement tester une IA de navigation sur un seul robot et supposer qu'elle fonctionnera sur un autre ; la forme physique et l'équilibre changent tout.

L'équipe a également réalisé un test pilote « sim-to-real » (de la simulation à la réalité), prenant l'un des modèles d'IA pour l'amener hors de l'ordinateur et sur un vrai robot dans une vraie pièce. Ils ont constaté que la performance du robot dans la simulation informatique était presque identique à sa performance dans le monde réel, avec une très forte corrélation dans la manière dont il s'écartait de la trajectoire. Cela suggère que leur simulateur fondé sur la physique est un prédicteur fiable du comportement dans le monde réel.

En résumé, HumanoidVLN n'est pas seulement un nouveau jeu de données ; c'est une nouvelle façon de penser la navigation des robots. L'article soutient que si nous voulons que les robots marchent dans nos rues et nettoient nos maisons, nous devons arrêter de les tester dans un monde où ils ne peuvent pas tomber. En ancrant les tests dans la physique réelle et dans des corps de robots diversifiés, l'article nous montre que le chemin vers un robot marcheur utile est pavé d'équilibre, et pas seulement de code.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →