← Derniers articles
💻 computer science

VEGA: Learning Navigation VLAs from In-the-Wild Egocentric Video with Geometric Trajectory Supervision

VEGA introduit une méthode pour l'entraînement de modèles de vision-langage-action de navigation à partir de vidéos égocentrées non étiquetées en reconstruisant la géométrie locale de la scène pour générer des trajectoires conscientes des obstacles pour la supervision, atteignant des améliorations significatives de l'évitement de collisions et des taux de réussite par rapport aux bases de référence existantes.

Auteurs originaux : Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

Publié 2026-06-19
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Gershom Seneviratne, Yohan Abeysinghe, Jianyu An, Vaibhav Shende, Dinesh Manocha

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous vouliez apprendre à un robot comment marcher à travers une pièce bondée sans heurter des chaises, des personnes ou des tables. Habituellement, pour apprendre cela à un robot, vous devez soit :

  1. Enregistrer un humain marchant dans cette pièce exacte pendant que le robot regarde, ou
  2. Programmer manuellement le robot pour qu'il évite des obstacles spécifiques.

Ces deux méthodes sont lentes, coûteuses et difficiles à déployer à grande échelle. Vous ne pouvez pas enregistrer un humain marchant dans chaque pièce possible dans le monde.

Entrez en scène, VEGA.

Les chercheurs derrière ce papier ont trouvé une manière ingénieuse d'apprendre aux robots à naviguer en utilisant des milliards de vidéos « du monde réel » trouvées sur Internet (comme des gens marchant dans leurs maisons, sur des sentiers de randonnée ou dans des rues animées). Ces vidéos sont excellentes car elles montrent des environnements réels, encombrés et désordonnés, mais elles présentent un gros problème : elles ne disent pas au robot où aller ni comment éviter les meubles. Ce ne sont que des vidéos « sans action ».

Voici comment VEGA transforme ces vidéos aléatoires en un enseignant de la navigation, en utilisant quelques étapes créatives :

1. L'astuce de la « Carte Mentale »

D'abord, VEGA observe une seule image d'une vidéo et utilise une IA spéciale pour construire une carte mentale 3D de la pièce. Il détermine où se trouve le sol, où se trouvent les murs et où se trouvent les obstacles (comme une table basse ou un chien) qui se tiennent là. Il crée une « carte de sécurité » qui sait exactement quel espace est disponible pour marcher.

2. Le jeu du « Et si ? »

Une fois la carte construite, VEGA joue à un jeu de « Et si ? »

  • Et si le robot voulait aller vers cette chaise rouge ?
  • Et si le robot voulait aller vers la porte ?
  • Et si le robot voulait simplement marcher vers un endroit vide sur le tapis ?

Pour chaque destination possible, VEGA utilise un planificateur mathématique pour calculer le chemin parfait et sûr pour y parvenir sans rien heurter. Il fait cela des millions de fois, créant une immense bibliothèque de paires « Objectif + Chemin Sûr ».

3. Le robot « Étudiant »

Maintenant, VEGA entraîne le cerveau d'un robot (appelé un modèle VLA ou Vision-Language-Action). Ce robot étudiant regarde la vidéo originale et voit le « Chemin Sûr » que VEGA a calculé.

  • La leçon : « Voici ce que tu vois (la vidéo), voici où tu veux aller (l'objectif), et voici le chemin sûr que tu dois suivre. »
  • Le résultat : Le robot apprend à regarder une scène, à comprendre un objectif (comme « aller à la cuisine » ou « aller vers cette photo ») et à calculer instantanément un chemin sûr, simplement en regardant le flux de la caméra. Il n'a plus besoin de la carte 3D une fois entraîné ; il utilise simplement ses yeux et son cerveau.

Pourquoi est-ce une avancée majeure ?

Pensez à l'apprentissage de la conduite.

  • L'ancienne méthode : Vous apprenez à conduire uniquement en ayant un moniteur de conduite assis à côté de vous dans une voiture spécifique sur une rue spécifique, en vous disant exactement quand tourner.
  • La méthode VEGA : Vous regardez des millions d'heures de vidéos de caméras embarquées (dashcams) provenant du monde entier. Vous utilisez un ordinateur pour déterminer les « trajectoires parfaites » pour chaque destination possible dans ces vidéos. Ensuite, vous entraînez votre cerveau à imiter ces trajectoires parfaites.

Les résultats

Les chercheurs ont testé cela sur un vrai robot dans des pièces encombrées et désordonnées avec des obstacles en mouvement. Comparé aux autres navigateurs de haut niveau :

  • Succès : Le robot a atteint sa destination beaucoup plus souvent (au moins 150 % de mieux).
  • Sécurité : Il a heurté des objets 66 % de moins souvent.
  • Espace : Il s'est laissé plus de place pour manœuvrer, évitant les passages étroits de 60 % de plus.

Ils ont également créé un test géant appelé VEGA-Bench (avec 250 000 scènes et 5 millions d'objectifs) pour prouver que leur méthode fonctionne mieux que la concurrence pour éviter les collisions et atteindre des cibles spécifiques.

En résumé : VEGA prend le chaos de la bibliothèque vidéo d'Internet, le transforme en un « manuel de sécurité » structuré grâce à la géométrie, et apprend aux robots à naviguer dans le monde réel sans avoir besoin de sessions d'entraînement enregistrées à la main et coûteuses.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →