← Derniers articles
💻 computer science

From Seeing to Experiencing: Scaling Navigation Foundation Models with Reinforcement Learning

Cet article introduit le cadre de travail Seeing-to-Experiencing (S2E), qui améliore les modèles de fondation de navigation en combinant un préentraînement hors ligne sur des vidéos à l'échelle du web avec l'apprentissage par renforcement en simulation afin d'améliorer le raisonnement interactif et la sécurité, soutenu par un nouveau banc d'essai d'évaluation appelé NavBench-GS.

Auteurs originaux : Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Publié 2026-06-12
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Honglin He, Yukai Ma, Brad Squicciarini, Wayne Wu, Bolei Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Gros Problème : Le « Touriste » vs Le « Local »

Imaginez que vous vouliez apprendre à un robot comment marcher dans une ville animée.

L'ancienne méthode (Juste « Voir ») :
Actuellement, la plupart des robots de navigation sont entraînés comme un touriste qui aurait regardé des milliers d'heures de vidéos YouTube sur la marche en ville. Ils ont vu tous les types de rues, de foules et d'obstacles à l'écran. C'est ce qu'on appelle le pré-entraînement hors ligne (Offline Pre-training).

  • La faille : Regarder une vidéo de quelqu'un esquivant un skateur est très différent d'esquiver réellement un skateur. Le robot sait à quoi ressemble une collision, mais il ne comprend pas la physique de la chute ou le timing à la fraction de seconde nécessaire pour s'arrêter. Si le robot essaie de marcher dans le monde réel, il pourrait se figer ou s'écraser parce qu'il n'a jamais vraiment « ressenti » les conséquences d'un mauvais virage. Il lui manque la causalité (la relation de cause à effet).

La nouvelle méthode (Le cadre « S2E ») :
Les auteurs proposent une nouvelle méthode appelée Seeing-to-Experiencing (S2E). Considérez cela comme le fait de prendre ce touriste et de l'envoyer dans un simulateur de jeu vidéo ultra-réaliste et sûr, où il peut réellement marcher, trébucher et apprendre de ses erreurs sans se blesser.

L'objectif est de combiner la connaissance large du touriste qui regarde des vidéos avec le sens de la rue de quelqu'un qui a réellement pratiqué dans le monde réel.


Comment ça marche : La recette en deux étapes

Le cadre S2E utilise deux principaux « tours de passe-passe » pour fonctionner efficacement.

1. Le système d'« Ancre » (Pendant la phase vidéo)

Le défi : Quand un robot regarde une vidéo, il voit que parfois les gens marchent droit, parfois ils tournent à gauche pour éviter un chien, et parfois ils s'arrêtent pour un feu rouge. Toutes ces actions sont valables pour la même situation. Si le robot essaie de deviner un seul chemin moyen, il échouera.

La solution : Les auteurs utilisent ce qu'ils appellent l'Anchor-Guided Distribution Matching (Correspondance de distribution guidée par ancres).

  • L'analogie : Imaginez que le robot est un chef essayant de deviner une recette. Au lieu de deviner une seule saveur, il place plusieurs « Ancres » (comme des profils de saveurs spécifiques : « Épicé », « Sucré », « Salé ») sur la table.
  • Comment cela aide : Le robot apprend que pour une situation donnée, la réponse peut être « Épicé » (aller tout droit) OU « Salé » (tourner à gauche). En utilisant ces ancres, le robot apprend à prédire un menu d'actions possibles et bonnes plutôt qu'une simple moyenne. Cela rend le robot beaucoup plus flexible et prêt pour différents scénarios.

2. Le cerveau « Résiduel » (Pendant la phase de pratique)

Le défi : Une fois que le robot commence à pratiquer dans le simulateur, nous voulons qu'il apprenne de nouveaux tours (comme esquiver un piéton en mouvement). Mais si nous laissons le robot tout réapprendre à partir de zéro, il pourrait oublier comment marcher droit ou reconnaître un trottoir. C'est ce qu'on appelle l'« oubli catastrophique ». De plus, le simulateur est légèrement différent du monde réel (éclairage, textures différentes), ce qui peut confondre le robot.

La solution : Ils utilisent un Module d'Attention Résiduelle (Residual-Attention Module).

  • L'analogie : Imaginez que le robot possède un « Cerveau de Base » (la partie entraînée sur les vidéos) qui est excellent pour reconnaître les rues. Lorsqu'il entre dans le simulateur, nous ne remplaçons pas le Cerveau de Base. Au lieu de cela, nous attachons un petit « Cerveau Additionnel » (le Module Résiduel) léger par-dessus lui.
  • Comment cela aide : Le Cerveau de Base reste figé et garde ses connaissances générales en sécurité. L'Add-on (le cerveau additionnel) est la seule partie qui apprend. Il se concentre uniquement sur les nouvelles choses interactives : « Oh, cette personne bouge, je dois ralentir ».
  • Le bénéfice : C'est comme ajouter une nouvelle application à votre téléphone sans supprimer vos contacts. Le robot acquiert de nouvelles compétences réactives (esquiver, s'arrêter) sans perdre ses anciennes connaissances générales (reconnaître une route).

Le test de conduite : NavBench-GS

Pour prouver que cela fonctionne, les auteurs ont construit un nouveau terrain d'essai appelé NavBench-GS.

  • Qu'est-ce que c'est ? Au lieu de tester sur des images 2D plates (comme regarder une photo d'une rue), ils ont construit un monde en 3D qui ressemble exactement au monde réel mais possède une vraie physique. Vous pouvez lancer une balle contre le robot, et il réagira.
  • Les résultats :
    • Les robots entraînés uniquement sur des vidéos (les « Touristes ») s'écrasaient souvent face à des personnes ou des obstacles en mouvement.
    • Les robots entraînés avec la méthode S2E (les « Locaux ») étaient bien meilleurs. Ils atteignaient leur destination plus souvent et s'écrasaient beaucoup moins.
    • La surprise d'efficacité : Le robot S2E a appris plus rapidement avec moins de données. Un robot entraîné avec seulement 100 heures de données + la pratique en simulateur a été plus performant que d'autres robots entraînés sur plus de 2 000 heures de vidéo. Cela prouve que la pratique interactive est plus précieuse que le simple visionnage de vidéos.

Preuve dans le monde réel

L'équipe ne s'est pas arrêtée aux simulations. Ils ont placé leur robot sur deux machines réelles :

  1. Un robot à roues (comme un robot de livraison).
  2. Un robot quadrupède (un robot ressemblant à un chien).

Ils ont testé ces robots dans de vraies rues de ville avec de vrais obstacles et de vraies personnes. Les robots S2E ont navigué avec succès dans ces environnements complexes sans entraînement spécifique préalable sur ces rues exactes (Généralisation Zero-Shot). Ils ont pu rester sur le trottoir et éviter les piétons, prouvant que les compétences apprises dans le simulateur se sont parfaitement transférées dans le monde réel.

Résumé

L'article soutient que pour rendre les robots véritablement intelligents dans la navigation, nous ne pouvons pas nous contenter de leur donner plus de vidéos. Nous devons les laisser pratiquer. En combinant une fondation stable « basée sur la vidéo » avec un module d'apprentissage « basé sur la pratique » qui n'écrase pas leurs connaissances originales, les robots peuvent apprendre à naviguer de manière sûre et efficace dans le chaos du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →