← Derniers articles
💻 computer science

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

Cet article introduit JOP-VLN, un nouveau cadre qui intègre de manière synergique l'apprentissage par imitation hors politique avec l'exploration sur politique à travers un pipeline d'entraînement en trois étapes afin d'atteindre des performances de pointe sur les benchmarks de navigation vision-langage.

Auteurs originaux : Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

Publié 2026-07-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous soyez en train d'apprendre à un robot à être votre guide touristique personnel. Vous voulez qu'il écoute vos commandes vocales comme : « Marche vers la cuisine, tourne à gauche au niveau du vase bleu, et arrête-toi devant le réfrigérateur », puis qu'il le fasse réellement sans heurter les murs ou se perdre. C'est le monde de la Navigation Vision-et-Langage (VLN). Il s'agit d'une branche de la robotique où un « agent incarné » (un robot avec un corps et des yeux) doit comprendre le monde réel désordonné à travers une caméra et donner un sens à la parole humaine pour se déplacer.

Le grand défi est que les robots sont très mauvais pour apprendre de leurs propres erreurs. Si vous apprenez à un robot en lui montrant des vidéos parfaites de la façon de marcher, il apprendra à copier ces vidéos. Mais dès qu'il entre dans une nouvelle pièce ou voit une chaise à un endroit différent, il panique parce qu'il n'a jamais appris comment se rétablir quand les choses tournent mal. C'est comme un étudiant qui mémorise les réponses d'un examen blanc mais qui se fige lorsque le professeur change les chiffres. Pour corriger cela, les scientifiques essaient généralement deux choses différentes : soit ils montrent au robot plus d'exemples de chemins parfaits (Apprentissage par Imitation), soit ils laissent le robot errer et lui donnent une « friandise » (récompense) lorsqu'il se rapproche de l'objectif (Apprentissage par Renforcement). Pendant longtemps, ces deux méthodes étaient comme deux écoles distinctes qui ne se parlaient jamais.

Entrez en scène JOP-VLN, un nouveau cadre qui décide d'organiser une fête commune pour ces deux écoles. Les chercheurs ont construit un système qui enseigne au robot en trois étapes distinctes, mélangeant la sécurité de la copie d'experts avec l'audace de l'exploration autonome. Considérez cela comme un camp d'entraînement où le robot apprend d'abord les bases auprès d'un maître entraîneur, puis s'entraîne sur une version du monde avec des « petites roues » où un filet de sécurité le rattrape lorsqu'il tombe, et enfin, il part dans la nature pour explorer, mais avec une règle spéciale : il ne prête attention qu'aux moments où il était confus ou a fait une erreur, utilisant ces moments pour devenir plus intelligent.

Le papier présente ce pipeline en trois étapes pour résoudre le problème des robots qui restent bloqués lorsqu'ils rencontrent quelque chose de nouveau. Dans la première étape, le robot apprend les compétences de base de la navigation et comment résumer ce qu'il voit, tout comme un étudiant apprenant l'alphabet et comment écrire une phrase. Dans la deuxième étape, le robot tente de naviguer, et chaque fois qu'il commence à dévier de sa trajectoire, un système de sécurité en « mode dieu » (appelé oracle) intervient pour corriger son chemin. Le robot apprend alors de ces chemins corrigés, pratiquant efficacement la manière de se rétablir après des erreurs. C'est la partie « off-policy », où il apprend à partir de données collectées par un mélange de ses propres tentatives et des corrections du filet de sécurité.

La magie opère dans la troisième étape, où le papier combine tout. Les chercheurs ont réalisé que si on laissait le robot explorer de manière aléatoire, il pourrait simplement errer en rond ou devenir trop confiant dans de mauvaises habitudes. Ils ont donc ajouté un filtre ingénieux : ils ne laissent le robot apprendre que lors des moments où il était véritablement incertain ou en « haute entropie » (une façon sophistiquée de dire qu'il devinait de manière sauvage). Cela empêche le robot de perdre son temps sur des tâches faciles qu'il maîtrise déjà et le force à se concentrer sur les choses difficiles. De plus, ils ont trié les données d'entraînement afin que le robot passe le plus de temps possible à pratiquer les chemins spécifiques où il avait précédemment échoué, garantissant ainsi qu'il apprenne à corriger ses propres erreurs.

Les résultats de cette approche sont impressionnants. Testé sur des benchmarks de navigation standards, JOP-VLN a atteint un taux de réussite de 69,9 % sur le jeu de données R2R et de 68,0 % sur le jeu de données RxR. Ces chiffres représentent un nouvel état de l'art, ce qui signifie qu'il a surpassé les méthodes précédentes qui reposaient sur un seul type d'apprentissage. Les chercheurs ont également testé le robot dans le monde réel, en utilisant un robot chien à quatre pattes dans des bureaux intérieurs et des jardins extérieurs. Même avec la réalité désordonnée de l'éclairage et des textures du monde réel, le robot pouvait suivre des instructions complexes, prouvant que ce style d'apprentissage « conjoint » l'aide à mieux généraliser qu'auparavant. Le papier suggère qu'en mélangeant soigneusement le guidage d'expert avec une exploration intelligente axée sur l'erreur, nous pouvons construire des robots qui ne sont pas seulement bons pour suivre des règles, mais qui sont aussi assez résilients pour gérer les imprévus et les rebondissements du monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →