← Derniers articles
💻 computer science

AgenticNav: Zero-Shot Vision-and-Language Navigation as a Tool-Calling Harness

AgenticNav introduit un cadre de navigation vision-langage léger et zero-shot qui réimagine l'interaction entre le VLM et l'environnement comme un harnais d'appel d'outils, permettant la sélection d'actions directe basée sur les pixels, des requêtes de profondeur à la demande et la récupération sélective de la mémoire pour atteindre des performances de pointe sans prédicteurs de points de passage appris.

Auteurs originaux : Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Publié 2026-07-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yijian Li, Changze Li, Hantian Shi, Jiaying Luo, Jiyuan Cai, Ming Yang, Tong Qin

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un robot comment naviguer dans une maison totalement nouvelle. Vous lui donnez une commande simple : « Va à la cuisine, tourne à droite et arrête-toi près du canapé. » C'est le monde de la Navigation Vision-Langage (VLN). Il s'agit d'une branche de la robotique où un agent doit comprendre le langage humain et les indices visuels pour se déplacer dans un espace 3D qu'il n'a jamais vu auparavant. Pendant longtemps, les robots devaient être entraînés sur des milliers de maisons spécifiques pour apprendre à se déplacer, ce qui signifiait qu'ils se perdraient si vous les emmeniez dans un autre bâtiment. Mais récemment, nous avons développé des « Grands Modèles Vision-Langage » (VLM) — des cerveaux d'IA super intelligents qui peuvent déjà comprendre les images et les mots sans avoir besoin d'être réentraînés pour chaque tâche. La grande question pour les scientifiques est la suivante : comment connecter ce cerveau intelligent aux jambes d'un robot ? Comment permettre à l'IA de décider exactement où poser le pied sans s'embrouiller dans la réalité désordonnée et continue du monde réel ?

C'est là qu'intervient l'article AgenticNav. Les auteurs soutiennent que l'ancienne façon de connecter l'IA aux robots était comme donner à un conducteur une carte ne comportant que trois routes pré-dessinées au choix. Si la destination ne se trouvait pas sur l'une de ces trois routes, le conducteur était bloqué. La nouvelle méthode, AgenticNav, change la donne. Au lieu de forcer le robot à choisir parmi une liste limitée de mouvements pré-approuvés, elle lui donne un ensemble d'« outils » qu'il peut invoquer dès qu'il en a besoin. Pensez à l'IA comme à un détective dans un jeu de mystère. Au lieu que le jeu force le détective à choisir entre « Aller à gauche », « Aller à droite » ou « Aller tout droit », le détective peut désormais dire : « J'ai besoin de vérifier la profondeur de ce pixel spécifique sur le mur », ou « Montre-moi la carte de l'endroit où j'ai été », ou « Je veux marcher directement vers cette chaise que je vois ».

L'article présente un système appelé AgenticNav, qui agit comme un « harnais » ou un panneau de contrôle pour ces cerveaux d'IA intelligents. Les chercheurs ont découvert qu'en donnant à l'IA trois outils spécifiques, celle-ci pouvait naviguer dans des environnements inconnus bien mieux qu'auparavant, même sans entraînement supplémentaire. Le premier outil est l'Outil d'Action. Au lieu de choisir parmi une petite liste d'endroits suggérés, l'IA peut pointer directement n'importe quel pixel dans la vue de la caméra et dire : « Va là ». Le système effectue ensuite le calcul pour transformer ce pixel en un chemin de marche sûr. Le deuxième outil est l'Outil de Profondeur. Parfois, l'IA a besoin de savoir exactement à quelle distance se trouve un objet. Au lieu de montrer à l'IA une carte de profondeur géante et déroutante, cet outil lui permet de demander : « À quelle distance se trouve le mur à cet endroit précis ? » et d'obtenir un nombre précis. Le troisième outil est l'Outil de Mémoire. Pendant que le robot marche, il construit une carte compacte. Si le robot est confus ou doit se souvenir d'un panneau qu'il a vu plus tôt, il peut demander au système de « rappeler » ce moment spécifique, plutôt que d'essayer de se souvenir de chaque image de l'intégralité de son voyage, ce qui submergerait son cerveau.

Les auteurs ont testé ce système dans une simulation informatique appelée R2R-CE (utilisant le simulateur Habitat) ainsi que sur un vrai robot. La validation en conditions réelles impliquait 30 épisodes spécifiques couvrant des scènes de laboratoire, de bureau et de jardin extérieur, mettant l'accent sur des tâches telles que la lecture de panneaux, la navigation à longue distance et l'arrivée précise à une cible. Ils ont constaté que, lors de l'utilisation d'un cerveau d'IA puissant (GPT-5.5), leur nouvelle méthode atteignait un taux de réussite de 55 % pour atteindre l'objectif, ce qui représente un bond significatif par rapport à la meilleure méthode précédente (SmartWay) qui n'atteignait que 44 %. En termes d'efficacité (comment elle équilibre le succès avec un chemin court), ils sont passés de 35,04 % à 48,41 %. L'article suggère que le goulot d'étranglement n'est pas seulement l'intelligence du cerveau de l'IA, mais la manière dont nous lui donnons les outils pour interagir avec le monde. En laissant l'IA choisir ses propres cibles et demander des informations spécifiques, elle devient beaucoup plus capable de naviguer dans le monde réel, même dans des endroits qu'elle n'a jamais visités auparavant. Les chercheurs ont également noté que cette approche fonctionne bien avec différents types de cerveaux d'IA, suggérant que ce style d'« appel d'outils » est une voie prometteuse pour créer des robots capables de véritablement comprendre et se déplacer dans notre monde complexe.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →