← Derniers articles
💻 computer science

City Navigation in the Wild: Exploring Emergent Navigation from Web-Scale Knowledge in MLLMs

Ce papier introduit **CityNav**, un nouveau benchmark de navigation visuelle parcimonieuse conçu pour évaluer la capacité des modèles de langage multimodaux (MLLM) à naviguer dans des environnements urbains réels en s'appuyant sur leurs connaissances internes, et propose la méthode **VoP** (Verbalization of Path) pour améliorer significativement leurs performances.

Auteurs originaux : Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

Publié 2026-02-12
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Dwip Dalal, Utkarsh Mishra, Narendra Ahuja, Nebojsa Jojic

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Problème : Le Touriste Perdu dans une Ville Étrangère

Imaginez que vous êtes un robot, mais un robot très intelligent (ce qu'on appelle un MLLM, un modèle de langage multimodal). Vous avez lu tous les livres du monde, vous avez vu des millions de photos sur Internet, et vous connaissez l'histoire de chaque monument.

Pourtant, on vous parachute en plein milieu de Tokyo ou de New York, sans GPS, sans carte, et sans aucune instruction. On vous donne juste une photo de l'intersection où vous vous trouvez et on vous dit : "Trouve le Palais de Belvedere".

Le problème, c'est que même si vous êtes "intelligent", vous n'avez pas de sens de l'orientation réel. Vous voyez une rue, vous voyez un panneau, mais vous n'arrivez pas à relier ce que vous voyez avec ce que vous savez de la ville. Vous tournez en rond comme un touriste qui regarde son téléphone sans comprendre où il est.

La Solution : La Méthode "VoP" (Le Carnet de Voyage Mental)

Les chercheurs ont remarqué que ces robots intelligents ont un immense trésor de connaissances caché dans leur cerveau, mais ils ne savent pas comment s'en servir pour marcher. Ils voient l'image, mais ils ne "pensent" pas à la ville.

Pour régler ça, ils ont inventé une méthode appelée VoP (Verbalization of Path).

L'analogie du carnet de notes :
Imaginez que ce robot, au lieu de simplement regarder la photo et de choisir un chemin au hasard, ait maintenant un petit carnet de notes. À chaque intersection, avant de faire un pas, le robot doit s'arrêter et écrire à voix haute (ou dans son "cerveau") :

  1. "Où suis-je exactement ?" (ex: "Je suis au coin de la rue Broadway et Canal.")
  2. "Où est mon but ?" (ex: "Le One World Trade Center est au sud.")
  3. "Quel est mon plan ?" (ex: "Je vais descendre Broadway, puis tourner à gauche à la rue Vesey.")

C'est comme si on forçait le robot à se raconter une histoire pour se repérer. En mettant des mots sur ce qu'il voit et sur ce qu'il sait, il transforme ses connaissances théoriques (ce qu'il a lu sur le web) en une carte mentale concrète.

Comment ont-ils testé cela ? (Le Grand Test de la Ville)

Ils ont créé un défi appelé CityNav. Ce n'est pas un petit jeu vidéo tout simple ; c'est un test de survie urbaine dans quatre villes géantes : New York, Tokyo, Vienne et São Paulo.

C'est un test très difficile car :

  • C'est long : Le robot doit prendre plus de 50 décisions de suite sans se tromper.
  • C'est multilingue : À Tokyo, les panneaux sont en japonais. À São Paulo, en portugais. Le robot doit comprendre les signes pour ne pas se perdre.
  • C'est "nu" : Pas d'aide, pas de GPS, juste des images de rues (Google Street View).

Le Résultat : Un robot qui devient un vrai explorateur

Les résultats sont impressionnants. Les robots "normaux" (ceux qui ne font que regarder les images) échouent presque toujours ou tournent en boucle. Mais les robots qui utilisent la méthode du "Carnet de Voyage" (VoP) réussissent beaucoup mieux.

Ils arrivent à utiliser leur culture générale pour compenser le manque de GPS. Par exemple, s'ils voient un bâtiment spécifique, ils se disent : "Ah, je reconnais cette architecture, je suis donc dans tel quartier, donc mon but est par là !"

En résumé

Ce papier prouve que pour qu'une Intelligence Artificielle devienne un véritable agent capable de se déplacer dans le monde réel, il ne suffit pas qu'elle soit "instruite". Il faut qu'elle apprenne à verbaliser son raisonnement : transformer ses connaissances en un plan d'action écrit pour ne pas perdre le fil de son voyage.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →