← Derniers articles
💻 computer science

NaviTrace: Evaluating Embodied Navigation of Vision-Language Models

Ce papier présente NaviTrace, une référence de haute qualité pour la réponse visuelle aux questions, comportant plus de 3000 traces de navigation expertes couvrant des scénarios et des types d'incarnation variés, et qui révèle que les modèles vision-langage actuels restent en retrait par rapport aux performances humaines en matière d'ancrage spatial et de localisation d'objectifs lorsqu'ils sont évalués à l'aide d'un nouveau score de trace sémantiquement conscient.

Auteurs originaux : Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

Publié 2026-03-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Tim Windecker, Manthan Patel, Moritz Reuss, Richard Schwarzkopf, Cesar Cadena, Rudolf Lioutikov, Marco Hutter, Jonas Frey

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous enseigniez à un touriste brillant mais inexpérimenté comment se déplacer dans une nouvelle ville. Vous lui montrez une photo d'une rue et dites : « Marchez jusqu'à cette voiture rouge. » Un touriste humain regarderait la photo, repérerait la voiture, remarquerait les escaliers, verrait le panneau « Ne pas marcher » et tracerait un chemin sur la photo indiquant exactement où poser les pas.

Ce papier présente NaviTrace, un nouveau « test » conçu pour vérifier si les robots d'IA modernes (spécifiquement les modèles vision-langage) peuvent faire la même chose.

Voici une décomposition du papier utilisant des analogies simples :

1. Le Problème : Le « Touriste Robot » se Perd

Les robots deviennent plus intelligents pour comprendre le langage et voir des images. Mais lorsque vous demandez à un robot de « descendre les escaliers » ou de « suivre la route », nous ne savons pas vraiment à quel point il est doué pour déterminer le chemin.

  • L'Ancienne Méthode : Pour tester les robots, les chercheurs les envoyaient autrefois dans le monde réel. C'est comme tester un conducteur en lui faisant traverser le pays à chaque fois que vous voulez vérifier ses compétences. C'est coûteux, lent et difficile à répéter.
  • La Méthode de Simulation : D'autres utilisent des simulations de jeux vidéo. C'est comme tester un conducteur dans un simulateur de vol. C'est peu coûteux et répétable, mais les « routes » du jeu sont souvent trop simples, manquant de détails du monde réel comme un revêtement irrégulier ou des règles sociales (comme attendre un piéton).

2. La Solution : Un Examen de Navigation « Papier-Crayon »

Les auteurs ont créé NaviTrace, qui ressemble à un examen standardisé pour la navigation des robots.

  • Le Déroulement : Au lieu d'envoyer un robot dehors, ils montrent à une IA une seule photo d'une scène réelle (comme une rue animée ou un parc) et lui donnent un ordre (par exemple, « Allez au bout de la route »).
  • La Surprise : Ils demandent à l'IA de tracer une ligne 2D (une « trace ») directement sur la photo, montrant où un type spécifique de voyageur devrait aller.
  • Les Voyageurs : Ils testent quatre « incarnations » différentes (types de voyageurs) :
    1. Humain : Peut marcher partout mais ne peut pas grimper de hauts murs.
    2. Robot à pattes : Comme un chien à quatre pattes ; peut gérer un terrain accidenté mais est petit.
    3. Robot à roues : Comme un robot de livraison ou un fauteuil roulant ; a besoin de chemins lisses et de rampes.
    4. Vélo : Doit rester sur les routes ou les pistes cyclables ; déteste les escaliers.

3. Le Système de Notation : La « Règle Intelligente »

Comment noter un dessin ? On ne peut pas simplement mesurer la distance du début à la fin. Les auteurs ont inventé un système de notation spécial qui agit comme une règle intelligente :

  • Correspondance de Forme : La ligne dessinée ressemble-t-elle au chemin qu'un expert humain tracerait ? (Ils utilisent une astuce mathématique appelée « Warping Dynamique du Temps » pour comparer les formes).
  • Vérification de l'Objectif : La ligne est-elle vraiment arrivée à destination ?
  • La Pénalité « Ne Pas Aller Là-bas » : C'est la partie ingénieuse. Le système connaît les objets présents sur la photo (par exemple, de l'herbe, des escaliers, une route animée). Si l'IA trace une ligne pour un fauteuil roulant montant un escalier, le système lui inflige une lourde pénalité. Si elle trace une ligne pour un humain marchant sur une piste cyclable, elle reçoit une pénalité plus faible.

4. Les Résultats : L'IA est Intelligente, Mais Pas « Ancrée »

Les auteurs ont testé les meilleurs modèles d'IA (comme Gemini, GPT-5 et d'autres) contre des experts humains.

  • L'Écart : Les humains ont obtenu environ 75/100. Les meilleurs modèles d'IA ont obtenu environ 34/100. L'IA fait mieux que le hasard, mais elle est encore loin derrière un humain.
  • La Principale Erreur : Le plus gros problème n'est pas que l'IA ne sait pas comment marcher ; c'est qu'elle ne peut pas trouver la destination.
    • Analogie : Si vous dites à l'IA « Allez à la voiture rouge », elle trace souvent un chemin qui semble raisonnable mais qui aboutit à la mauvaise voiture, ou elle trace un chemin qui sort complètement de la carte.
    • Lorsque les chercheurs ont forcé l'IA à simplement deviner la destination puis à tracer une ligne droite jusqu'à elle, le score ne s'est guère amélioré. Cela signifie que l'IA lutte pour comprendre où se trouvent les choses dans l'image, et pas seulement comment se déplacer.
  • Le Piège du « Raisonnement » : Certains modèles d'IA (comme o3) ont écrit des étapes logiques parfaites dans le texte : « Je dois aller à gauche, éviter les escaliers et me diriger vers la voiture. » Cependant, lorsqu'ils ont réellement tracé la ligne, ils ont ignoré leur propre texte et ont dessiné un chemin qui s'est enfoncé dans un mur. Le « cerveau » de l'IA (texte) et ses « yeux » (dessin) ne communiquent pas correctement entre eux.

5. Pourquoi Cela Compte

Le papier soutient que avant de pouvoir faire confiance aux robots pour livrer des colis, aider les personnes âgées ou rechercher des survivants, nous avons besoin d'un moyen de les tester qui soit équitable, peu coûteux et qui couvre la complexité du monde réel. NaviTrace fournit ce test. Il nous montre que si l'IA est excellente pour discuter et reconnaître des objets, elle lutte toujours pour « voir » le monde d'une manière qui lui permette de s'y déplacer en toute sécurité et de manière logique.

En résumé : Le papier a créé un test de navigation où les robots doivent dessiner une carte sur une photo. Les résultats montrent que si les robots s'améliorent, ils sont toujours terribles pour s'orienter et ignorent souvent les règles physiques de la route (comme les escaliers pour les fauteuils roulants).

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →