← Derniers articles
🤖 AI

VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

Ce papier révèle que les modèles vision-langage de pointe peinent à suivre des chemins visuels en raison d'une incapacité fondamentale à résister aux distracteurs locaux, un goulot d'étranglement qui persiste malgré la mise à l'échelle, les interventions de raisonnement ou les instructions explicites.

Auteurs originaux : Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

Publié 2026-05-18
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Hyesoo Hong, Minsoo Kim, Wonje Jeung, Sangyeon Yoon, Dongjae Jeon, Albert No

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous jouiez à un jeu de « Reliez les points » avec un robot très intelligent. Vous pointez un point rouge spécifique et dites : « Suivez cette ligne sinueuse jusqu'à la fin, et dites-moi la couleur de chaque point que vous traversez. »

Vous vous attendriez à ce que le robot réalise cela facilement. Mais selon cet article, même les modèles d'IA les plus avancés (appelés modèles vision-langage ou VLM) sont terribles dans cette tâche simple. Ils ne font pas seulement des erreurs aléatoires ; ils se distraient et passent à une ligne différente qui ressemble presque identique à celle que vous leur avez demandé de suivre.

Voici une analyse de ce que les chercheurs ont découvert, en utilisant des analogies simples :

1. Le problème de la « Gare bondée »

Les chercheurs ont créé deux tests principaux pour évaluer la capacité de ces IA à tracer une ligne.

  • Le test du circuit : Imaginez un panneau électrique en désordre avec de nombreux fils de la même couleur courant côte à côte. Vous demandez à l'IA de suivre le fil connecté au « Port 7 ».
  • Le test de la spirale : Imaginez un seul escalier en colimaçon (de la forme d'une canne en sucre) avec des points colorés dessus. Vous demandez à l'IA de monter les marches du bas vers le haut.

Le résultat : L'IA commence correctement mais se perd presque immédiatement. S'il y a un autre fil ou un autre tour de spirale juste à côté de celui qu'elle est censée suivre, l'IA fait souvent un « saut » vers ce voisin. C'est comme un randonneur essayant de suivre un seul sentier à travers une forêt, mais lorsque deux chemins courent parallèlement sur quelques mètres, le randonneur met accidentellement le pied sur le mauvais et continue de marcher.

2. La distraction du « Jumeau »

L'article a découvert que l'IA n'échoue pas parce que la tâche est trop difficile ou parce qu'elle ne peut pas « voir ». Elle échoue à cause de la compétition locale.

Pensez-y ainsi : vous essayez d'écouter votre ami parler dans une pièce calme. Facile. Maintenant, imaginez que votre ami parle, mais juste à côté de lui se trouve un jumeau portant exactement les mêmes vêtements, parlant avec exactement la même voix, disant exactement les mêmes mots. Même si vous savez qui est votre ami, votre cerveau pourrait se confondre et commencer à écouter le jumeau.

Les chercheurs ont constaté que lorsque la ligne « voisine » ressemble beaucoup à la ligne « cible » (même couleur, même angle, même forme), l'attention de l'IA se fixe sur le voisin. L'IA ne « perd pas le fil » de manière brumeuse ; elle choisit activement le mauvais chemin parce que ce mauvais chemin semble trop tentant localement.

3. Pourquoi « réfléchir plus fort » ne sert à rien

Les chercheurs ont essayé de résoudre ce problème en demandant à l'IA de « réfléchir étape par étape » (une technique appelée raisonnement). Ils espéraient que l'IA ferait une pause, regarderait de plus près et dirait : « Attendez, c'est la mauvaise ligne. »

L'analogie : C'est comme demander à un touriste perdu de « réfléchir plus fort » pour savoir dans quelle direction aller. Au lieu de regarder la carte (la ligne visuelle), le touriste commence à deviner en se basant sur des règles générales comme : « Habituellement, les routes tournent ainsi », ou « Le soleil est à gauche, donc je devrais aller à droite ».

L'article a révélé que :

  • Le raisonnement n'a pas corrigé la vision : L'IA n'a pas commencé à tracer la ligne correctement. Au lieu de cela, elle a commencé à utiliser des « raccourcis » ou des devinettes. Par exemple, dans le test de la spirale, certaines IA ont arrêté de tracer la ligne et ont simplement deviné l'ordre des points en se basant sur la forme de la spirale (par exemple : « Le cercle intérieur est rouge, donc le suivant doit être bleu »).
  • C'est devenu plus coûteux : Lorsque l'IA a essayé de « réfléchir », elle a utilisé une quantité massive de puissance de calcul (comme un humain qui se parle à lui-même pendant 10 minutes juste pour dire « rouge, bleu, vert »), mais elle a quand même donné la mauvaise réponse.
  • Les instructions ont échoué : Même lorsque les chercheurs ont donné à l'IA un code de conduite strict disant : « Ne changez pas de ligne, même si elles se ressemblent », l'IA a quand même ignoré la règle et a sauté vers la mauvaise ligne.

4. Le mythe du « Grand Cerveau »

Habituellement, lorsque l'IA fait une erreur, nous supposons que c'est parce que le modèle est trop petit. Nous pensons : « Si nous rendons simplement le cerveau plus gros, il aura raison. »

Les chercheurs ont testé cela en utilisant des modèles allant du petit au massif (jusqu'à 235 milliards de paramètres).

  • Le résultat : Les modèles plus grands ont fait légèrement mieux, mais pas de beaucoup. Même les modèles les plus grands et les plus coûteux se sont encore perdus dans la « gare bondée ». Rendre le cerveau plus gros ne lui a pas donné une meilleure capacité à maintenir un seul fil dans un enchevêtrement.

5. Le chaos du monde réel

Enfin, les chercheurs ont testé cela sur des images du monde réel, comme des câbles emmêlés dans une usine ou des cartes de métro complexes.

  • La découverte : Le même problème s'est produit. Lorsque l'IA a essayé de tracer une ligne de métro à travers une station où trois lignes se croisent, ou de suivre un câble à travers un nœud, elle continuait à passer à la mauvaise ligne. Le comportement de « saut » n'était pas seulement un bug dans leurs tests fictifs ; il se produit aussi dans des situations réelles et désordonnées.

La conclusion

L'article conclut que les modèles d'IA actuels sont excellents pour reconnaître ce que sont les choses (par exemple : « C'est une carte de métro »), mais ils sont étonnamment mauvais pour suivre les choses (par exemple : « Tracez cette ligne spécifique de A à B »).

Ils manquent d'un « muscle » spécifique pour maintenir leur attention verrouillée sur un seul chemin lorsqu'un chemin d'apparence similaire se trouve juste à côté. Jusqu'à ce que nous construisions une IA avec un mécanisme dédié pour ignorer ces « jumeaux visuels », elle continuera à se perdre dans les jeux de suivi de ligne les plus simples.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →