← Derniers articles
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

GroundBench est un benchmark contrefactuel et factorisé conçu pour isoler et diagnostiquer les causes spécifiques des échecs d'affordance des modèles vision-langage en démontrant que de nombreux succès de mise en correspondance apparents sont en réalité pilotés par des associations catégorie-action plutôt que par un véritable raisonnement visuel ou mécanique.

Auteurs originaux : Sarthak Sattigeri

Publié 2026-09-15
📖 8 min de lecture🧠 Analyse approfondie

Auteurs originaux : Sarthak Sattigeri

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un bras robotique tendant la main vers une tasse de café. Pour réussir, la machine doit résoudre trois énigmes distinctes simultanément : elle doit décider quelle partie de la tasse importe (l'anse, et non le rebord), localiser exactement où se trouve cette partie dans le monde visuel, et comprendre quelle action cette partie invite (saisir, et non pousser). Pendant des années, les chercheurs ont testé des systèmes d'intelligence artificielle sur ces tâches en leur demandant de décrire ce qu'un robot devrait faire avec un objet. Une étude complémentaire récente a suggéré que si vous dites simplement à l'IA le nom de la partie cible — en disant par exemple « attrape l'anse » au lieu de simplement « attrape la tasse » — les performances du système bondissent de manière spectaculaire. Cela a conduit à une conclusion pleine d'espoir : l'IA apprenait enfin à regarder l'image et à raisonner sur la mécanique physique de l'objet.

Cependant, une nouvelle enquête appelée GroundBench suggère que cette conclusion est peut-être prématurée. Les chercheurs derrière cette étude, dirigés par Sattigeri de l'Université de Manipal à Jaipur, soupçonnaient que l'IA n'apprenait pas réellement à mieux voir l'objet. Au lieu de cela, ils émettaient l'hypothèse que le système pourrait s'appuyer sur un raccourci : simplement mémoriser que certains mots, comme « anse », sont presque toujours associés à l'action « saisir », indépendamment de ce que montre réellement l'image. Pour tester cela, ils ont construit un nouveau benchmark rigoureux conçu pour séparer la capacité à trouver une partie dans une image de la capacité à deviner une action basée sur un mot. Ils ne se sont pas contentés de demander à l'IA d'accomplir une tâche ; ils ont systématiquement supprimé l'information, pièce par pièce, pour voir quel indice spécifique était réellement le moteur du succès.

Les chercheurs ont construit une série de six scénarios différents, ou conditions, pour tester trois versions différentes d'un modèle d'intelligence artificielle de pointe. Dans le premier scénario, l'IA voyait uniquement l'image d'un objet, comme un clavier ou une porte, sans instructions textuelles. Dans le deuxième, ils ont ajouté le nom de l'objet, tel que « clavier ». Dans le troisième, ils ont nommé la partie spécifique, comme « la barre d'espace ». Dans le quatrième, ils ont fourni l'emplacement exact de la partie sur l'écran — un point précis et un cadre autour de celui-ci — mais ont délibérément retenu le nom de la partie. Dans le cinquième, ils ont donné à la fois le nom et l'emplacement. Enfin, dans le sixième, ils ont ajouté des détails techniques sur la façon dont l'objet se déplace, comme si une articulation est une charnière ou un coulisseau.

Les résultats ont été frappants et contre-intuitifs. Lorsque les chercheurs ont donné à l'IA l'emplacement exact de la partie cible mais ont refusé de lui dire comment cette partie s'appelait, les performances du système se sont effondrées. À travers les trois modèles testés, la précision du choix de l'action correcte est tombée au niveau d'une supposition aléatoire, voire moins. Un modèle, bien que doté de l'emplacement d'un bouton mais privé de son nom, n'a obtenu que 0,26, alors qu'une simple base de référence ignorant totalement l'image avait obtenu 0,53. L'IA pouvait reproduire parfaitement l'emplacement qui lui était montré, plaçant son « doigt » exactement là où les chercheurs pointaient, pourtant elle échouait à comprendre quoi faire de cet emplacement. C'était comme si le robot pouvait voir le bouton mais n'avait aucune idée que les boutons sont destinés à être pressés.

En contraste total, lorsque les chercheurs ont donné à l'IA le nom de la partie mais ont retenu sa localisation, la performance a grimpé en flèche. Les mêmes modèles qui avaient échoué avec les données de localisation uniquement ont bondi à des taux de précision compris entre 0,68 et 0,74 lorsqu'on leur disait que la partie était un « bouton » ou une « porte », même sans voir où elle se trouvait. Ce schéma s'est vérifié partout : dès que l'IA recevait le nom de la catégorie de la partie, elle pouvait presque toujours deviner l'action correcte. Les chercheurs ont constaté que dans leur ensemble d'objets soigneusement sélectionnés, le nom de la partie seul suffisait à déterminer la réponse. L'IA ne regardait pas l'image pour comprendre la physique ; elle lisait le mot et se rappelait une association apprise.

Pour confirmer cette suspicion, les chercheurs ont mené un test de contrôle où ils ont supprimé l'image entière et ont demandé aux modèles de répondre sur la base du texte seul. Pour le modèle le plus avancé testé, supprimer l'image n'a fait aucune différence sur ses performances dans les conditions où le nom de la partie était fourni. Le modèle obtenait un score tout aussi bon, voire légèrement meilleur, sans voir l'objet. Cela constituait une preuve solide que le système n'utilisait pas l'ancrage visuel — le processus consistant à connecter des mots à des pixels spécifiques dans une image — mais s'appuyait plutôt sur un raccourci textuel. L'IA savait qu'une « porte à charnière » implique « tirer » et un « bouton coulissant » implique « pousser » parce qu'elle avait vu ces associations dans ses données d'entraînement, et non parce qu'elle comprenait la mécanique de la porte ou du bouton spécifique devant elle.

L'étude a également testé si l'IA pouvait suivre une question piège. Les chercheurs ont pris l'image d'un objet possédant plusieurs parties, comme un clavier avec de nombreuses touches, et ont demandé à l'IA d'effectuer une action sur une partie non standard, comme une touche spécifique qui est rarement utilisée. Ils voulaient voir si l'IA regarderait réellement cette touche spécifique ou si elle reviendrait par défaut à l'action la plus courante pour l'objet entier. Bien que les modèles aient généralement suivi la nouvelle instruction, ils ont éprouvé des difficultés significatives lorsque l'action demandée était inhabituelle, comme soulever une partie verticalement. Dans ces cas, les modèles revenaient souvent à l'action standard, suggérant qu'ils s'appuyaient toujours sur leurs associations les plus communes plutôt que d'analyser réellement la scène visuelle.

Peut-être la découverte la plus surprenante fut que l'ajout d'informations n'aidait pas toujours. Lorsque les chercheurs ont donné à l'IA l'emplacement et le nom de la partie, puis ont ajouté des descriptions mécaniques détaillées sur la façon dont l'objet se déplaçait, la performance a en réalité diminué. Les modèles ne se sont pas améliorés ; ils sont devenus moins précis. Cela suggère que l'information supplémentaire a confondu le système ou l'a détourné du raccourci simple et efficace du simple nom de la partie. Les chercheurs ont conclu que pour ces tâches spécifiques, plus de données ne signifiait pas un meilleur raisonnement.

Les implications de ce travail sont significatives pour le domaine de la robotique et de l'intelligence artificielle. Cela révèle que des scores élevés sur certains tests peuvent être trompeurs. Une IA peut apparaître comme un maître du raisonnement physique alors qu'elle n'est en fait qu'un maître des associations de mots. Les chercheurs ont trouvé que l'amélioration spectaculaire observée dans les études précédentes, où nommer une partie augmentait la précision de manière importante, n'était probablement pas due au fait que l'IA apprenait soudainement à mieux voir. Au contraire, c'était parce que le nom lui-même contenait la réponse. L'étude ne prétend pas que ces modèles sont incapables de raisonnement visuel, mais elle montre qu'ils ne l'utilisaient pas sous ces conditions spécifiques.

GroundBench sert d'outil de diagnostic, une façon d'éplucher les couches de la performance d'une IA pour voir ce qui se passe réellement en dessous. En séparant la localisation visuelle du nom sémantique, les chercheurs ont exposé un fossé entre ce que les modèles semblaient faire et ce qu'ils faisaient réellement. Ils ont découvert que lorsque le nom de la partie était retiré, les modèles ne pouvaient pas trouver l'action, même si l'emplacement était parfaitement clair. Cela suggère que pour ces systèmes, le chemin vers un véritable raisonnement mécanique est plus long qu'on ne le pensait. Ils n'ont pas encore appris à regarder un objet et à comprendre sa fonction ; ils ont appris à écouter un mot et à deviner la fonction. L'étude ne se termine pas par une déclaration d'échec, mais par une carte plus claire de la direction que doit prendre le travail : construire des systèmes capables de véritablement connecter les mots qu'ils entendent avec le monde physique qu'ils voient, plutôt que de compter sur les raccourcis qui les ont si bien servis jusqu'à présent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →