← Derniers articles
💻 computer science

Investigating Relational Reasoning in VLMs

Cet article examine si les modèles vision-langage comprennent réellement les relations visuelles ou s'ils s'appuient sur des raccourcis linguistiques en utilisant un ensemble de données géométriques synthétiques et le modèle Qwen3-VL-4B, révélant que les VLM actuels combinent un véritable raisonnement visuel avec des stratégies principalement ancrées dans des indices linguistiques.

Auteurs originaux : Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

Publié 2026-08-25
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Adhithya Laxman Ravi Shankar Geetha, Aulia Kharis Rakhmasari, Haleema Ramzan, Xander Yap

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le paysage moderne de l'intelligence artificielle, une nouvelle génération d'ordinateurs a appris à voir et à parler simultanément. Ces systèmes, connus sous le nom de modèles de vision-langage, peuvent regarder une photographie et décrire son contenu, répondre à des questions sur ce qu'ils voient, ou même résoudre des énigmes basées sur une image. Pour l'observateur humain, ils semblent posséder une véritable compréhension du monde visuel, semblable à une personne capable de jeter un regard sur une scène et de saisir instantanément comment les objets sont liés les uns aux autres. Cependant, une question fondamentale reste sans réponse : ces machines comprennent-elles réellement les relations spatiales et les connexions entre les objets, ou ne sont-elles que de habiles moteurs de reconnaissance de formes s'appuyant sur des astuces linguistiques et des suppositions statistiques ? Cette incertitude est importante car, si ces systèmes ne font que simuler la compréhension par des raccourcis, ils pourraient échouer de manière imprévisible face à des situations ne correspondant pas à leurs données d'entraînement, entraînant des erreurs dans des applications critiques.

Une équipe de chercheurs s'est donné pour mission de découvrir les rouages internes de ces modèles en dépouillant la complexité du monde réel pour la remplacer par un environnement synthétique contrôlé. Ils ont créé un ensemble de données personnalisé composé de milliers d'images simples, chacune présentant un petit nombre de formes géométriques de base comme des cercles, des carrés et des triangles disposés selon des motifs spécifiques. Ces formes se voyaient attribuer des couleurs et des tailles distinctes et, dans certains cas, des flèches étaient dessinées pour les connecter explicitement, tandis que dans d'autres, la connexion n'était suggérée que par leur position relative. Les chercheurs ont ensuite posé une série de questions précises à un modèle de vision-langage moderne, lui demandant d'identifier le nombre de formes, de reconnaître des couleurs spécifiques ou de déterminer la direction d'une flèche entre deux objets. En comparant les réponses du modèle aux faits connus des images synthétiques, ils ont pu mesurer exactement la performance de la machine.

Les résultats ont révélé une division marquée entre ce que le modèle pouvait faire facilement et ce qu'il peinait à comprendre. Lorsqu'on lui posait des questions de reconnaissance simples, comme compter le nombre total de formes ou identifier si un carré vert était présent, le modèle affichait une précision quasi parfaite, dépassant souvent les quatre-vingt-seize pour cent. Il semblait avoir une emprise solide sur les éléments tangibles de l'image. Cependant, dès que les questions nécessitaient que le modèle comprenne des relations sans indices visuels explicites, ses performances chutaient considérablement. Par exemple, lorsqu'on lui demandait d'identifier quels objets étaient connectés par une flèche sans que la flèche ne soit dessinée, ou de décrire la position d'une forme par rapport à une autre en se basant uniquement sur leur disposition, la précision du modèle tombait autour de soixante pour cent ou moins. Curieusement, lorsque la requête fournissait des marqueurs visuels explicites, tels que demander la direction d'une flèche dessinée, le modèle maintenait une précision élevée de plus de quatre-vingt-douze pour cent. Cela suggérait que la machine ne construisait pas une carte mentale cohérente de la scène, mais s'appuyait plutôt fortement sur les mots spécifiques utilisés dans la question et sur les marqueurs visuels explicites fournis.

Pour déterminer si le modèle « voyait » réellement les relations ou s'il ne faisait que deviner à partir du langage, les chercheurs ont mené un test rigoureux en modifiant les images elles-mêmes. Ils ont créé des versions modifiées des images originales où ils supprimaient numériquement un élément spécifique, tel qu'une forme ou une flèche, puis posaient à nouveau les mêmes questions. Si le modèle raisonnait véritablement sur les preuves visuelles, la suppression d'un élément clé de l'image aurait dû faire chuter sa précision. Dans certains cas, c'est exactement ce qui s'est produit ; lorsqu'on demandait au modèle de compter les formes ou de suivre la direction d'une flèche, la suppression de l'élément visuel pertinent faisait chuter sa performance de près de vingt-cinq pour cent. Cela indiquait que pour ces tâches, le modèle regardait effectivement l'image, mais qu'il mélangeait aussi ces données visuelles avec des biais internes qui le rendaient fragile lorsque la scène changeait.

Plus surprenant encore, les chercheurs ont découvert que pour d'autres types de questions, la suppression d'éléments visuels améliorait la performance du modèle ou la laissait inchangée. Lorsqu'on l'interrogeait sur la position relative des formes ou sur l'existence d'une connexion sans flèche, le modèle obtenait de meilleures réponses lorsque les preuves visuelles étaient obscurcies. Ce résultat contre-intuitif, que l'article note comme « surprenant » et « contredisant directement le raisonnement visuel », suggère fortement que le modèle n'utilisait pas les données visuelles pour résoudre ces problèmes. Au lieu de cela, il s'appuyait sur des motifs statistiques appris lors de ses données d'entraînement, devinant essentiellement la réponse en fonction de la façon dont la question était formulée plutôt qu'en fonction de ce qui se trouvait réellement dans l'image. La machine ne raisonnait pas sur l'espace ; elle récitait une réponse probable basée sur des indices linguistiques.

En scrutant l'intérieur des couches de traitement du modèle, les chercheurs ont retracé la manière dont l'information circulait de l'entrée d'image initiale jusqu'à la réponse finale. Ils ont constaté que les premières couches du modèle étaient très douées pour repérer des détails simples comme la présence d'une couleur ou d'une forme spécifique. À mesure que l'information progressait plus profondément dans le système, le modèle devenait meilleur pour compter et identifier des relations grossières. Cependant, les couches plus profondes échouaient à encoder de manière cohérente les relations complexes et abstraites entre les objets, telles que la direction précise d'une flèche ou l'agencement spatial des éléments sans marqueurs explicites. L'étude conclut que, bien que ces systèmes puissants puissent obtenir des scores élevés sur de nombreuses tâches visuelles, leur compréhension est strictement limitée à ce qui est explicitement observable. Ils ne font pas preuve d'une véritable compréhension visuelle, s'appuyant plutôt sur une stratégie hybride qui combine une perception visuelle réelle avec des raccourcis linguistiques. Cette découverte met en évidence une limitation critique de l'intelligence artificielle actuelle, suggérant qu'une véritable compréhension visuelle exige plus que le simple traitement de pixels et de mots ; elle exige une forme de raisonnement plus profonde et plus robuste que ces modèles n'ont pas encore atteinte.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →