← Derniers articles
🤖 machine learning

VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs

Le benchmark VRIQ révèle que les modèles de vision-langage actuels sont peu performants sur les tâches de raisonnement visuel, principalement en raison de limitations de perception plutôt que de déficits de raisonnement, avec une précision allant de 28 % sur les puzzles abstraits à 45 % sur les images naturelles.

Auteurs originaux : Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Publié 2026-02-06
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Tina Khezresmaeilzadeh, Jike Zhong, Konstantinos Psounis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une équipe de robots incroyablement intelligents capables de lire des livres et de regarder des images. Vous voulez savoir s'ils sont vraiment « intelligents » ou s'ils sont simplement très doués pour deviner. Pour le découvrir, les auteurs de cet article ont construit un test spécial appelé VRIQ (Visual Reasoning IQ - Quotient Intellectuel de Raisonnement Visuel).

Considérez le VRIQ comme une immense « boîte à énigmes » numérique conçue pour piéger ces robots. La boîte contient deux types d'énigmes :

  1. Énigmes Abstraites : Elles ressemblent aux cartes classiques des tests de QI avec des formes, des lignes et des motifs étranges. Il n'y a pas d'objets du monde réel ici, juste des symboles.
  2. Énigmes Naturelles : Elles utilisent des photos réelles de choses quotidiennes, comme des pommes, des voitures ou des personnes, mais posent les mêmes questions de logique complexes.

La Grande Surprise : Les Robots sont « Aveugles »

Lorsque les chercheurs ont testé les modèles d'IA les plus intelligents disponibles (y compris les célèbres modèles d'OpenAI et de Google), ils ont fait une découverte choquante.

  • Sur les Énigmes Abstraites : Les robots ont obtenu des résultats presque aussi mauvais que s'ils devinaient au hasard. Leur score moyen était d'environ 28 % (là où 25 % correspond à la chance pure). C'est comme un étudiant qui aurait mémorisé le dictionnaire mais qui serait incapable de lire une seule phrase.
  • Sur les Énigmes Naturelles : Ils ont un peu mieux réussi (environ 45 %), mais ils étaient encore loin d'être parfaits.

L'article révèle que le problème n'est pas que les robots sont mauvais en raisonnement. Le problème est qu'ils sont mauvais en perception.

Le Travail de Détective : Pourquoi ont-ils échoué ?

Pour comprendre exactement où les robots échouaient, les chercheurs ont agi comme des détectives. Ils ne se sont pas contentés de demander : « Quelle est la réponse ? ». Ils ont décomposé chaque énigme en étapes minuscules en utilisant des « questions de sondage ».

Imaginez un robot échouant à une énigme où il doit trouver la forme qui est l'intruse. Les chercheurs ont demandé :

  • Sondage de Perception : « Combien de cercles rouges vois-tu ? »
  • Sondage de Raisonnement : « S'il y a 3 cercles rouges et que la règle est "en retirer un", que reste-t-il ? »

Les Résultats de l'Enquête :

  • 56 % du temps : Le robot a échoué parce qu'il n'a pas pu voir les bases (par exemple, il n'a pas pu compter les cercles ou déterminer dans quelle direction une forme pointait).
  • 43 % du temps : Le robot n'a pas pu voir les bases et n'a pas pu comprendre la logique.
  • Seulement 1 % du temps : Le robot a tout vu parfaitement, mais a simplement fait une erreur de logique.

La Métaphore : C'est comme donner une recette de gâteau à un chef. Le chef (l'IA) connaît parfaitement la logique de la pâtisserie. Mais si le chef a les yeux bandés et ne peut pas voir qu'il n'y a que 2 œufs au lieu de 4, le gâteau sera raté. L'échec n'était pas la logique de la cuisine ; c'était l'incapacité de voir les ingrédients.

Le « Twist » des Outils

Les chercheurs ont tenté une dernière chose. Ils ont donné à un modèle d'IA spécifique (le o3 d'OpenAI) un ensemble d'outils numériques, comme une loupe, des ciseaux (pour recadrer les images) et une calculatrice. Ce modèle était autorisé à « réfléchir avec des images » en manipulant activement l'image avant de répondre.

Le Résultat : Ce robot utilisant des outils a décollé. Il est passé d'un score de 28 % à plus de 50 % sur les énigmes abstraites et même 80-100 % sur les énigmes naturelles. Cela prouve que si vous donnez au robot de meilleurs « yeux » (des outils pour voir clairement), son « cerveau » (le raisonnement) fonctionne bien mieux.

L'Essentiel

L'article conclut que les modèles d'IA actuels n'échouent pas par manque d'intelligence ou de logique. Ils échouent parce qu'ils ont du mal à percevoir précisément le monde visuel. Ils ne parviennent pas à compter les objets de manière fiable, à comprendre la profondeur 3D ou à déterminer la rotation d'un objet.

Pour que l'IA soit véritablement intelligente en matière de raisonnement visuel, nous n'avons pas seulement besoin de cerveaux plus gros ; nous devons lui donner de meilleurs yeux.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →