← Derniers articles
💬 NLP

Do AI Models Perform Human-like Abstract Reasoning Across Modalities?

Cet article démontre que l'évaluation du raisonnement abstrait de l'IA uniquement sur la base de la précision est trompeuse, car elle surestime les capacités dans les tâches textuelles où les modèles s'appuient sur des raccourcis superficiels et les sous-estime dans les tâches visuelles où les modèles saisissent souvent les abstractions voulues malgré un échec de leur application correcte.

Auteurs originaux : Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Publié 2026-02-04
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Claas Beger, Ryan Yi, Shuhao Fu, Kaleda Denton, Arseny Moskvichev, Sarah W. Tsai, Sivasankaran Rajamanickam, Melanie Mitchell

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous êtes un enseignant donnant un casse-tête à un élève. Le casse-tête montre quelques exemples de la façon dont un motif change (comme « déplace le bloc rouge vers la gauche ») et demande ensuite à l'élève d'appliquer cette même règle à une nouvelle image, encore non vue.

Pendant longtemps, nous avons testé les IA sur ces casse-têtes en utilisant un « bulletin de notes » qui compte seulement combien de fois l'IA trouve la réponse finale. Si l'IA trouve la bonne image, nous lui donnons un A+.

Cette étude pose une question plus profonde : L'IA a-t-elle réellement compris la règle, ou a-t-elle simplement eu de la chance en repérant un truc bizarre ?

Voici l'histoire de ce que les chercheurs ont découvert, expliquée simplement :

1. Les deux façons de passer le test

Les chercheurs ont testé les meilleurs modèles d'IA (comme o3 d'OpenAI, Claude et Gemini) de deux manières différentes :

  • Le Mode Texte : Ils ont fourni le casse-tête à l'IA sous la forme d'une liste de nombres et de mots (par exemple, « La grille 1 a un carré rouge en 2,2... »).
  • Le Mode Visuel : Ils ont montré à l'IA une véritable image du casse-tête, tout comme un humain le verrait.

2. La surprise du « Texte » : des scores élevés, une compréhension superficielle

Lorsque l'IA a passé le test en Mode Texte, elle a réalisé des performances incroyables. En fait, la meilleure IA (o3) a obtenu un score plus élevé que l'humain moyen.

Mais attention : les chercheurs ont demandé à l'IA d'expliquer comment elle avait résolu le casse-tête.

  • Les humains expliquent généralement cela en utilisant le concept réel, comme « Supprimer les objets du haut et du bas ».
  • L'IA a souvent donné des explications qui étaient techniquement correctes pour les exemples spécifiques présentés, mais qui passaient à côté de l'idée générale.

L'analogie : Imaginez un élève passant un examen de mathématiques. Le professeur demande : « Combien font 2 + 2 ? » L'élève répond « 4 ». Le professeur demande : « Comment es-tu arrivé à ce résultat ? » L'élève répond : « J'ai regardé l'horloge, et les aiguilles étaient sur 4, donc j'ai deviné 4 ». La réponse était juste, mais le raisonnement était un « raccourci ». L'IA faisait cela constamment. Elle repérait des motifs accidentels dans les nombres (comme « la couleur rouge est toujours le chiffre 3, donc je vais supprimer le chiffre 3 ») plutôt que de comprendre le concept d'« objet ».

Le verdict : En mode texte, les scores élevés de l'IA surévaluaient sa véritable intelligence. Elle était douée pour deviner, mais pas toujours douée pour raisonner.

3. La surprise du « Visuel » : des scores bas, un génie caché

Lorsque les chercheurs sont passés au Mode Visuel (en montrant des images), les scores de l'IA se sont effondrés. Elle se trompait de l'image finale beaucoup plus souvent que les humains.

Cependant, les chercheurs ont examiné à nouveau les explications de l'IA.
Ils ont trouvé quelque chose de surprenant : même quand l'IA se trompait sur l'image finale, son explication de la règle était souvent correcte !

L'analogie : Imaginez un architecte brillant qui peut décrire parfaitement comment construire une maison (« Posez les briques en cercle, puis ajoutez un toit »). Mais, quand il essaie réellement de poser les briques, il continue de les faire tomber ou de les placer au mauvais endroit parce qu'il est maladroit.
L'IA en mode visuel était comme cet architecte. Elle comprenait parfaitement le concept abstrait (la « règle »), mais elle avait du mal à « voir » l'image assez clairement pour l'appliquer correctement. Elle ne pouvait pas déterminer exactement la taille de la grille ou l'emplacement des objets.

Le verdict : En mode visuel, les faibles scores de l'IA sous-évaluaient sa véritable intelligence. Elle comprenait très bien la logique, mais elle échouait sur la partie « perception » du travail.

4. L'effet « Outil »

Les chercheurs ont également donné une « calculatrice » à l'IA (du code Python) pour l'aider.

  • En Mode Texte : La calculatrice n'a pas beaucoup aidé. L'IA était déjà bonne en logique, mais mauvaise avec les raccourcis.
  • En Mode Visuel : La calculatrice a beaucoup aidé. Lorsque l'IA a pu utiliser du code pour « regarder » l'image et compter les pixels, ses scores ont augmenté. Cela a prouvé que l'IA n'était pas « stupide » sur le plan de la logique ; elle avait simplement besoin d'aide pour voir l'image.

La grande conclusion

Si l'on ne regarde que le score final (le « A+ »), on pourrait penser que l'IA est un génie en mode texte mais un échec en mode visuel.

Mais quand on examine comment elles réfléchissent :

  • En Texte : Elles utilisent souvent des « tricheries » avec des raccourcis astucieux qui ne fonctionnent pas dans le monde réel.
  • En Visuel : Ce sont des génies « maladroits » qui comprennent les règles mais ne parviennent pas tout à fait à les exécuter.

L'étude conclut que pour savoir si une IA devient réellement « humaine », nous ne pouvons pas nous contenter de vérifier si la réponse est correcte. Nous devons aussi vérifier si le raisonnement est correct. Sinon, nous sommes soit en train de surestimer leurs capacités textuelles, soit de sous-estimer leur potentiel visuel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →