← Derniers articles
🤖 AI

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

L'article introduit StemBind, un banc d'essai de diagnostic qui révèle un « écart de liaison » persistant dans les grands modèles de langage multimodaux où, malgré l'identification correcte des règles visuelles, ils échouent fréquemment à mapper ces règles à des instances spécifiques lors du raisonnement visuel abstrait, une limitation que ni la mise à l'échelle des modèles ni les modes de pensée explicites ne parviennent actuellement à résoudre.

Auteurs originaux : Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

Publié 2026-06-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous passiez un test de puzzles visuels très difficile, du genre de ceux utilisés pour mesurer l'intelligence humaine (pensez aux matrices progressives de Raven). Vous regardez une grille de formes, vous déduisez la règle cachée qui relie les formes, et vous choisissez la pièce correcte pour terminer le motif.

Maintenant, imaginez une IA super intelligente passant ce test. Voici la chose étrange que la recherche STEMBIND a découverte : L'IA connaît souvent parfaitement la règle, mais choisit quand même la mauvaise réponse.

C'est comme un étudiant qui peut réciter la définition exacte d'une formule mathématique du manuel et expliquer précisément comment elle fonctionne, mais qui échoue à injecter les nombres dans la formule pour obtenir le résultat final.

Voici une décomposition de ce que les chercheurs ont découvert, en utilisant des analogies simples :

1. Le Problème : Le fossé de la « perte de traduction »

Les tests d'IA actuels regardent généralement seulement la réponse finale : « Avez-vous eu juste ou faux ? ». C'est comme un professeur qui noterait un test de mathématiques en ne regardant que le chiffre final, ignorant si l'étudiant a réellement compris les étapes.

Les chercheurs ont construit un nouveau test appelé STEMBIND pour regarder à l'intérieur du cerveau de l'IA. Ils ont posé à l'IA trois questions sur le même puzzle :

  1. Perception : « Quelles formes vois-tu ? » (Peux-tu voir les ingrédients ?)
  2. Règle : « Quel est le motif ? » (Connais-tu la recette ?)
  3. Complet : « Quelle pièce complète le puzzle ? » (Peux-tu cuisiner le plat ?)

La découverte choc :
Sur 22 des 24 modèles d'IA différents testés, l'IA pouvait décrire correctement les formes et nommer correctement la règle. Mais lorsqu'on lui demandait de choisir la réponse finale, elle échouait.

  • Analogie : Imaginez un chef qui peut décrire parfaitement une recette de gâteau et lister chaque ingrédient, mais quand on lui demande de cuire le gâteau, il met le gâteau dans le four à l'envers. Il connaît la théorie, mais il ne peut pas lier cette théorie à l'action spécifique de la cuisson.

2. Le coupable spécifique : L'étape de la « Correspondance » (Mapping)

Les chercheurs ont décomposé le processus de pensée en quatre étapes (basées sur une célèbre théorie de la psychologie) :

  • S1 (Encodage) : Voir les formes.
  • S2 (Inférence) : Déduire la règle.
  • S3 (Correspondance/Mapping) : <--- L'endroit problématique Connecter la règle aux choix de réponses spécifiques.
  • S4 (Application) : Choisir la réponse finale.

Ils ont découvert que l'IA reste bloquée à S3. C'est comme avoir une carte et une destination, mais oublier quelle rue mène à quel bâtiment. L'IA sait que la règle est « pivoter de 90 degrés », mais face aux quatre options, elle n'arrive pas à déterminer laquelle est le résultat de cette rotation.

3. Ce qui ne fonctionne pas pour corriger le problème

Les chercheurs ont testé deux manières courantes dont les humains pensent que l'IA s'améliore :

  • Augmenter la taille de l'IA (Scaling) : Ils ont essayé d'utiliser des versions beaucoup plus grandes et puissantes de l'IA.
    • Résultat : L'IA plus grande devenait meilleure pour voir les formes et nommer les règles, mais elle échouait toujours à choisir la bonne réponse finale. C'est comme donner une plus grande bibliothèque à un étudiant ; il connaît plus de faits, mais il ne peut toujours pas résoudre le problème spécifique.
  • Faire « réfléchir » l'IA (Mode de réflexion) : Ils ont laissé l'IA écrire ses pensées avant de répondre (comme montrer son raisonnement).
    • Résultat : Cela a en fait rendu les choses pires. L'IA est devenue meilleure pour décrire l'image, mais elle est devenue moins bonne pour choisir la règle et la réponse finale.
    • Analogie : C'est comme un étudiant qui commence à se parler à lui-même en résolvant un problème. Il décrit magnifiquement l'image, mais le bavardage supplémentaire le confond tellement qu'il oublie la règle et choisit la mauvaise réponse.

4. Pourquoi cela importe

L'article soutient que nous devons arrêter de simplement classer les modèles d'IA par leur score final. Nous devons diagnostiquer ils tombent en panne.

La conclusion principale est que les modèles d'IA actuels sont excellents pour voir et comprendre les règles, mais ils sont terribles pour appliquer ces règles à des instances spécifiques. Ils se « perdent » entre la connaissance de la règle et le choix de la réponse.

En bref : l'IA n'est pas aveugle, et elle n'est pas stupide concernant la logique. Elle a simplement un bug dans l'étape de « traduction » où elle tente de transformer une règle connue en un choix spécifique. Corriger ce fossé de « liaison » (binding) est le prochain grand défi pour les chercheurs en IA.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →