← Derniers articles
💻 computer science

Unveiling Fine-Grained Visual Traces: Evaluating Multimodal Interleaved Reasoning Chains in Multimodal STEM Tasks

Cet article présente StepSTEM, une évaluation rigoureuse de niveau master comportant 283 problèmes et un nouveau cadre d'évaluation au niveau des étapes conçu pour évaluer le raisonnement intermodal fin dans les grands modèles de langage multimodaux, révélant que les modèles les plus avancés actuels reposent encore fortement sur des raccourcis textuels plutôt que sur une véritable intégration visuelle-textuelle.

Auteurs originaux : Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

Publié 2026-05-12
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jing Jin, Hao Liu, Yan Bai, Yihang Lou, Zhenke Wang, Tianrun Yuan, Juntong Chen, Yongkang Zhu, Fanhu Zeng, Xuanyu Zhu, Tao Feng, Yige Xu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'enseigner à un robot comment résoudre un puzzle scientifique difficile, comme déterminer comment un pont tient ou calculer l'orbite d'un satellite. Vous montrez au robot une image du pont et une description textuelle du problème.

Le Problème : Le Robot « Code de Triche »
Actuellement, les robots d'IA les plus intelligents (appelés Modèles de Langage Multimodaux de Grande Taille) ressemblent à des élèves excellents en lecture mais terribles en observation. Lorsqu'on leur soumet un problème scientifique accompagné d'un schéma, ils ignorent souvent l'image entièrement. Ils se contentent de lire le texte, de deviner la réponse en se basant sur leur mémoire et de déclarer : « Je l'ai résolu ! »

L'article qualifie cela de « effondrement modal ». C'est comme un élève passant un examen de mathématiques qui voit un graphique mais décide de simplement lire les mots de la question et d'ignorer le graphique parce que c'est plus facile. Les tests existants leur permettent souvent de s'en tirer parce qu'ils ne vérifient que si la réponse finale est correcte. Si le robot devine le bon nombre sans regarder l'image, le test dit : « Bien joué ! » Mais le robot n'a pas réellement appris à utiliser les indices visuels.

La Solution : STEPSTEM (Le « Professeur Strict »)
Les auteurs ont créé un nouveau test très strict appelé STEPSTEM. Imaginez-le comme un examen de « niveau master » pour les robots qui les force à montrer leur travail.

  1. Le Piège : Ils ont conçu 283 problèmes astucieux où vous ne pouvez pas les résoudre sans regarder l'image. Le texte seul est une impasse ; l'image détient la clé. C'est comme une chasse au trésor où la carte (l'image) est le seul moyen de trouver le trésor, et les indices (le texte) sont inutiles sans elle.
  2. L'Exigence : Le robot n'a pas seulement le droit de donner une réponse ; il doit parcourir la solution étape par étape, en alternant entre l'écriture de texte et le dessin d'images. C'est comme demander à un élève de résoudre un problème de physique en écrivant une explication, puis en dessinant un diagramme des forces, puis en écrivant l'étape suivante, puis en dessinant un nouveau diagramme, et ainsi de suite.
  3. La Notation : Au lieu de simplement vérifier le nombre final, les auteurs ont construit un « correcteur intelligent » qui examine chaque étape individuelle.
    • Le robot a-t-il regardé la bonne partie de l'image ? (Ils utilisent des « boîtes englobantes » comme des post-it numériques pour vérifier cela).
    • Le texte correspond-il au dessin ?
    • Le robot a-t-il suivi un chemin logique, ou a-t-il simplement sauté à une conclusion ?

Les Résultats : Les Robots Apprennent Encore
Lorsqu'ils ont soumis leurs robots de premier plan à ce test strict, les résultats furent surprenants :

  • Les Experts « Texte Uniquement » : Les robots les plus puissants qui ne peuvent écrire que du texte (comme Claude Opus 4.6 et Gemini 3.1 Pro) ont obtenu environ 38 % de bonnes réponses. Ils étaient bons dans les parties textuelles mais ont complètement échoué dans les parties de dessin car ils ne peuvent littéralement pas dessiner.
  • Les Robots « Tout-terrain » : Les robots capables à la fois de lire et de dessiner (comme Gemini 2.5 Flash Image) se sont mieux débrouillés pour dessiner, mais ils ont toujours eu du mal à obtenir la bonne réponse finale. Ils pouvaient dessiner une image, mais ils se trompaient souvent sur la logique.
  • Le Grand Écart : L'article a révélé que même les meilleurs robots sont loin d'être de véritables « penseurs visuels ». Ils dépendent trop du texte et n'ont pas appris à véritablement combiner la vision et la réflexion.

L'Essentiel
L'article soutient que nous devons cesser de simplement demander aux robots « Quelle est la réponse ? » et commencer à demander : « Montrez-moi comment vous y êtes arrivé. »

Imaginez un détective. Si un détective résout un crime mais n'a pas examiné les empreintes digitales ou les photos de la scène de crime, nous ne ferions pas confiance à sa solution, même s'il a deviné le bon nom. STEPSTEM est l'outil qui force le détective IA à examiner les preuves (les images) et à expliquer comment ces preuves ont conduit à la conclusion, étape par étape.

Les auteurs concluent que, bien que l'IA devienne plus intelligente, elle a encore un long chemin à parcourir avant de pouvoir véritablement « voir » et « réfléchir » aux problèmes scientifiques comme le ferait un expert humain. Ils espèrent que ce nouveau test aidera les chercheurs à construire des robots qui ne se contentent pas de deviner, mais qui comprennent réellement le monde visuel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →