← Derniers articles
💬 NLP

MM-THEBench: Do Reasoning MLLMs Think Reasonably?

Cet article présente MM-THEBench, un benchmark complet conçu pour évaluer les hallucinations dans les étapes de raisonnement intermédiaire des grands modèles de langage multimodaux, comblant ainsi la lacune des évaluations existantes qui négligent les processus de pensée internes des modèles de raisonnement post-entraînés.

Auteurs originaux : Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Publié 2026-02-02
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhidian Huang, Zijun Yao, Ji Qi, Shangqing Tu, Junxian Ma, Jinxin Liu, Weichuan Liu, Xiaoyin Che, Lei Hou, Juanzi Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une équipe de détectives surdoués et multi-talentueux (ce sont les Modèles de Langage de Grande Taille Multimodaux de Raisonnement, ou MLLM). Ces détectives sont excellents pour regarder une image, lire un graphique ou regarder une vidéo, puis résoudre un mystère.

Autrefois, ces détectives se contentaient de crier leur réponse finale : « Le suspect est le majordome ! » Mais récemment, ils ont été entraînés à penser à voix haute avant de parler. Ils écrivent une longue liste d'indices et d'étapes logiques (appelées Chaînes de Pensée ou CoT pour Chain-of-Thought) afin d'expliquer comment ils sont parvenus à cette conclusion.

Le problème ? Parfois, même si le détective rédige une longue et sophistiquée liste d'étapes, certaines de ces étapes sont des mensonges totaux (des hallucinations). Pourtant, par pure chance ou en ignorant les mensonges, ils finissent quand même par crier la bonne réponse finale.

Cette publication présente un nouvel outil appelé MM-THEBENCH pour attraper ces détectives en flagrant délit de mensonge durant leur processus de réflexion.

Le nouveau terrain d'entraînement des détectives : MM-THEBENCH

Considérez MM-THEBENCH comme un « Test de Détection de Mensonges » de haute technologie, spécifiquement conçu pour le processus de pensée, et non seulement pour la réponse finale.

1. Les trois types de mensonges (La Taxonomie)
Les auteurs ont réalisé que lorsqu'un détective ment, cela tombe généralement dans l'une des trois catégories suivantes. Ils ont créé une liste de contrôle pour les repérer :

  • Le mensonge de la « Fausse Mémoire » (Connaissance) : Le détective invente un fait appris à l'école. Exemple : « Je sais avec certitude que la Tour Eiffel est à Londres. » (Ce n'est pas le cas).
  • Le mensonge de la « Mauvaise Vue » (Perception) : Le détective regarde la photo mais voit des choses qui n'existent pas. Exemple : « Je vois une voiture rouge dans l'image », alors que la voiture est en réalité bleue. (Mauvaise perception).
  • Le mensonge du « Mauvais Raisonnement » (Logique) : Le détective voit les bonnes choses mais connecte mal les points. Exemple : « La voiture est bleue, et les voitures bleues sont rapides, donc cette voiture est une Ferrari. » (Mauvaise logique).

2. Le système de notation (Rubriques)
Au lieu de simplement vérifier si la réponse finale est juste ou fausse, MM-THEBENCH décompose la pensée du détective en de minuscules étapes atomiques.

  • Imaginez un problème mathématique. La solution de référence (« Gold Standard ») comporte 5 étapes spécifiques.
  • Le système vérifie le processus de pensée de 20 étapes du détective par rapport à ces 5 étapes de référence.
  • Il demande : « As-tu réellement vu la voiture ? Connaissais-tu la règle sur les triangles ? As-tu fait le calcul correctement ? »
  • Il attribue un score pour chaque étape, marquant précisément l'endroit où le « mensonge » s'est produit.

Ce qu'ils ont découvert (Les Résultats)

Les auteurs ont testé 14 des modèles de détectives les plus intelligents au monde (incluant des noms célèbres comme GPT-5, Claude et Gemini) en utilisant ce nouveau test. Voici ce qu'ils ont découvert :

1. Le piège de la « Réponse Correcte »
Ce n'est pas parce qu'un détective obtient la bonne réponse finale qu'il a pensé correctement.

  • Analogie : Imaginez un élève passant un examen de mathématiques. Il écrit un paragraphe de non-sens, invente des chiffres et utilise une logique erronée, mais il finit par deviner le chiffre final et obtient la bonne réponse.
  • Constat : De nombreux modèles ont obtenu la bonne réponse bien que leurs « étapes de pensée » soient remplies d'hallucinations. Le processus de pensée n'était pas une explication fidèle de la manière dont ils ont résolu le problème.

2. La différence entre « Mauvaise Vue » et « Mauvaise Logique »
C'était une découverte surprenante :

  • Hallucinations de Perception (Mauvaise Vue) : Elles arrivent tout le temps. Les modèles identifient souvent mal les objets ou les couleurs. Cependant, cela nuit rarement à la réponse finale. Le modèle peut penser qu'une voiture est rouge alors qu'elle est bleue, mais il parvient tout de même à comprendre que la voiture est en mouvement.
  • Hallucinations de Raisonnement (Mauvaise Logique) : Elles sont rares, mais mortelles. Si le modèle se trompe dans la logique (par exemple, « Si A alors B » alors qu'il s'agit en réalité de « Si A alors C »), la réponse finale est presque toujours fausse.
  • À retenir : Il vaut mieux avoir un détective avec une mauvaise vue qu'un détective avec un cerveau défaillant.

3. Le problème de la « Sur-réflexion » (Overthinking)
L'article a révélé que lorsque les modèles sont contraints de réfléchir plus longtemps (plus d'étapes), ils ne deviennent pas nécessairement plus intelligents.

  • Analogie : Imaginez un détective qui continue de prendre des notes. Ses 5 premières notes sont brillantes. Les 15 suivantes ne sont que du bavardage, des répétitions ou des inventions de nouveaux faits.
  • Constat : À mesure que la réflexion s'allonge, la « précision » chute. Les modèles génèrent beaucoup d'étapes supplémentaires, inutiles ou hallucinées, juste pour remplir l'espace. Ils font de la « sur-réflexion » et s'éloignent de la vérité.

L'essentiel

L'article soutient que nous ne pouvons plus simplement faire confiance à la réponse finale donnée par un modèle. Nous devons examiner comment ils y sont parvenus.

MM-THEBENCH est comme une loupe qui nous force à regarder le carnet de notes du détective. Il montre que même si ces modèles d'IA deviennent meilleurs pour résoudre des problèmes, leur « pensée » interne est souvent désordonnée, pleine de petits mensonges et parfois complètement déconnectée de la réalité. Pour qu'ils soient véritablement fiables, nous devons corriger leur processus de pensée, et pas seulement leurs réponses finales.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →