← Derniers articles
💬 NLP

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

Cet article présente VMMU, un benchmark vietnamien comprenant 2 500 questions multimodales réparties sur sept tâches conçues pour évaluer la capacité des modèles vision-langage à effectuer un véritable raisonnement visuel-textuel au-delà de l'anglais, révélant que les modèles actuels éprouvent des difficultés principalement avec l'ancrage multimodal plutôt qu'avec l'OCR malgré de solides performances linguistiques spécifiques.

Auteurs originaux : Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Publié 2026-01-26
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un robot assistant multilingue très intelligent. Vous voulez voir s'il peut aider un étudiant vietnamien à résoudre un problème de devoirs difficile présenté sous forme d'image. L'image n'est pas seulement une photo ; c'est une page d'un manuel scolaire ou d'un examen de conduite qui contient du texte en vietnamien mélangé à des diagrammes, des graphiques et des panneaux de signalisation.

Le document présente un nouveau « test » appelé VMMU pour voir si ces robots sont capables de réaliser cette tâche spécifique. Voici le détail de ce qu'ils ont découvert, en utilisant des analogies simples :

1. Le Test : Un parcours d'obstacles « multitâche »

Considérez le VMMU comme une salle de sport pour l'IA, mais au lieu de soulever des poids, les robots doivent résoudre 2 548 puzzles différents. Ces puzzles couvrent sept domaines : les mathématiques, la physique, la chimie, la biologie, la géographie, les examens de conduite et les tests de QI.

Le piège ? Les questions ne sont pas simplement tapées sur un écran. Elles sont intégrées dans des images. Pour répondre, le robot doit :

  • Lire les mots vietnamiens à l'intérieur de l'image (comme lire un panneau).
  • Regarder la partie image (comme un graphique ou une carte).
  • Relier les deux pour trouver la réponse.

2. La Grande Surprise : Lire n'est pas le problème

Les chercheurs se sont d'abord demandé : « Le robot échoue-t-il parce qu'il ne sait pas lire le vietnamien ? »
Ils ont testé la capacité des robots à simplement transcrire (lire à haute voix) le texte à l'intérieur des images.

  • Le Résultat : Les robots étaient en fait excellents pour lire le texte vietnamien. Ils l'ont réussi presque 95 % du temps.
  • L'Analogie : Imaginez un étudiant qui peut lire chaque mot d'une page parfaitement, mais qui se trompe quand même dans un problème de mathématiques parce qu'il ne comprend pas comment les chiffres se rapportent à l'image. Le problème n'est pas les yeux ; c'est le cerveau.

3. La Vraie Difficulté : Relier les points

Lorsque les robots ont essayé de résoudre les problèmes complets (lecture + observation + raisonnement), leurs scores ont chuté de manière significative.

  • Le Résultat : Même les robots commerciaux les plus intelligents n'ont obtenu que 66 % de bonnes réponses.
  • Le Facteur « Réflexion » : Les chercheurs ont constaté une grande différence entre les robots « rapides » et les robots « réfléchis ».
    • Les Robots Rapides : Ils répondent rapidement et obtiennent environ 50 à 70 % de réussite.
    • Les Robots Réfléchis : Ces modèles font une pause pour « réfléchir » aux étapes. Ils ont obtenu des scores bien plus élevés (73–86 %).
  • L'Analogie : C'est comme la différence entre un étudiant qui lance la première réponse qui lui vient à l'esprit et un autre qui s'arrête, dessine un diagramme et suit la logique étape par étape. Les modèles qui « réfléchissent » ont bien mieux réussi.

4. Le Problème de l'« Encombrement »

Les chercheurs ont remarqué que lorsque le texte et l'image étaient entassés ensemble dans une image désordonnée, les robots étaient confus.

  • L'Expérience : Ils ont extrait le texte de l'image pour le donner au robot sous la forme d'une liste propre, tout en lui remettant l'image séparément.
  • Le Résultat : Les robots ont été meilleurs pour résoudre le problème.
  • L'Analogie : C'est comme essayer de résoudre un puzzle pendant que quelqu'un vous crie des instructions depuis l'autre bout de la pièce. Si on vous remet les instructions sur une feuille de papier propre et qu'on vous laisse vous concentrer sur les pièces du puzzle, vous réussissez bien mieux. Les robots avaient du mal à ignorer le « bruit » du texte lorsqu'il était mélangé à l'image.

5. La Traduction n'aide pas

Les chercheurs se sont demandé : « Peut-être que les robots ne connaissent pas assez bien le vietnamien. Et si nous traduisions la question en anglais ? »

  • Le Résultat : Non. Traduire la question en anglais a en fait rendu les robots moins performants.
  • L'Analogie : Imaginez un examen de conduite où les panneaux sont en vietnamien, mais les instructions sont en anglais. Le robot est confus car le panneau indique « Stop » en vietnamien, mais l'instruction en anglais ne correspond pas au contexte visuel. Le robot a besoin de comprendre l'ensemble du contexte vietnamien pour résoudre l'énigme.

6. L'Habitude de « Deviner »

Enfin, ils ont essayé de supprimer entièrement l'image pour ne donner au robot que la question textuelle.

  • Le Résultat : Les scores des robots ont chuté, mais ils ne sont pas tombés à zéro. Ils ont toujours obtenu environ 51 % de réussite (contre 25 % pour un choix aléatoire).
  • L'Analogie : Il s'avère que les robots sont comme des étudiants qui ont mémorisé les « astuces » de l'examen. Même sans l'image, ils peuvent deviner la bonne réponse en se basant uniquement sur la formulation de la question, en utilisant des schémas déjà rencontrés. Ils ne sont pas réellement en train de « voir » la réponse ; ils sont juste doués pour deviner.

L'Essentiel à Retenir

Le document conclut que les modèles d'IA actuels sont excellents pour lire le texte vietnamien dans les images, mais qu'ils ont encore du mal à relier ce texte aux preuves visuelles et à raisonner sur le problème. Ils doivent apprendre à « réfléchir » plus profondément et à gérer la réalité désordonnée des textes et des images mélangés, plutôt que de simplement compter sur des raccourcis ou sur le hasard.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →