← Derniers articles
🤖 AI

HueManity: Probing Fine-Grained Visual Perception in MLLMs

L'article présente HueManity, un benchmark à grande échelle utilisant des images de type Ishihara pour révéler que les modèles de langage multimodaux (MLLM) de pointe présentent un déficit critique de perception visuelle fine par rapport aux humains et aux modèles spécialisés, malgré leurs fortes capacités de raisonnement de haut niveau.

Auteurs originaux : Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rynaa Grover, Jayant Sravan Tamarapalli, Sahiti Yerramilli, Nilay Pande

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous possédez un robot très intelligent capable de lire des livres, d'écrire des poèmes et de décrire les scènes complexes d'un tableau. Vous pourriez vous dire : « S'il est si intelligent, il peut sûrement tout voir clairement, n'est-ce pas ? »

Le papier « HueManity » affirme : « Pas si vite. »

Les chercheurs ont conçu un test spécial pour voir si ces modèles de langage de grande taille multimodaux (MLLM) — les cerveaux d'IA derrière de nombreux chatbots — peuvent réellement voir les détails minuscules, ou s'ils se contentent de deviner en se basant sur ce qu'ils ont lu auparavant.

Voici le compte rendu de leurs découvertes en utilisant des analogies simples :

1. Le Test : L'énigme de l'« Encre Invisible »

Les chercheurs ont créé une immense bibliothèque de 83 850 images. Chaque image ressemble à un amas de points colorés et désordonnés, semblable aux tests de daltonisme d'Ishihara que vous pourriez voir chez un médecin.

  • L'astuce : Cachés à l'intérieur des points désordonnés se trouvent deux lettres ou chiffres (comme « 42 » ou « X7 »).
  • Le défi : Pour les trouver, vous devez ignorer le bruit visuel et repérer les subtiles différences de couleurs qui forment la forme des lettres.
  • Le but : Il ne s'agit pas de « réfléchir » ou de « raisonner ». C'est purement une question de vision. L'IA peut-elle trouver l'aiguille dans la botte de foin ?

2. Les Résultats : Humains vs IA

Les chercheurs ont soumis ce test à des humains, à un programme de vision par ordinateur standard (ResNet50) et à neuf des modèles d'IA les plus performants d'aujourd'hui (comme GPT-4, Claude et LLaVA).

  • Humains : Ils étaient presque parfaits. Ils ont vu les chiffres et les lettres instantanément (99 % et 93 % de précision).
  • Vision par ordinateur standard : Elle a également très bien réussi (96 % et 94 %). C'est comme un œil entraîné qui sait exactement quoi chercher.
  • Les modèles d'IA « intelligents » : Ils ont échoué lamentablement.
    • Le meilleur modèle d'IA n'a réussi que 33 % des tests de chiffres simples.
    • Sur les tests de lettres/chiffres plus difficiles, la meilleure IA n'a réussi que 3 %.
    • La plupart des autres modèles ont obtenu entre 0 % et 1 %.

L'analogie : Imaginez demander à un génie qui a lu tous les livres de la bibliothèque de trouver un mot spécifique écrit à l'encre invisible sur une page. Le génie connaît peut-être le concept du mot, mais il ne peut pas réellement voir l'encre sur la page. Il « hallucine » des réponses au lieu de voir la vérité.

3. Pourquoi l'IA a-t-elle échoué ?

Le papier suggère que l'IA n'est pas « stupide », mais qu'elle possède un angle mort spécifique :

  • Trop de concentration sur la « vue d'ensemble » : Ces IA sont entraînées pour comprendre la signification d'une image (par exemple, « C'est un chat assis sur un tapis »). Elles sont si douées pour la vue d'ensemble qu'elles ignorent les détails minuscules et désordonnés (les couleurs et les formes spécifiques des points).
  • Dépendance aux suppositions : Lorsque l'IA ne peut pas voir les points, elle essaie de deviner en se basant sur des schémas linguistiques. C'est comme un étudiant qui ne connaît pas la solution d'un problème de mathématiques mais qui devine une réponse parce qu'elle ressemble à quelque chose qu'il a déjà entendu.
  • L'effet de « plissement des yeux » : Curieusement, lorsque les chercheurs ont rendu les images plus floues (résolution plus basse), un modèle d'IA s'est en fait amélioré. Il semble que l'IA ait besoin que le « bruit » soit lissé pour deviner la forme, plutôt que de réellement voir les détails.

4. Le « Tour de Magie » qui n'a pas fonctionné

Les chercheurs ont tenté d'« enseigner » à l'IA comment réussir ce test :

  • Montrer des exemples : Ils ont montré quelques exemples de l'énigme à l'IA. Cela n'a pas aidé.
  • Ajustement fin (Fine-tuning) : Ils ont tenté de réentraîner l'IA spécifiquement sur ces énigmes. Cela n'a pas aidé. En fait, cela a fait oublier à l'IA comment lire du texte simple !

La conclusion : Le problème n'est pas que l'IA n'a pas été assez enseignée ; le problème réside probablement dans la façon dont l'IA est construite. C'est comme essayer d'apprendre à un poisson à grimper aux arbres en lui donnant plus de livres sur l'escalade. Le poisson (l'IA) n'est tout simplement pas construit pour ce type de vision.

Pourquoi est-ce important ?

Le papier soutient que nous ne pouvons pas faire confiance à ces IA dans des situations où voir clairement est critique.

  • Si une IA conduit une voiture, elle doit voir une fissure légère dans le pare-brise ou un petit panneau sous la pluie, et non pas simplement « deviner » qu'il y a une route.
  • Si une IA examine des scanners médicaux, elle doit repérer une anomalie minuscule, et non pas seulement décrire la forme générale de l'organe.

En bref : Ces modèles d'IA sont d'excellents conteurs et très doués pour comprendre des concepts, mais ils sont actuellement très mauvais en vision de précision (fine-grained vision). Ils sont comme une personne capable de décrire parfaitement un tableau, mais incapable de trouver la signature cachée dans un coin.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →