← Derniers articles
🤖 AI

How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks

Ce papier évalue les modèles de base multimodaux de pointe tels que GPT-4o sur des tâches classiques de vision par ordinateur en utilisant un nouveau cadre de chaînage de prompts pour révéler que, bien qu'ils fassent office de généralistes respectables dotés d'une forte compréhension sémantique, ils restent en retrait par rapport aux modèles spécialisés dans les tâches géométriques et présentent des modes d'échec spécifiques.

Auteurs originaux : Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

Publié 2026-05-04
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rahul Ramachandran, Ali Garjani, Roman Bachmann, Andrei Atanov, Oğuzhan Fatih Kar, Amir Zamir

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez un groupe de bibliothécaires incroyablement intelligents et bien informés (les Modèles Fondamentaux Multimodaux ou MFMs, comme GPT-4o, Gemini et Claude). Ces bibliothécaires ont lu presque tous les livres d'Internet et peuvent décrire une image avec des détails beaux et poétiques. Ils sont célèbres pour répondre à des questions telles que : « Que se passe-t-il sur cette photo ? » ou « Écrivez une histoire sur ce chien. »

Mais les chercheurs de l'EPFL ont posé une question différente : « Ces bibliothécaires peuvent-ils réellement faire le travail d'un photographe professionnel ou d'un architecte 3D ? »

Pour le savoir, ils ne se sont pas contentés de demander aux bibliothécaires de discuter ; ils les ont soumis à une série d'examens rigoureux et techniques, habituellement réservés aux robots spécialisés en vision par ordinateur. Voici comment ils ont procédé et ce qu'ils ont découvert, expliqué simplement.

Le Défi : Le Problème du « Texte Seul »

Le problème principal est que ces modèles d'IA sont entraînés à parler, pas à dessiner ou à mesurer. Si vous demandez à un robot de vision standard de « trouver le chat », il dessine un cadre autour de lui. Si vous demandez à une IA basée sur du texte, elle pourrait dire : « Je vois un chat. »

Pour les tester équitablement, les chercheurs ont inventé un jeu de traduction appelé « Chaînage de Prompts ».

  • L'Analogie : Imaginez que vous êtes bandé et que vous devez trouver un livre spécifique dans une immense bibliothèque. Vous ne pouvez pas voir, mais vous pouvez poser des questions à un guide.
  • La Méthode : Au lieu de demander à l'IA de « dessiner un cadre autour du chat » (ce qu'elle ne peut pas faire nativement), les chercheurs ont décomposé la tâche en minuscules étapes basées sur le texte. Ils ont demandé à l'IA : « Y a-t-il un chat dans le coin supérieur gauche ? » « Non. » « Y a-t-il un chat au milieu ? » « Oui. » Puis, « Est-il dans la moitié supérieure du milieu ? » « Oui. »
  • En enchaînant ces minuscules questions « Oui/Non », l'IA finit par construire une carte de l'emplacement de l'objet, dessinant efficacement un cadre ou un masque uniquement par le texte. Cela a permis aux chercheurs de comparer les « parleurs » aux « faiseurs » (modèles spécialisés) sur exactement les mêmes tâches.

L'Examen : Qu'ont-ils Testé ?

Les chercheurs ont soumis les modèles à six types de tests différents, allant du facile au très difficile :

  1. Classification : « Qu'est-ce que c'est ? » (Comme identifier un zèbre).
  2. Détection d'Objets : « Où est le zèbre ? » (Dessiner un cadre autour de lui).
  3. Segmentation : « Quels pixels appartiennent au zèbre ? » (Colorier le zèbre parfaitement).
  4. Regroupement : « Si je tape sur l'oreille du zèbre, quels autres pixels appartiennent au même zèbre ? »
  5. Prédiction de Profondeur : « Quelle partie de l'image est la plus proche de la caméra ? » (Créer une carte de distance 3D).
  6. Normales de Surface : « Dans quelle direction la surface fait-elle face ? » (Ce mur fait-il face à gauche, à droite, en haut ou en bas ?).

Les Résultats : Le « Généraliste » contre le « Spécialiste »

1. Ils sont d'excellents « Généralistes », mais pas des « Spécialistes ».
Les modèles d'IA ont étonnamment bien réussi pour être des généralistes. Ils pouvaient identifier des objets et comprendre la scène générale mieux qu'un hasard. Cependant, ils restent encore nettement en retard par rapport aux robots spécialisés construits spécifiquement pour ces emplois.

  • Analogie : L'IA est comme un brillant médecin généraliste qui sait un peu de tout. Les modèles spécialisés sont comme des neurochirurgiens. Le généraliste peut diagnostiquer un mal de tête, mais il ne peut pas réaliser une chirurgie cérébrale aussi bien que le chirurgien.

2. Le Fossé entre « Sémantique » et « Géométrie »
Les modèles étaient beaucoup meilleurs dans les tâches Sémantiques (comprendre ce que sont les choses) que dans les tâches Géométriques (comprendre se trouvent les choses dans l'espace 3D).

  • Ils pouvaient vous dire « C'est un zèbre » facilement.
  • Ils peinaient à vous dire « Ce zèbre est à 5 mètres et son dos fait légèrement face à gauche. »
  • Analogie : Ils sont excellents pour décrire l'intrigue d'un film, mais terribles pour dessiner la scénographie ou calculer la physique des explosions.

3. Le Problème de la « Vision Floue »
Lorsque les chercheurs ont essayé de faire dessiner des contours précis à l'IA, les modèles ont souvent peiné avec les détails fins. C'était comme s'ils avaient une « vision floue ».

  • Pour résoudre cela, les chercheurs ont dû fournir à l'IA des recadrages « zoomés » de l'image (comme regarder à travers une loupe) pour l'aider à voir clairement les bords. Sans cette aide, les contours de l'IA étaient désordonnés.

4. Les Modèles de « Raisonnement » Changent la donne
L'article a testé un nouveau type d'IA appelé « Modèles de Raisonnement » (comme o1, o3 et o4-mini). Ces modèles prennent un temps supplémentaire pour « réfléchir » avant de répondre.

  • Le Résultat : Ces modèles pensants étaient beaucoup meilleurs dans les tâches difficiles de géométrie 3D (profondeur et normales de surface) que les modèles standards. Ils semblaient utiliser la logique pour déterminer les relations spatiales, alors que les modèles standards ne faisaient que deviner en se basant sur des motifs.

5. Le Problème de l'« Hallucination »
Lorsque les chercheurs ont testé le tout nouveau GPT-4o, qui peut réellement générer des images (dessiner des tableaux) au lieu de simplement parler, ils ont constaté qu'il était sujet aux hallucinations.

  • Analogie : Si vous lui demandez de « dessiner le zèbre », il pourrait dessiner un zèbre, mais il pourrait aussi ajouter accidentellement une corne de licorne ou placer les pattes du zèbre au mauvais endroit. La génération d'images est prometteuse mais actuellement peu fiable pour des tâches précises.

La Conclusion

L'article conclut que, bien que ces immenses modèles d'IA soient d'impressionnants « généralistes » capables de comprendre le sens d'une image, ils ne sont pas encore prêts à remplacer les outils spécialisés utilisés par les ingénieurs et les scientifiques pour les mesures précises et la reconstruction 3D.

Cependant, les modèles de « Raisonnement » montrent les premiers signes de comblement de ce fossé, suggérant que, à mesure que l'IA apprend à « réfléchir » plus profondément, sa capacité à comprendre le monde physique 3D commence à rattraper sa capacité à comprendre le langage.

Note Importante : Les chercheurs soulignent que leur méthode de « Chaînage de Prompts » est un outil de test, et non une façon pratique d'utiliser ces modèles dans la vie réelle. C'est comme utiliser une règle pour mesurer la taille d'un modèle ; c'est un moyen d'obtenir un chiffre, mais vous n'utiliseriez pas une règle pour construire une maison. L'objectif était simplement de voir à quel point ces modèles sont vraiment bons, et la réponse est : « Très bons pour parler de photos, mais ils apprennent encore à les mesurer. »

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →