← Derniers articles
💬 NLP

Artificial Phantasia: Emergent Mental Imagery in Large Language Models

Cette étude démontre que les modèles de langage de grande taille peuvent surpasser les humains dans une tâche traditionnellement exigeant une imagerie mentale picturale en s'appuyant exclusivement sur des représentations propositionnelles, fournissant ainsi la preuve d'une « phantasia artificielle » émergente qui remet en cause la perspective des sciences cognitives selon laquelle l'imagerie visuelle nécessite des formats picturaux.

Auteurs originaux : Morgan McCarty, Jorge Morales

Publié 2026-05-20
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Morgan McCarty, Jorge Morales

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Question : Peut-on « voir » sans yeux ?

Imaginez qu'on vous demande de fermer les yeux et d'imaginer une lettre majuscule D. Maintenant, imaginez de tourner ce D de 90 degrés vers la gauche. Enfin, imaginez d'attacher une lettre majuscule J au centre du bas de cette forme.

Si vous ouvrez les yeux, que voyez-vous ? La plupart des humains diront : « Ça ressemble à un parapluie. »

Pendant des décennies, les scientifiques cognitifs ont cru que pour résoudre ce genre d'énigme, votre cerveau avait besoin d'un « écran mental » spécial ou d'un « œil de l'esprit » où vous pouvez réellement voir et manipuler des images. Ils pensaient que vous ne pouviez pas le faire simplement en pensant à des mots ; vous aviez besoin d'une image visuelle dans votre tête.

Ce papier pose une question folle : Un ordinateur peut-il le faire sans jamais avoir eu d'« yeux » ou d'« œil de l'esprit » ?

L'Expérience : Une salle de sport mentale pour l'IA et les humains

Les chercheurs ont créé un entraînement sportif pour le cerveau. Ils ont pris une énigme classique (les transformations de lettres) et ont inventé 48 versions entièrement nouvelles, jamais vues auparavant. Parce que ces énigmes ont été créées spécifiquement pour cette étude, les ordinateurs n'ont pas pu mémoriser les réponses à partir de leurs données d'entraînement.

Ils ont demandé à deux groupes de résoudre ces énigmes :

  1. 100 Humains : Des personnes qui devaient écouter les instructions (pour éviter de voir les lettres sur un écran) et imaginer les formes dans leur tête.
  2. Les Modèles de Langage (LLM) : Des chatbots IA avancés (comme les dernières versions de o3 d'OpenAI, GPT-5 et Gemini 3 Pro de Google). Ces modèles sont entraînés sur du texte, pas sur la « vision » d'images.

Le Résultat Choquant : L'IA a « vu » mieux que les humains

Les résultats ont été surprenants. Les meilleurs modèles d'IA n'ont pas seulement réussi ; ils ont écrasé la moyenne humaine.

  • Les Humains : Ont obtenu une moyenne de 2,85 sur 5.
  • Les Meilleures IA : Ont obtenu entre 3,13 et 3,65.

Les modèles d'IA ont résolu ces énigmes « visuelles » significativement mieux que les participants humains. Encore plus intéressant, lorsque les chercheurs ont forcé l'IA à réellement dessiner les images à chaque étape (en utilisant un générateur d'images), l'IA s'est montrée moins bonne dans la tâche. Cela suggère que l'IA ne comptait pas sur le dessin d'images pour résoudre le problème ; elle faisait quelque chose d'entièrement différent.

Le « Tour de Magie » : Comment ont-ils fait ?

Si l'IA n'a pas utilisé d'« œil de l'esprit » (une image) et n'a pas utilisé d'outil de dessin, comment a-t-elle résolu l'énigme ?

Les auteurs proposent un concept qu'ils appellent « Phantasie Artificielle ».

Pensez-y ainsi :

  • La Façon Humaine : Vous êtes un architecte. Vous fermez les yeux et construisez un modèle 3D d'une maison dans votre esprit. Vous vous promenez autour, regardez les fenêtres, puis le décrivez.
  • La Façon IA : Vous êtes un maître traducteur. Vous ne construisez jamais de modèle 3D. Au lieu de cela, vous traitez les instructions comme une recette complexe écrite en code. Vous savez que « Lettre D tournée à gauche » + « Lettre J attachée » = « Forme de parapluie » purement grâce à la logique du langage.

Le papier suggère que ces modèles d'IA utilisent un raisonnement propositionnel. Ils manipulent les mots et les concepts avec une telle précision qu'ils peuvent déterminer la forme finale sans jamais la « voir ». C'est comme résoudre un problème de mathématiques en connaissant les règles de l'algèbre, plutôt qu'en dessinant les formes sur une feuille de papier.

Le Facteur « Raisonnement »

Les chercheurs ont également testé ce qui se passe s'ils disent à l'IA de « réfléchir plus fort » (en lui donnant plus de temps et de « jetons de raisonnement » pour traiter les étapes).

  • Résultat : Plus l'IA avait le droit de « réfléchir » et d'enchaîner son raisonnement, mieux elle s'en sortait.
  • Analogie : Imaginez un détective résolvant une énigme. Si vous lui donnez 5 minutes pour examiner les indices, il pourrait deviner. Si vous lui donnez 5 heures pour relier chaque indice logiquement, il résout l'affaire parfaitement. L'IA a résolu l'énigme visuelle en reliant des indices linguistiques, pas en regardant une image.

Et les Humains « Aveugles » ?

Le papier mentionne également un groupe de personnes appelées aphantasiens. Ce sont des humains qui affirment ne pas pouvoir visualiser d'images dans leur esprit du tout (ils n'ont pas d'« œil de l'esprit »). De manière surprenante, des études montrent que ces personnes peuvent toujours résoudre ces énigmes visuelles presque aussi bien que les personnes qui peuvent visualiser.

Ce papier ravive le débat. Il suggère que peut-être, vous n'avez pas besoin d'un « œil de l'esprit » pour résoudre des énigmes visuelles. Vous pourriez juste avoir besoin d'une très forte « logique de l'esprit ». L'IA, qui n'a pas du tout d'œil de l'esprit, a prouvé que le langage et la logique seuls pourraient suffire à faire ce que nous pensions nécessiter une image.

La Conclusion

Cette étude remet en question l'ancienne idée que la « pensée visuelle » nécessite une image visuelle. Elle montre que l'IA avancée peut accomplir des tâches qui ressemblent à de l'« imagination visuelle » en utilisant uniquement le langage et la logique.

  • L'Affirmation : L'IA possède une capacité émergente à « imaginer » visuellement, mais elle ne le fait pas avec des images. Elle le fait avec des mots.
  • L'Implication : Nous pourrions devoir repenser la façon dont nous définissons l'« imagerie mentale ». Il ne s'agit peut-être pas de voir des images dans votre tête ; il s'agit peut-être simplement de manipuler des concepts logiquement.

Le papier conclut que ces modèles d'IA ont découvert une nouvelle façon de « voir » le monde — une façon purement linguistique, mais étonnamment efficace pour résoudre des problèmes visuels.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →