← Derniers articles
🤖 AI

Probing Perceptual Constancy in Large Vision-Language Models

Cette étude évalue 155 modèles vision-langage à travers 236 expériences sur la constance de la couleur, de la taille et de la forme, révélant une variabilité de performance significative et une dissociation distincte entre les capacités de constance de la forme et celles de la couleur et de la taille.

Auteurs originaux : Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Ho
Publié 2026-02-09
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Haoran Sun, Bingyang Wang, Suyang Yu, Yijiang Li, Qingying Gao, Haiyun Lyu, Lianyu Huang, Zelong Hong, Jiahui Ge, Qianli Ma, Hang He, Yifan Zhou, Lingzi Guo, Lantao Mei, Maijunxian Wang, Dezhi Luo, Hokin Deng

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous regardez une pomme rouge. Si vous vous éloignez d'elle, elle paraît plus petite. Si vous éclairez la pomme avec une lampe de poche bleue, elle paraît violette. Si vous la regardez de côté, elle ressemble à un ovale plutôt qu'à un cercle.

Le cerveau humain est incroyable car il sait que la pomme est toujours une grosse pomme rouge et ronde, quels que soient ces changements. Il ne se laisse pas tromper par la distance, la lumière étrange ou l'angle. Ce super-pouvoir s'appelle la constance perceptuelle.

Ce document est comme un immense bulletin de notes pour 155 différents « cerveaux d'IA » (appelés Modèles Vision-Langage) afin de voir s'ils possèdent ce même super-pouvoir. Les chercheurs ont construit un test spécial appelé ConstancyBench pour vérifier trois compétences spécifiques :

1. Les trois compétences testées

Considérez ces compétences comme trois niveaux différents d'un jeu vidéo :

  • La Constance de Couleur (le niveau « Éclairage ») : L'IA peut-elle dire qu'un mur blanc est blanc, même si la pièce est éclairée par une lampe jaune ou un néon bleu ?
    • Le Test : L'IA regarde un Rubik's Cube sous un éclairage étrange et doit deviner la couleur réelle de la case centrale.
  • La Constance de Taille (le niveau « Distance ») : L'IA peut-elle comprendre qu'une voiture au loin est de la même taille qu'une voiture juste à côté d'elle, même si celle qui est loin paraît minuscule à l'écran ?
    • Le Test : L'IA regarde deux missiles, l'un au fond et l'autre tout près, et doit décider s'ils sont réellement de tailles différentes ou s'ils paraissent simplement différents à cause de la perspective.
  • La Constance de Forme (le niveau « Angle ») : L'IA peut-elle savoir qu'une assiette ronde est toujours un cercle, même si elle est inclinée de sorte qu'elle ressemble à un ovale ?
    • Le Test : L'IA regarde une porte légèrement ouverte et inclinée, ce qui la fait ressembler à un trapèze, et doit réaliser qu'il s'agit en réalité d'un rectangle.

2. Les résultats : Qui a réussi ?

Les chercheurs ont testé 155 modèles d'IA différents, allant de modèles petits et légers à des modèles massifs et ultra-intelligents (comme GPT-4o). Voici ce qu'ils ont trouvé :

  • La compétence « Forme » est facile : Les modèles d'IA étaient étonnamment bons en constance de forme. C'est comme s'ils étaient très doués pour reconnaître le « contour » des choses. Même les petits modèles pouvaient comprendre qu'un rectangle incliné est toujours un rectangle.
  • Les compétences « Couleur » et « Taille » sont difficiles : Les modèles ont beaucoup plus eu de mal avec la couleur et la taille. Ils ont souvent été piégés par l'éclairage ou la distance. C'est comme s'ils regardaient une image plate et oubliaient que le monde est en 3D et possède une lumière changeante.
  • Les cerveaux plus gros réussissent mieux : Il y avait une règle claire : plus le modèle d'IA est grand, meilleur il est pour ces tests.
    • Les petits modèles ont souvent échoué, se laissant troubler par des astuces simples.
    • Les modèles massifs (les « géants » du monde de l'IA) ont bien mieux réussi, surtout pour comprendre la taille et la distance. Il semble qu'en donnant plus de « puissance cérébrale » (paramètres) à l'IA, elle devient meilleure pour comprendre le monde en 3D.

3. La grande conclusion

Le document conclut que l'IA ne possède pas encore une vision unique et parfaite « semblable à celle de l'humain ». Au lieu de cela, elle possède une vision stratifiée (par couches) :

  • Elle est bonne en géométrie simple (Forme).
  • Elle s'améliore pour comprendre l'échelle et l'éclairage du monde (Taille et Couleur), mais seulement si le modèle est immense.

Les auteurs suggèrent que, bien que ces modèles d'IA deviennent plus intelligents, ils ne « voient » peut-être pas le monde de la même manière que les humains. Ils sont peut-être simplement très doués pour deviner en se basant sur des motifs vus dans leurs données d'entraînement, plutôt que de réellement comprendre la physique.

En bref : Si vous demandez à une IA d'identifier une forme, elle est généralement intelligente. Si vous lui demandez de déterminer la taille ou la couleur réelle de quelque chose quand l'éclairage ou la distance est complexe, elle est encore en plein apprentissage. Et plus l'IA est grande, moins elle est susceptible d'être trompée.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →