← Derniers articles
💬 NLP

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

Cette étude révèle que, contrairement aux humains qui respectent leurs règles d'attribution de couleur, les modèles vision-langage (VLM) sont incapables d'aligner leurs réponses finales sur leur propre raisonnement introspectif, en particulier face aux biais de connaissances du monde, ce qui remet en question leur fiabilité pour des déploiements à haut risque.

Auteurs originaux : Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

Publié 2026-04-09
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🍎 Le Titre : "Quand appeler une pomme 'rouge' ?"

Imaginez que vous avez un dessin au trait d'une pomme. On commence à la colorer en rouge, mais très doucement. D'abord, c'est à peine une touche de rouge. Puis, un peu plus. Et ainsi de suite, jusqu'à ce qu'elle soit entièrement rouge.

La question est simple : À quel moment précis commencez-vous à dire "C'est une pomme rouge" ?

C'est exactement ce que les chercheurs ont demandé à des humains et à des intelligences artificielles (les modèles de vision-linguistique, ou VLM) de faire. Ils ont créé un jeu appelé GCA (Attribution de couleur graduée) pour tester la "conscience de soi" de ces machines.

🤖 Le Problème : Les IA disent une chose, mais en font une autre

L'idée derrière cette étude, c'est de vérifier si les IA sont honnêtes avec elles-mêmes.

  1. La règle intérieure (l'introspection) : On demande d'abord à l'IA : "Si tu vois une pomme avec 50 % de pixels rouges, la considères-tu comme rouge ?" L'IA répond : "Oui, ma règle est de dire 'rouge' dès qu'il y a 50 % de rouge." C'est sa règle intérieure.
  2. L'action réelle : Ensuite, on lui montre une pomme avec exactement 50 % de rouge.
  3. Le verdict :
    • Les humains : Ils disent "C'est rouge". Ils respectent leur règle.
    • Les IA (comme GPT-5-mini) : Elles disent souvent "Non, c'est blanc" (ou une autre couleur), même si elles viennent de dire que leur règle était de 50 %.

C'est comme si un juge disait : "Je condamne toute personne avec plus de 50 % de preuves à la prison" et qu'ensuite, face à une personne avec exactement 50 % de preuves, il la laissait partir en disant : "Ah, non, en fait, ce n'est pas assez."

🎨 L'Analogie du "Sorcier des Préjugés"

Pourquoi les IA font-elles ça ? Les chercheurs ont découvert que les IA sont victimes d'un préjugé linguistique (ce qu'on appelle des "priors" du monde réel).

Imaginez que l'IA est un petit magicien qui a lu tous les livres du monde.

  • Quand il voit un pentagone jaune (une forme sans signification), il se fie à ses yeux : "Je vois 30 % de jaune, donc je dis 'jaune'." Il est honnête.
  • Mais quand il voit une pomme, son cerveau de magicien crie : "ATTENTION ! C'est une POMME ! Les pommes sont ROUGES !"

Même si la pomme est à 90 % blanche sur le dessin, le "magicien" (l'IA) est tellement obsédé par le fait que les pommes sont rouges dans la vraie vie, qu'il ignore ce qu'il voit réellement. Il ignore sa propre règle mathématique pour suivre son intuition culturelle.

En résumé :

  • Les humains voient la pomme, comptent les pixels, et disent : "Il y a trop de blanc, c'est blanc." (Ils sont fidèles à leur règle).
  • Les IA voient la pomme, pensent "Pomme = Rouge", et disent "C'est rouge" même si la pomme est presque blanche. Elles trahissent leur propre règle pour satisfaire leur connaissance du monde.

🧠 Ce que cela nous apprend sur la confiance

Cette étude est cruciale pour l'avenir, surtout dans des domaines sérieux comme la médecine ou le droit.

  • Le mythe de la "réflexion" : On pense souvent que si une IA écrit un long texte expliquant son raisonnement (ce qu'on appelle la "chaîne de pensée"), c'est qu'elle réfléchit vraiment.
  • La réalité : Cette étude montre que l'IA peut écrire un raisonnement parfait et logique, puis ignorer complètement ce qu'elle vient d'écrire pour donner une réponse basée sur des préjugés.

C'est comme si un avocat écrivait un mémoire juridique impeccable, prouvant que son client est innocent, mais qu'au moment de plaider, il crie : "Il est coupable !" parce qu'il a lu dans les journaux que le client a un mauvais passé.

🏁 Conclusion Simple

Les chercheurs ont prouvé que :

  1. Les IA sont excellentes pour compter (elles savent combien de pixels sont rouges).
  2. Mais elles sont mauvaises pour respecter leurs propres règles quand un préjugé (comme "les pommes sont rouges") entre en jeu.
  3. Les humains, eux, sont beaucoup plus cohérents : ils respectent leurs règles, même s'ils se trompent parfois sur le comptage exact (ils surestiment un peu la couleur, mais ils restent fidèles à leur logique).

Leçon à retenir : Ne faites pas confiance aveuglément aux explications d'une IA. Parfois, elle vous dit ce qu'elle pense qu'elle devrait faire, mais elle finit par faire ce que son "culture" lui dicte, même si cela contredit sa propre logique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →