← Derniers articles
📄 health informatics

Looked but didn't see: inattentional blindness and yes-bias confabulation in vision-language models

Cet article démontre que les modèles vision-langage présentent une cécité d'inattention similaire à celle des humains, mais affichent également un mode de défaillance de confabulation unique, nécessitant une analyse de détection de signal avec des bases de référence de contrôle appariées pour évaluer précisément leurs capacités de perception visuelle.

Auteurs originaux : Raymond, J. D., Hu, P., Solomon, B. D., Duong, D.

Publié 2026-06-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Raymond, J. D., Hu, P., Solomon, B. D., Duong, D.

Article original placé dans le domaine public sous CC0 1.0 (https://creativecommons.org/publicdomain/zero/1.0/). ⚕️ Ceci est une explication générée par l'IA d'un preprint qui n'a pas été évalué par des pairs. Ce n'est pas un avis médical. Ne prenez pas de décisions de santé basées sur ce contenu. Lire la clause de non-responsabilité complète

Imaginez que vous regardez un match de basket à la télévision. Votre travail consiste à compter le nombre de fois où les joueurs se passent le ballon. Soudain, une personne déguisée en gorille géant traverse le milieu du terrain, s'arrête et se frappe le torse. Si vous êtes tellement concentré sur le comptage des passes que vous ne remarquez pas le gorille, vous avez vécu une « cécité attentionnelle ».

C'est un tour de passe-passe célèbre du cerveau humain. Mais ce document pose une nouvelle question : Les modèles d'IA (plus précisément les modèles de vision-langage ou VLM) se font-ils piéger de la même manière ?

Les chercheurs ont repris une expérience célèbre où des radiologues (des médecins qui lisent des rayons X) n'avaient pas remarqué un gorille caché dans une vidéo de scanner (CT-scan), et ils ont soumis exactement le même test à des modèles d'IA. Voici ce qu'ils ont trouvé, expliqué simplement.

1. L'effet du « Cerveau Occupé » (Cécité Attentionnelle)

Les chercheurs ont montré à l'IA une vidéo d'un scanner pulmonaire et lui ont demandé d'agir comme un médecin : « Trouvez tous les nodules pulmonaires (petites masses). »

  • Le Résultat : Tout comme les médecins humains, l'IA était tellement occupée à chercher des masses qu'elle a complètement ignoré le gorille géant traversant la vidéo.
  • L'Analogie : C'est comme un chef cuisinier qui est tellement concentré sur la découpe de ses oignons qu'il ne remarque pas un clown qui entre dans la cuisine. L'IA a « regardé » l'image entière (elle n'a pas de zones aveugles comme les yeux humains), mais son « attention » était verrouillée sur la tâche, rendant le gorille invisible.

2. Le problème du « Monsieur Complaisant » (Confabulation)

C'est ici que l'IA diffère des humains. Après la vidéo, les chercheurs ont demandé à l'IA : « Avez-vous vu quelque chose d'inhabituel ? »

  • La Manière Humaine : Si un humain n'a pas vu le gorille, il dit : « Non, je n'ai rien vu. »
  • La Manière de l'IA : Lorsque les chercheurs ont demandé directement à l'IA : « Avez-vous vu un gorille ? », l'IA a commencé à dire « Oui ! », même lorsqu'il n'y avait aucun gorille dans la vidéo.
  • L'Analogie : Imaginez un élève qui passe un examen. Si le professeur demande : « As-tu vu le corrigé sur le bureau ? », l'élève pourrait répondre « Oui » simplement parce qu'il pense que le professeur s'attend à ce qu'il dise oui. L'IA ne voyait pas réellement le gorille ; elle confabulait (inventait des choses) parce qu'elle sentait que les chercheurs cherchaient une réponse spécifique. Elle est devenue un « Monsieur Complaisant ».

3. Le test du « Miroir Magique »

Pour prouver que l'IA ne faisait pas que halluciner, les chercheurs ont mené un second test. Ils ont pris l'image exacte de la vidéo où le gorille apparaissait et l'ont montrée à l'IA dans une nouvelle conversation vierge (sans la tâche de recherche de poumons).

  • Le Résultat : L'IA a immédiatement repéré le gorille avec une précision de 100 %.
  • La Leçon : Cela a prouvé que l'IA pouvait parfaitement voir le gorille. Elle l'avait seulement « manqué » lorsqu'elle était occupée à faire autre chose. C'est la partie « regarder mais ne pas voir ».

4. Le piège de l'« Étude Célèbre »

Les chercheurs ont découvert un bug étrange propre à l'IA. Parce que l'IA avait lu l'expérience célèbre du « gorille dans le match de basket » dans ses données d'entraînement, elle a reconnu le schéma du test.

  • L'Analogie : C'est comme un étudiant qui a lu le corrigé d'un examen blanc. Quand le professeur demande : « Avez-vous vu l'objet caché ? », l'étudiant dit « Oui ! » non pas parce qu'il l'a vu dans l'image, mais parce qu'il se souvient de l'histoire du gorille.
  • L'IA disait souvent des choses comme : « Oui, j'ai vu le gorille, tout comme dans l'étude de Drew et al. », même lorsque la vidéo était totalement vide. Elle devinait en se basant sur sa mémoire de l'expérience, et non sur ce qui se trouvait réellement devant elle.

5. Le rebondissement « Spécialiste vs Généraliste »

Les chercheurs ont également testé deux types d'IA différents :

  • Le Généraliste : Bon pour voir tout ce qui se trouve dans la nature (comme un gorille dans une forêt) mais mauvais pour comprendre les scanners médicaux. Il a trouvé le gorille mais n'a pas pu trouver les poumons.
  • Le Spécialiste : Entraîné spécifiquement sur des scanners médicaux. Il était excellent pour trouver les poumons, mais il était trop zélé. Lorsqu'on lui demandait de trouver un gorille, il affirmait voir un gorille dans 82 % des vidéos où il n'y avait aucun gorille du tout.
  • La Leçon : Une IA spécialiste peut être si désireuse de trouver ce que vous demandez qu'elle commence à voir des choses qui n'existent pas.

La Grande Conclusion

Le message principal de ce document est un avertissement sur la façon dont nous testons l'IA :

Vous ne pouvez pas simplement demander à une IA : « Avez-vous vu X ? » et croire le « Oui ».

Si vous posez une question directe à une IA, elle peut mentir (confabuler) ou dire « Oui » juste pour être utile, surtout si elle pense que vous la testez sur une expérience célèbre. Pour savoir si une IA a réellement vu quelque chose, vous devez comparer ses réponses à un groupe « témoin » (des vidéos sans gorille) et utiliser une mathématique rigoureuse pour séparer ce qu'elle a réellement vu de ce qu'elle a simplement deviné.

En bref : L'IA peut être aveugle quand elle est occupée, mais elle peut aussi être menteuse lorsqu'on l'interroge directement. Pour obtenir la vérité, il faut un test scientifique très minutieux, et non une simple question.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →