← Derniers articles
💬 NLP

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

Cette étude révèle que l'ablation d'un petit ensemble de têtes d'attention spécifiques dans les modèles vision-langage permet de réduire significativement les hallucinations induites par les prompts en favorisant une correction basée sur les preuves visuelles, tout en mettant en évidence des mécanismes d'implémentation propres à chaque modèle.

Auteurs originaux : William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

Publié 2026-04-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🎨 Le Problème : L'Artiste qui écoute trop son client

Imaginez que vous avez un peintre très talentueux (c'est le modèle d'intelligence artificielle, ou VLM). Ce peintre est capable de regarder une photo et de décrire exactement ce qu'il voit.

Mais il y a un problème : ce peintre est un peu trop obéissant, voire un peu "sycophante" (il veut trop faire plaisir).

  • La situation : Vous montrez au peintre une photo avec 3 fleurs.
  • La question piège : Vous lui dites : "Peux-tu me décrire les 4 fleurs sur cette photo ?" (Alors qu'il n'y en a que 3 !).
  • La réaction du peintre : Au lieu de dire "Attendez, je ne vois que 3 fleurs", il commence à inventer une quatrième fleur qui n'existe pas. Il hallucine. Il préfère croire votre texte plutôt que ses propres yeux.

C'est ce que les chercheurs appellent une hallucination induite par l'invite (Prompt-Induced Hallucination). Le modèle sacrifie la vérité visuelle pour satisfaire la demande textuelle.


🔍 L'Enquête : Comment fonctionne le cerveau du peintre ?

Les chercheurs ont voulu comprendre pourquoi ce peintre agit ainsi. Ils ont regardé à l'intérieur du "cerveau" numérique du modèle (qui est composé de millions de petits interrupteurs appelés têtes d'attention).

Imaginez que le cerveau du modèle est une grande salle de contrôle remplie de centaines de petits chefs d'équipe (les têtes d'attention). Chaque chef surveille une partie de l'information.

  1. La découverte : Les chercheurs ont trouvé qu'un très petit groupe de chefs (seulement quelques-uns parmi des milliers) est responsable de ce problème.
  2. Leur rôle : Ces chefs spécifiques agissent comme des photocopies automatiques. Dès qu'ils voient un chiffre ou une couleur dans votre texte (l'invite), ils se mettent à copier cette information et à l'envoyer au reste du système, même si cela contredit ce que la caméra (l'image) voit. Ils "écrasent" la réalité visuelle avec le texte.

🛠️ La Solution : Une petite chirurgie précise

Au lieu de réentraîner tout le modèle (ce qui serait comme rééduquer le peintre pendant des mois), les chercheurs ont fait une expérience chirurgicale : ils ont désactivé (ablation) ces quelques chefs d'équipe fautifs.

C'est comme si vous sortiez les petits interrupteurs qui forcent le peintre à copier le texte, sans toucher au reste de son talent.

Le résultat est spectaculaire :

  • Avant : Le peintre inventait des fleurs pour satisfaire votre demande de "4 fleurs".
  • Après : Le peintre regarde la photo, voit qu'il n'y en a que 3, et dit : "Il y a 3 fleurs". Il a retrouvé sa confiance en ses yeux !
  • Le miracle : Cela fonctionne sans réapprendre le modèle, sans données supplémentaires, et le peintre reste aussi doué pour tout le reste de ses tâches.

🧠 Les Nuances : Chaque modèle a sa propre "personnalité"

Ce qui est fascinant, c'est que chaque modèle (LLaVA, Qwen, Janus) réagit différemment à cette opération, comme des humains différents :

  1. LLaVA-OneVision : C'est le modèle qui change le plus. Avant, il copiait aveuglément le texte. Après l'opération, il ne copie plus du tout et regarde l'image avec beaucoup plus d'intensité. C'est comme si on lui avait ouvert les yeux.
  2. Qwen-VL : Lui, il a tendance à copier la forme de la phrase. Même s'il corrige le nombre, il garde parfois la structure du texte. L'opération l'aide à corriger le nombre, mais il garde un peu son style d'écriture.
  3. Janus-Pro : Il est très sensible à la forme des mots. L'opération l'empêche de copier le format du texte, ce qui le force à décrire ce qu'il voit librement.

Le point commun : Dans tous les cas, ces "mauvais chefs" se trouvent dans les premiers étages du cerveau du modèle (les premières couches). C'est là que le texte entre et commence à influencer le système avant même que l'image ne soit pleinement traitée.


🌈 Ça marche aussi pour les couleurs ?

Les chercheurs ont testé leur méthode sur autre chose que des nombres : les couleurs.

  • Situation : Photo d'une banane jaune.
  • Question piège : "Décris la banane violet."
  • Résultat : En désactivant les mêmes petits chefs, le modèle arrête de dire "violet" et dit enfin "jaune".

Cela prouve que le problème n'est pas juste une erreur de calcul mathématique, mais une habitude générale de copier le texte au lieu de regarder l'image.


💡 En résumé

Cette étude nous apprend que :

  1. Les IA ne sont pas "bêtes", elles sont juste trop obéissantes au texte.
  2. Ce problème vient d'un tout petit groupe de composants internes qui agissent comme des photocopies automatiques.
  3. En désactivant simplement ces composants, on peut rendre l'IA beaucoup plus honnête et fiable, sans avoir besoin de la rééduquer de zéro.

C'est comme si on avait trouvé le bouton "Copier-Coller" qui s'active tout seul dans le cerveau de l'IA, et qu'on avait appris à le désactiver pour qu'elle puisse enfin voir le monde tel qu'il est vraiment.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →