← Derniers articles
🤖 AI

GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs

L'article présente GHOST, une méthode automatique qui génère des images naturelles sans objet en optimisant les plongements d'images pour induire et exposer activement les vulnérabilités d'hallucination des modèles de langage multimodaux, atteignant ainsi des taux de réussite nettement plus élevés que les approches précédentes tout en servant également d'outil pour améliorer la robustesse des modèles grâce au réglage fin.

Auteurs originaux : Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

Publié 2026-02-03
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Aryan Yazdan Parast, Parsa Hosseini, Hesam Asadollahzadeh, Arshia Soltani Moakhar, Basim Azam, Soheil Feizi, Naveed Akhtar

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Le Gros Problème : L'IA « Trop Imaginative »

Imaginez que vous avez un assistant robot très intelligent capable de regarder des photos et de décrire ce qu'il voit. Il est excellent pour la plupart des choses, mais il a un bug bizarre : parfois, il voit des choses qui n'existent pas.

Si vous lui montrez la photo d'une banane sur une assiette, il pourrait affirmer avec assurance : « Oui, je vois un couteau à côté de la banane », alors qu'il n'y a aucun couteau. Dans le monde de l'IA, c'est ce qu'on appelle une hallucination. C'est comme une personne qui a tellement envie de faire plaisir ou qui est tellement habituée à certains schémas qu'elle invente des détails pour combler les vides.

L'Ancienne Méthode : Vérifier une Liste Statique

Auparavant, les chercheurs essayaient de trouver ces erreurs en montrant à l'IA une liste fixe de photos (comme un test à choix multiples). Ils demandaient : « Vois-tu un couteau ? » et regardaient si l'IA se trompait.

  • La Faille : C'est comme tester un conducteur uniquement sur un parking spécifique et vide. Vous pourriez manquer le fait qu'il panique lorsqu'il voit un ballon rouge rouler dans la rue. Les anciens tests étaient trop rigides et ne pouvaient pas trouver de nouvelles ou de bizarres façons dont l'IA pouvait échouer.

La Nouvelle Solution : GHOST (L'Artiste du « Tour de Magie »)

Les auteurs présentent GHOST (Generating Hallucinations via Optimizing Stealth Tokens). Voyez GHOST comme un magicien qui ne se contente pas de montrer une photo à l'IA ; il peint une nouvelle image spécifiquement conçue pour piéger l'IA et lui faire voir un fantôme.

Voici comment fonctionne GHOST, étape par étape :

1. L'Optimisation de l'« Encre Invisible »

GHOST part d'une photo normale (comme la banane sur l'assiette). Il veut faire croire à l'IA qu'il y a un couteau.

  • Au lieu de dessiner un couteau (ce qui serait évident pour un humain), GHOST travaille dans un « langage secret » appelé embeddings. Imaginez cela comme l'état de rêve interne de l'IA.
  • GHOST modifie cet état de rêve de manière infime. Il ajoute des indices d'« encre invisible ». Peut-être change-t-il légèrement la courbe de la tige de la banane pour qu'elle ressemble légèrement à un manche de couteau pour l'IA, mais pour un humain, elle ressemble toujours exactement à une banane.

2. Le « Traducteur » (Le Mapper)

Il y a un problème : l'IA qui regarde l'image (le MLLM) parle une langue différente de l'IA qui peint l'image (le Modèle de Diffusion).

  • GHOST construit un traductur (appelé mapper). Ce traducteur prend les « ajustements de rêve secrets » du peintre et les traduit en instructions que le peintre peut comprendre, sans avoir besoin de demander de l'aide à l'observateur (le MLLM) chaque seconde. Cela rend le processus extrêmement rapide.

3. Le « Peintre de Rêves » (Diffusion)

Une fois les instructions secrètes prêtes, GHOST utilise un Modèle de Diffusion (un type d'IA qui crée des images à partir de bruit) pour peindre l'image finale.

  • Il part de la photo originale de la banane et « débruite » doucement l'image en fonction des instructions secrètes.
  • Le Résultat : L'image finale semble 100 % naturelle pour un humain. C'est toujours une banane sur une assiette. Mais pour l'IA, les changements subtils dans l'éclairage ou la forme sont suffisants pour qu'elle s'écrie : « JE VOIS UN COTEAU ! »

Pourquoi est-ce une avancée majeure ?

L'article revendique trois victoires majeures grâce à GHOST :

  1. C'est un Maître Détective :

    • Les anciennes méthodes trouvaient environ 1 % des cas d'hallucination.
    • GHOST en a trouvé plus de 28 %. C'est comme passer d'un détecteur de métaux qui rate 99 % des pièces à un détecteur qui en trouve presque toutes.
  2. C'est un Piège Universel (Transférabilité) :

    • GHOST peut piéger une IA (comme Qwen) puis montrer cette même image « piégée » à une IA totalement différente (comme GPT-4o).
    • Le Résultat : La seconde IA hallucine aussi ! Cela prouve que les différentes IA partagent les mêmes angles morts. C'est comme trouver un type spécifique d'illusion d'optique qui trompe à la fois vos yeux et ceux de votre ami, même si vous avez une vision différente.
  3. C'est un Remède, Pas Juste un Test :

    • Les auteurs n'ont pas seulement utilisé GHOST pour casser des choses ; ils l'ont utilisé pour les réparer.
    • Ils ont pris les images « piégées » créées par GHOST et les ont montrées à l'IA avec la bonne réponse (« Non, il n'y a pas de couteau »).
    • Le Résultat : L'IA est devenue meilleure pour ne plus halluciner à l'avenir. C'est comme montrer à un étudiant les questions pièges exactes auxquelles il a mal répondu pour qu'il puisse apprendre la bonne réponse.

L'Essentiel à Retenir

GHOST est un outil qui crée automatiquement des « photos pièges » pour tester la résistance des systèmes de vision par IA. Il prouve que les modèles d'IA actuels sont fragiles et peuvent être facilement trompés par des changements subtils et naturels. Mais plus important encore, il fournit un moyen de trouver ces faiblesses et d'entraîner l'IA pour la rendre plus fiable, garantissant que lorsqu'elle dit qu'elle voit un couteau, elle voit réellement un couteau.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →