← Derniers articles
⚡ electrical engineering

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

Ce papier propose LIME, un cadre d'inférence sans entraînement qui atténue les hallucinations dans les grands modèles de langage multimodaux en utilisant la Propagation de Pertinence par Couche pour ajuster dynamiquement les représentations clé-valeur et imposer une plus grande dépendance aux entrées perceptuelles par rapport aux priors textuels.

Auteurs originaux : Itai Allouche, Joseph Keshet

Publié 2026-05-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Itai Allouche, Joseph Keshet

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un assistant robot très intelligent et multi-talents. Ce robot peut voir des images, entendre des sons et lire du texte, le tout simultanément. Il est censé être un détective qui examine une photo ou écoute un enregistrement pour vous dire exactement ce qui se passe.

Cependant, ce robot a une mauvaise habitude : il se ment à lui-même.

Parfois, vous lui montrez une photo d'un parc vide, et il affirme avec assurance : « Je vois un chien qui joue à rapporter ! » Ou vous faites jouer un enregistrement de silence, et il insiste : « J'entends un chat qui miaule ! » C'est ce qu'on appelle une hallucination. Le robot est tellement habitué à lire des histoires et à parler de choses qu'il commence à deviner en fonction de ce qui arrive habituellement, plutôt qu'en regardant ce qui est réellement présent.

Le Problème : Le Robot est « Trop Textuel »

Les auteurs de cet article ont découvert pourquoi le robot fait cela. Ils ont constaté que lorsque le robot prend une décision, il écoute beaucoup trop son « cerveau textuel » (sa connaissance des mots et des histoires) et écoute à peine ses « yeux » ou ses « oreilles » (l'image ou le son réel).

Pensez-y comme à un étudiant passant un examen. L'étudiant a beaucoup étudié et connaît le manuel par cœur. Mais lorsque le professeur montre une image et demande : « Qu'y a-t-il sur cette image ? », l'étudiant ignore l'image et écrit simplement la première chose qui lui vient à l'esprit tirée du manuel. L'étudiant « hallucine » parce qu'il ne regarde pas les preuves.

La Solution : LIME (Learning Inference-time Modality Enhancement)

Les chercheurs ont créé une solution appelée LIME. La partie intéressante ? Ils n'ont pas eu à réapprendre au robot ni à modifier son cerveau (son code). Au lieu de cela, ils lui ont donné une « pichenette » au moment précis où il répond à une question.

Voici comment LIME fonctionne, en utilisant une analogie simple :

L'Analogie du « Projecteur »
Imaginez que le robot se trouve dans une pièce sombre avec une lampe de poche.

  1. Sans LIME : Le robot dirige la majeure partie de son projecteur sur une pile de livres (le texte). Il ignore les objets réels de la pièce (l'image ou le son). Il devine ce qui se trouve dans la pièce en se basant sur les livres.
  2. Avec LIME : Les chercheurs installent un capteur intelligent qui détecte où le robot regarde. Si le robot commence à ignorer l'image, LIME repousse doucement le faisceau de la lampe de poche vers l'image. Il force le robot à dire : « Attendez, laissez-moi regarder l'image à nouveau avant de parler. »

Comment il fait cela techniquement (simplifié) :
Le robot répond un mot à la fois. Chaque fois qu'il est sur le point de choisir le mot suivant, LIME intervient et demande :

  • « Dans quelle mesure l'image vous a-t-elle aidé à décider ce mot ? »
  • « Dans quelle mesure le texte vous a-t-il aidé ? »

Si l'image n'a pas aidé suffisamment, LIME effectue un tout petit ajustement temporaire de la mémoire interne du robot (spécifiquement les parties « Clé » et « Valeur » de son cerveau) pour donner plus de poids à l'image. Il le fait en une fraction de seconde, puis réinitialise pour le mot suivant. C'est comme un entraîneur qui chuchote : « Regarde le ballon ! » juste avant que le joueur ne frappe.

Qu'est-il Arrivé Quand Ils L'Ont Essayé ?

Les chercheurs ont testé cela sur de nombreuses tâches différentes :

  • Vision : Ils ont montré des images au robot et demandé : « Y a-t-il un ballon de sport ? » ou « Décrivez cette image. »
  • Audio : Ils ont fait jouer des sons et demandé : « Entendez-vous un chat ? »

Les Résultats :

  • Moins de Mensonges : Le robot a arrêté d'inventer des objets qui n'étaient pas là. S'il n'y avait pas de ballon, il disait « Non » au lieu de deviner « Oui ».
  • Meilleure Concentration : Lorsque le robot parlait effectivement de quelque chose, il regardait réellement la bonne partie de l'image ou le bon moment dans le son.
  • Pas de Réentraînement : Ils n'ont pas eu à passer des mois à réapprendre au robot. Ils ont simplement changé la façon dont il pensait pendant qu'il répondait.

Le Compromis

Il y a un hic. Comme LIME doit faire une pause et effectuer cet ajustement supplémentaire de « projecteur » pour chaque mot que le robot dit, il faut un peu plus de temps pour obtenir une réponse. C'est comme avoir un assistant très intelligent qui est légèrement plus lent parce qu'il vérifie deux fois son travail avant chaque phrase. Mais pour les situations où la précision est plus importante que la vitesse, c'est une victoire énorme.

Résumé

L'article montre que les modèles d'IA mentent souvent parce qu'ils se fient trop à leur mémoire des mots et pas assez à ce qu'ils voient ou entendent réellement. La nouvelle méthode, LIME, agit comme un entraîneur en temps réel qui force l'IA à prêter attention aux preuves (l'image ou le son) juste avant qu'elle ne parle, ce qui donne des réponses beaucoup plus honnêtes et précises sans avoir besoin de réentraîner l'IA depuis zéro.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →