Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment
Cet article propose la Saliency-Driven Perceptual Realignment (SDPR), un cadre de travail sans entraînement qui atténue les hallucinations dans les grands modèles vision-langage en redistribuant l'attention des jetons non sémantiques, en alignant les caractéristiques du cache KV pour prévenir la distorsion spatiale et en appliquant un décodage contrastif pour contrer les priors linguistiques, atteignant ainsi une performance supérieure sans entraînement supplémentaire ni surcharge de temps d'exécution significative.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Dans le monde en évolution rapide de l'intelligence artificielle, une nouvelle génération de systèmes a émergé, capables de voir et de parler en même temps. Ces grands modèles de vision-langage agissent comme des observateurs numériques, capables de regarder une photographie et de décrire ce qui s'y passe, ou de répondre à des questions sur la scène. Ils ont appris à connecter le monde visuel au langage humain, créant un pont entre les pixels et les mots. Cependant, malgré leur capacité impressionnante à générer des phrases fluentes et souvent sensées, ces systèmes souffrent d'un défaut persistant et frustrant : ils mentent fréquemment. Ils pourraient décrire avec assurance une personne tenant un ballon rouge alors que l'image montre un cerf-volant bleu, ou inventer des détails qui n'existent tout simplement pas. Cette tendance à générer des informations fausses, connue sous le nom d'hallucination, provient d'une dépendance profonde à ce que le modèle a lu auparavant plutôt qu'à ce qu'il voit réellement en ce moment. Lorsque les preuves visuelles sont peu claires ou complexes, le système se rabat souvent sur des suppositions basées sur sa bibliothèque interne de motifs linguistiques, produisant des réponses qui semblent correctes mais qui sont factuellement erronées. Cette imprévisibilité empêche ces outils puissants d'être dignes de confiance dans des situations réelles où l'exactitude est essentielle.
Des chercheurs de l'Université de Xidian et de l'Université de Tsinghua ont identifié les causes profondes de cette confusion visuelle et ont développé une méthode pour aider ces modèles à « voir clairement » avant de répondre. Leurs travaux révèlent que le problème n'est pas seulement un manque de connaissances, mais un échec dans la manière dont le modèle traite et mémorise ce qu'il voit pendant la fraction de seconde où il réfléchit. L'équipe a découvert qu'en analysant une image, l'attention du modèle est souvent détournée par des détails d'arrière-plan sans importance, ce qui le pousse à ignorer les parties les plus critiques de l'image. De plus, au fur et à mesure que le modèle commence à générer sa réponse mot par mot, sa mémoire de la scène visuelle se dégrade, devenant déformée et moins connectée à la question spécifique posée. Pour corriger cela, les chercheurs ont introduit un cadre ne nécessitant pas de réentraînement appelé Saliency-Driven Perceptual Realignment (Réalignement Perceptuel Piloté par la Saillance). Cette approche ne nécessite pas de réentraîner le modèle d'IA massif à partir de zéro ; au lieu de cela, elle agit comme un guide pendant le processus de réflexion, corrigeant doucement la focalisation et la mémoire du modèle pour s'assurer qu'il reste ancré dans la réalité visuelle de l'image.
La première étape de ce processus de correction s'attaque au moment où le modèle regarde l'image pour la première fois. Les chercheurs ont découvert que le mécanisme d'attention interne du modèle reste souvent bloqué sur des « jetons puits » (sink tokens), qui sont essentiellement des éléments d'arrière-plan sans signification qui captent accidentellement trop de l'attention. Imaginez une personne essayant d'écouter une conversation dans une pièce bruyante ; si son attention est détournée par un bruit fort et non pertinent, elle manque les mots importants qui sont prononcés. De même, le modèle laissait ces distractions de fond étouffer les indices visuels saillants, tels que le visage d'une personne ou un objet spécifique. La nouvelle méthode détecte quand ce détournement de l'attention se produit et redistribue l'attention du modèle, l'éloignant du bruit pour le ramener vers les parties significatives de l'image. En faisant cela, le modèle récupère les preuves visuelles supprimées qu'il ignorait auparavant, lui permettant de voir la scène plus précisément avant même de commencer à parler.
Une fois que le modèle a une vue plus claire, le second défi surgit lorsqu'il commence à générer sa réponse. Le modèle stocke une mémoire de l'image pour s'y référer en écrivant chaque nouveau mot. Cependant, les chercheurs ont observé que cette mémoire se déforme avec le temps. Parce que le modèle traite l'image et la question dans un ordre spécifique, la mémoire des détails visuels devient liée à leur position dans la séquence plutôt qu'à leur importance réelle pour la question. C'est comme si le modèle oubliait qu'un objet spécifique est important parce qu'il a été vu tôt dans la séquence, tandis que des détails ultérieurs, moins importants, deviennent trop prédominants dans sa mémoire. Pour contrer cela, le nouveau cadre réaligne cette mémoire interne. Il injecte un signal qui souligne les parties de l'image qui sont réellement pertinentes pour la question actuelle, garantissant que la mémoire du modèle reste concentrée sur les bonnes preuves visuelles tout au long du processus de génération, plutôt que de dériver vers des détails non pertinents.
Enfin, même avec une vue claire et une bonne mémoire, le modèle est toujours tenté de s'appuyer sur ses habitudes linguistiques préexistantes. Parfois, le modèle sait que la réponse est « oui » d'après l'image, mais ses motifs linguistiques internes suggèrent fortement « non » parce que c'est une expression courante dans ses données d'entraînement. Pour empêcher cela, les chercheurs ont ajouté une vérification finale qui compare la prédiction basée sur le visuel du modèle à une référence construite à partir de ses propres habitudes linguistiques. Si les deux divergent, le système supprime activement la supposition basée sur le langage et force le modèle à s'en tenir aux preuves visuelles. Ce processus contrastif garantit que la réponse finale est dictée par ce qui se trouve réellement dans l'image, et non par ce que le modèle s'attend à voir.
Les résultats de l'application de cette stratégie en trois parties sont significatifs. Testée sur divers grands modèles de vision-langage, la méthode a systématiquement réduit le nombre d'hallucinations et amélioré la précision des réponses. Dans des tests spécifiques mesurant la fréquence à laquelle les modèles identifient correctement les objets, la nouvelle approche a montré des améliorations allant jusqu'à près de sept points, et dans des tests mesurant la fréquence des détails hallucinés, elle a réduit les erreurs de plus d'un tiers. Crucialement, tout cela a été accompli sans nécessiter de réentraînement coûteux ou de données supplémentaires, simplement en ajustant la façon dont le modèle prête attention et mémorise l'information pendant son travail. En traitant systématiquement la dégradation de la conscience visuelle, du premier regard à la phrase finale, cette recherche offre un moyen robuste de rendre ces puissants systèmes d'IA plus fiables, garantissant qu'ils disent la vérité sur ce qu'ils voient.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.