← Derniers articles
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

Le document propose HEAL, un nouveau cadre qui identifie et atténue les hallucinations dans les modèles de langage multimodaux de grande taille en analysant les dérives de distribution d'information dans les têtes de synergie et en appliquant un étalonnage dynamique pour orienter les sorties vers des preuves factuelles.

Auteurs originaux : Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Publié 2026-09-10
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Les modèles de langage de grande taille multimodaux constituent une nouvelle classe puissante d'intelligence artificielle conçue pour voir et parler simultanément. Contrairement aux systèmes traditionnels qui traitent le texte ou les images de manière isolée, ces modèles peuvent regarder une photographie et la décrire, répondre à des questions à son sujet ou raconter une histoire basée sur ce qu'ils voient. Ils fonctionnent en tissant ensemble deux flux distincts d'informations : les données visuelles de l'image et les motifs linguistiques appris à partir de vastes quantités de texte. Pour que ces systèmes soient véritablement utiles dans des domaines à enjeux élevés comme l'imagerie médicale ou la conduite autonome, ils doivent être fiables. Cependant, ils souffrent fréquemment d'un problème connu sous le nom d'hallucination. Cela se produit lorsque le modèle génère une réponse qui semble confiante et plausible, mais qui est factuellement erronée par rapport au monde visuel, comme affirmer qu'une photo de chat contient un chien, ou inventer des détails qui ne sont tout simplement pas présents dans l'image.

Pendant longtemps, les chercheurs ont cru que ces erreurs se produisaient parce que le modèle prêtait trop d'attention à sa connaissance interne du langage et pas assez à l'image réelle. L'idée prédominante était qu'au fur et à mesure que le modèle rédigeait sa réponse, il s'éloignait de l'image et s'appuyait trop lourdement sur ce qu'il s'attendait à voir en se basant uniquement sur les mots. Pour corriger cela, les tentatives précédentes se sont concentrées sur le fait de forcer le modèle à regarder plus attentivement l'image ou en réentraînant l'ensemble du système à partir de zéro. Ces méthodes traitaient souvent le modèle comme une boîte noire, ajustant son comportement de l'extérieur sans comprendre la mécanique interne de la cause de l'erreur en premier lieu.

Une équipe de chercheurs de l'Université de technologie avancée de Shenzhen a maintenant regardé à l'intérieur du moteur de ces modèles pour trouver une explication différente. Ils proposent que les hallucinations ne sont pas causées par un simple manque d'attention envers l'image, ni par le fait que le modèle ignore l'image. Au contraire, ils ont découvert que l'erreur survient lorsque l'équilibre interne entre l'information visuelle et linguistique devient instable au sein de parties spécifiques du réseau de traitement du modèle. Les chercheurs ont développé une méthode appelée HEAL, qui signifie Head-lEvel information disentTanglement and caLibration (Désenchevêtrement et calibrage de l'information au niveau des têtes), pour identifier et corriger ce déséquilibre en temps réel.

Le cœur de leur découverte réside dans la manière dont le modèle traite l'information. À l'intérieur de ces grands modèles, il existe de nombreuses petites unités de traitement appelées têtes d'attention. Imaginez ces têtes comme une équipe de spécialistes travaillant ensemble pour comprendre une phrase. Certains spécialistes se concentrent purement sur les mots, d'autres purement sur l'image, et un troisième groupe travaille à fusionner les deux. Les chercheurs ont découvert que le groupe responsable de la fusion des deux flux — ce qu'ils appellent les têtes de synergie — est l'endroit où les problèmes commencent. Lorsque le modèle fonctionne correctement, ces têtes de synergie maintiennent un équilibre sain, maintenant l'information visuelle et linguistique dans un équilibre stable. Cependant, lorsque le modèle commence à halluciner, cet équilibre se rompt. La distribution de l'information au sein de ces têtes de fusion dévie de cet équilibre sain, provoquant la perte d'ancrage du modèle dans les preuves visuelles.

Crucialement, les chercheurs ont écarté l'idée que les hallucinations se produisent simplement parce qu'il y a trop peu de spécialistes regardant l'image ou parce que les spécialistes de l'image sont trop faibles. Leur analyse a montré que le nombre de têtes focalisées sur le visuel reste constant, que le modèle dise la vérité ou qu'il mente. Le problème n'est pas une pénurie d'attention visuelle, mais une dérive dans la manière dont les spécialistes de la fusion gèrent le mélange d'informations. Lorsqu'un modèle génère une description correcte, les têtes de synergie maintiennent les entrées visuelles et linguistiques dans un ratio stable. Lorsqu'il hallucine, ce ratio se déforme, penchant souvent trop lourdement vers les motifs linguistiques tandis que la connexion visuelle s'affaiblit, même si l'image est toujours présente.

Pour résoudre cela, l'équipe a créé une stratégie de calibrage dynamique qui agit comme un régulateur en temps réel. Au lieu de réentraîner le modèle ou de changer son architecture, HEAL intervient pendant le processus de génération. Il surveille l'information circulant à travers les têtes de synergie et détecte quand l'équilibre commence à dériver. Lorsqu'une dérive est détectée, le système injecte un facteur de calibrage qui ramène doucement l'information visuelle et linguistique vers l'équilibre correct. Ce processus est continu et adaptatif ; il ne force pas le modèle à ignorer le langage ou à se focaliser excessivement sur l'image, mais oriente plutôt la représentation interne vers un état où la preuve visuelle est correctement pondérée par rapport au contexte linguistique.

Les chercheurs ont testé cette approche sur plusieurs modèles de pointe, incluant des versions de LLaVA et Qwen. Les résultats ont été cohérents à travers différents systèmes et tâches. En appliquant ce calibrage dynamique, les modèles ont produit nettement moins d'hallucinations tout en conservant leur capacité à parler avec fluidité et créativité. Dans les tests conçus pour mesurer la fréquence à laquelle les modèles inventent des objets qui ne sont pas dans l'image, cette nouvelle méthode a réduit les erreurs plus efficacement que les techniques précédentes qui tentaient simplement de booster l'attention visuelle. L'étude suggère que la clé de la fiabilité de ces systèmes n'est pas seulement de les faire regarder plus attentivement l'image, mais de s'assurer que le mélange interne de la vue et de la parole reste stable.

Ce travail offre une nouvelle perspective sur la manière dont l'intelligence artificielle comprend le monde. Il montre que la fiabilité ne dépend pas seulement de la quantité de données ou de la puissance du matériel, mais de la maintenance d'un équilibre interne délicat entre différents types d'informations. En identifiant le point précis où cet équilibre se brise et en fournissant un moyen simple pour le restaurer, les chercheurs ont ouvert une voie vers des systèmes multimodaux plus dignes de confiance. La méthode est légère et ne nécessite pas les ressources de calcul massives nécessaires pour un réentraînement, ce qui en fait un outil pratique pour améliorer la précision de l'IA qui voit et parle. Les conclusions suggèrent que les améliorations futures de la fiabilité de l'IA pourraient provenir de l'ajustement de ces relations internes plutôt que de la construction de modèles plus grands et plus complexes à partir de zéro.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →