← Derniers articles
💬 NLP

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

Le document présente ADAPT, un cadre basé sur l'attention qui atténue les hallucinations dans les grands modèles de langage multimodaux en alignant la dynamique de l'attention croisée texte-image via des ancres visuelles, des mécanismes de correction en ligne et un ajustement par préférence, parvenant ainsi à une réduction significative des hallucinations tout en préservant les capacités générales.

Auteurs originaux : Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Publié 2026-07-01
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un Modèle de Langage Multimodal (MLLM) comme un guide touristique très intelligent et érudit à qui l'on vient de remettre une photographie. Son travail est de décrire la photo avec précision. Cependant, ce guide a une mauvaise habitude : au fur et à mesure qu'il parle, il commence à dériver. Il commence à s'appuyer davantage sur ce qu'il pense devoir se trouver dans l'image (basé sur ses connaissances générales) plutôt que sur ce qui s'y trouve réellement. C'est ce qu'on appelle l'hallucination — inventer des détails comme « un vélo rouge » alors que la photo ne montre qu'une voiture bleue.

Le document ADAPT étudie pourquoi cela se produit et propose une solution en trois parties pour garder le guide concentré sur la photo.

Le Problème : Le « Regard qui Dérive »

Les chercheurs ont découvert que les « yeux » du modèle (son attention croisée interne) sont forts au début, mais deviennent fatigués et confus à mesure que la description s'allonge.

  • Au début : Le modèle regarde exactement le bon endroit (par exemple, l'avion sur la photo).
  • Plus tard : Le regard devient « flou ». Il peut fixer le mauvais coin de l'image, ou il peut cesser totalement de regarder l'image pour simplement deviner en fonction des mots qu'il vient de prononcer.
  • Le Résultat : Le modèle commence à inventer des choses parce qu'il ne vérifie plus les preuves visuelles.

Imaginez cela comme un étudiant passant un examen. Au début, il regarde le manuel (l'image) pour répondre. Mais à mi-chemin, il se fatigue, arrête de regarder le livre et commence à deviner en se basant sur ce dont il se souvient du cours (les biais linguistiques). C'est là qu'il commence à faire des erreurs.

La Solution : ADAPT

Les auteurs ont construit un système appelé ADAPT (Attention Dynamics Alignment with Preference Tuning) pour corriger cela. Ils utilisent trois outils créatifs pour maintenir le « regard » du modèle stable.

1. L'« Ancre Dorée » (Amélioration Visuelle)

Avant que le modèle ne commence à rédiger sa longue description, le système jette un coup d'œil rapide et précoce à la photo pour identifier les faits les plus importants et incontestables.

  • L'Analogie : Imaginez que le guide touristique reçoive un surligneur avant de commencer à parler. Il balaie rapidement la photo et surligne le sujet principal (ex. : « C'est un avion blanc »).
  • La Correction : Cette zone surlignée devient une « Ancre Dorée ». C'est un point de référence stable qui dit : « Peu importe ce qui arrive, rappelle-toi que c'est un avion ». Le système nettoie cette ancre pour éliminer tout biais (comme le fait que le modèle regarde toujours le côté gauche de l'image, quel que soit le contenu).

2. Le « Superviseur de Projecteur » (Inférence Supervisée par l'Attention)

Pendant que le modèle parle, ce superviseur surveille son « regard » en temps réel.

  • L'Analogie : Imaginez un professeur strict debout à côté du guide. Chaque fois que les yeux du guide s'éloignent de l'« Ancre Dorée » ou commencent à fixer le vide, le professeur lui tapote doucement l'épaule.
  • La Correction : Si l'attention du modèle commence à dériver ou à devenir « imprécise », le système ramène instantanément l'attention du modèle vers les parties pertinentes de l'image. Il ne force pas le modèle à dire exactement les mêmes mots, mais il le force à regarder les preuves pertinentes avant de parler.

3. L'« Entraînement à l'Aveugle » (Guidage de l'Attention Visuelle par DPO)

Il s'agit d'une étape d'entraînement où le modèle apprend à préférer regarder la photo plutôt que de deviner.

  • L'Analogie : Le modèle est entraîné selon deux scénarios :
    1. Scénario A (La Bonne Méthode) : Le modèle voit la photo avec l'« Ancre Dorée » surlignée et donne une réponse correcte.
    2. Scénario B (La Mauvaise Méthode) : Le modèle voit un écran noir et bruité (un « bandeau sur les yeux ») et tente de deviner la réponse.
  • La Correction : Le système enseigne au modèle : « Si tu regardes un écran vide, tu ne devrais pas être confiant. Si tu regardes la vraie photo, tu devrais être confiant. » Cela entraîne le modèle à s'appuyer sur les preuves visuelles plutôt que de simplement inventer des choses.

Les Résultats

Lorsque les chercheurs ont testé ce système sur différents modèles d'IA :

  • Moins d'Hallucinations : Les modèles ont inventé 40 à 60 % de détails fictifs en moins.
  • Toujours Intelligent : Les modèles n'ont pas perdu leur capacité générale à parler ou à comprendre ; ils sont juste devenus bien meilleurs pour s'en tenir aux faits de l'image.
  • Efficace : Le système fonctionne rapidement, ajoutant très peu de temps supplémentaire au processus.

Résumé

En bref, ADAPT réalise que les modèles d'IA se « distraient » et commencent à deviner au fur et à mesure qu'ils parlent. Pour corriger cela, il leur donne un point de référence stable (l'Ancre), un superviseur en temps réel pour attraper les regards errants, et un entraînement spécial pour valoriser ce qu'ils voient plutôt que ce qu'ils imaginent. Le résultat est une IA qui dit la vérité sur l'image qu'elle regarde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →