← Derniers articles
💬 NLP

VisRAG2.0: Mitigating Visual Hallucinations via Evidence-Guided Multi-Image Reasoning in Visual Retrieval-Augmented Generation

L'article propose EVisRAG, un cadre guidé par l'évidence qui atténue les hallucinations visuelles dans le raisonnement multi-images en collectant explicitement des preuves visuelles pertinentes par rapport à la question et en employant un nouvel algorithme RS-GRPO pour une optimisation conjointe améliorée de la localisation et du raisonnement, atteignant des gains de performance significatifs sur les benchmarks de questions-réponses visuelles.

Auteurs originaux : Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

Publié 2026-07-29
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yubo Sun, Chunyi Peng, Yukun Yan, Shi Yu, Zhenghao Liu, Sen Mei, Chi Chen, Maosong Sun

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayiez de résoudre un mystère, mais au lieu d'un indice unique, on vous remet une pile désordonnée de trois journaux, photos et cartes différents. Vous avez un détective super intelligent dans votre poche — un programme informatique appelé Modèle de Langage-Vision (VLM) — qui peut lire du texte et regarder des images. Ce détective est excellent pour répondre aux questions, mais parfois, face à une énorme pile d'images, il s'embrouille. Il peut commencer à inventer des détails qu'il n'a pas vus, comme prétendre qu'une photo montre un chat alors qu'il s'agit d'un chien, ou mélanger des faits provenant de deux pages différentes. C'est ce qu'on appelle une « hallucination visuelle ».

Pour aider ces détectives, des scientifiques ont développé un système appelé Génération Augmentée par Récupération Visuelle (VRAG). Voyez cela comme le fait de donner une carte de bibliothèque au détective. Lorsque vous posez une question, le système extrait instantanément les pages les plus pertinentes de la bibliothèque et les tend au détective. L'idée est que si le détective a les bonnes preuves juste sous ses yeux, il n'aura pas besoin de deviner ou d'inventer des choses. Cependant, même avec les bonnes pages, le détective a souvent du mal à trouver la phrase exacte ou l'image dont il a besoin parmi le bruit, ou il peut être distrait par des détails non pertinents et inventer quand même une réponse. La grande question est : comment enseigner au détective à être un véritable enquêteur qui scanne attentivement chaque page, note uniquement les faits qu'il voit réellement, puis résout le mystère sans deviner ?

C'est exactement ce que le papier « VisRAG2.0 » (plus précisément le cadre EVisRAG) cherche à résoudre. Les auteurs, une équipe de chercheurs d'universités chinoises, proposent une nouvelle façon d'entraîner ces détectives IA pour qu'ils arrêtent d'halluciner et commencent à raisonner avec des preuves réelles. Ils ont constaté que les méthodes précédentes étaient comme donner une pile de papiers au détective en lui disant : « Débrouille-toi ! », ce qui menait souvent à la confusion. Au lieu de cela, EVisRAG force le modèle à agir comme un détective méticuleux qui suit un processus strict en trois étapes : Observer, Enregistrer et Raisonner.

Premièrement, le modèle regarde les images récupérées et énonce explicitement ce qu'il voit, page par page. Deuxièmement, il crée un « journal de preuves », en écrivant des faits spécifiques de chaque image et, surtout, en notant lorsqu'une image ne contient aucune information utile. Enfin, il utilise uniquement ce journal écrit pour résoudre le problème. Pour s'assurer que le modèle apprend réellement ce comportement, les chercheurs ont inventé une nouvelle méthode d'entraînement appelée RS-GRPO (Optimisation de Politique de Groupe Relative à Portée de Récompense). Vous pouvez voir cela comme un entraîneur très strict qui ne se contente pas de donner une note pour la réponse finale. Au lieu de cela, l'entraîneur donne un score séparé pour « A-t-il regardé la bonne image ? » et un autre score pour « A-t-il écrit le fait correctement ? ». Cela empêche le modèle d'obtenir une bonne note simplement en trouvant la bonne réponse par chance, garantant qu'il apprend réellement à trouver d'abord les preuves.

Les résultats de cette nouvelle approche sont assez impressionnants. Testé sur divers benchmarks de questions-réponses visuelles (comme la lecture de graphiques, de documents et de diapositives), le modèle EVisRAG surpasse systématiquement les modèles « backbone » standards d'une précision moyenne d'environ 19 %. Plus important encore, il réduit considérablement le nombre de fois où le modèle invente des faits. Dans un test spécifique, un modèle standard pourrait regarder un graphique et affirmer avec assurance que le mauvais pays a une population plus grande parce qu'il a halluciné un chiffre. EVisRAG, cependant, regarderait le graphique, écrirait les chiffres corrects dans son journal de preuves, puis déduirait correctement la réponse.

Le papier soutient également l'idée que le simple fait de faire « réfléchir plus longtemps » le modèle ou d'ajouter des agents plus complexes au système n'est pas la meilleure solution. Au lieu de cela, ils démontrent qu'une approche structurée, guidée par les preuves et combinée à leur méthode d'entraînement spécifique (RS-GRPO), est plus efficace. Ils ont démontré qu'en délimitant les récompenses — en ne donnant du crédit que pour les bonnes actions au bon moment — le modèle devient beaucoup plus stable et fiable. Bien que le papier ne prétende pas résoudre tous les problèmes possibles de l'IA, les expériences suggèrent que cette méthode est un grand pas en avant pour rendre les systèmes d'IA visuelle plus dignes de confiance, plus précis et moins enclins à inventer des choses lorsqu'ils examinent plusieurs images.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →