← Derniers articles
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

L'article présente DRAGON, un ensemble de données de référence et un cadre d'évaluation conçus pour évaluer la capacité des modèles vision-langage à ancrer leurs réponses dans des preuves visuelles spécifiques au sein de diagrammes, en palliant la limite d'une haute précision sans justification de raisonnement fiable.

Auteurs originaux : Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Publié 2026-04-29
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous passez un examen où vous devez observer un diagramme complexe — comme une carte, un circuit imprimé ou un graphique en barres — et répondre à une question le concernant.

Par le passé, si un programme informatique (une IA) donnait la bonne réponse, nous supposions qu'il « comprenait » l'image. Mais ce nouvel article, DRAGON, soutient que fournir la bonne réponse ne suffit pas. L'IA pourrait tricher. Elle pourrait deviner la réponse en se basant sur les mots de la question ou sur des motifs dans les données, sans réellement examiner les parties spécifiques de l'image qui prouvent que la réponse est vraie.

Pensez-y comme à un élève passant un examen de mathématiques.

  • L'ancienne méthode : Si l'élève écrit « 42 » comme réponse, le professeur lui met une coche. Nous ne savons pas s'il a fait les calculs ou s'il a simplement deviné.
  • La méthode DRAGON : Le professeur exige de voir le travail de l'élève. L'élève doit entourer les chiffres spécifiques qu'il a utilisés, dessiner des flèches vers les formules et surligner la partie du graphique qui a conduit au « 42 ». S'il ne peut pas pointer la preuve, il n'a pas vraiment résolu le problème, même si le chiffre final était correct.

Qu'est-ce que DRAGON ?

DRAGON est un nouveau « test » (référentiel) conçu pour démasquer les modèles d'IA qui devinent. Il pose une question simple mais difficile : « Montrez-moi exactement où, dans l'image, vous avez trouvé la réponse. »

Pour réussir ce test, l'IA doit dessiner un cadre autour des indices visuels spécifiques qu'elle a utilisés. Ces indices pourraient être :

  • Une barre spécifique sur un graphique.
  • Une étiquette sur une carte.
  • Un fil sur un schéma de circuit.
  • Une légende ou un titre.

Comment ils ont construit le test

Les chercheurs n'ont pas simplement demandé à l'IA de deviner ; ils ont créé une immense bibliothèque de plus de 11 000 questions issues de six types différents de diagrammes (graphiques, cartes, circuits, etc.).

Pour chaque question, des humains ont agi en tant que « véridiques ». Ils ont examiné le diagramme et la bonne réponse, puis ont dessiné les exactes boîtes autour des preuves visuelles nécessaires pour prouver cette réponse.

  • Analogie : Imaginez un détective résolvant un crime. Les annotateurs humains sont ceux qui disent : « L'indice n'est pas juste toute la pièce ; l'indice est cette empreinte de boue spécifique sur le sol. » L'IA doit ensuite trouver cette même empreinte.

Les trois façons dont ils ont interrogé l'IA

Les chercheurs ont essayé trois « invites » (façons de demander à l'IA d'accomplir la tâche) différentes pour voir si elle pouvait apprendre à montrer son travail :

  1. EDGE (L'approche directe) : « Voici l'image et la réponse. Dessinez simplement les cadres autour des preuves. » (Comme demander à un élève de simplement écrire la réponse).
  2. SAGE (L'approche étape par étape) : « D'abord, dites-moi quoi vous devez examiner (par exemple, « la barre rouge » et « l'année 2020 »). Ensuite, dessinez les cadres autour d'eux. » (Comme demander à l'élève de lister ses étapes avant de résoudre le problème).
  3. VERGE (L'approche d'auto-correction) : « Dessinez vos cadres. Maintenant, regardez à nouveau votre dessin. Avez-vous manqué quelque chose ? Votre cadre est-il trop grand ? Corrigez-le. » (Comme demander à l'élève de revérifier son travail).

Ce qu'ils ont découvert (les résultats)

Les résultats ont été une sorte de réveil pour la communauté de l'IA :

  • L'IA est bonne pour deviner, mauvaise pour prouver : De nombreux modèles d'IA ont trouvé la bonne réponse, mais lorsqu'on leur a demandé de dessiner les cadres, ils ont échoué lamentablement. Ils pointaient souvent la mauvaise partie de l'image ou manquaient des détails cruciaux.
  • Le problème de la « boîte noire » : Même les modèles d'IA les plus intelligents (comme Claude Opus ou Gemini) avaient du mal à montrer leur travail. Ils pouvaient dire « La réponse est 50 », mais ils ne pouvaient pas pointer de manière fiable le « 50 » sur le graphique.
  • Certains modèles sont meilleurs que d'autres : Les modèles « fermés » (les gros modèles coûteux de sociétés comme Anthropic et Google) étaient meilleurs pour trouver les preuves que les modèles open source, mais aucun d'entre eux n'était parfait.
  • Demander poliment aide un peu : L'utilisation des méthodes étape par étape (SAGE) ou d'auto-correction (VERGE) a aidé l'IA à trouver les bons endroits un peu plus souvent, mais cela n'a pas résolu le problème fondamental. L'IA manquait encore souvent des parties des preuves.

Pourquoi cela compte

L'article conclut que nous ne pouvons pas faire confiance à l'IA pour raisonner sur des diagrammes simplement parce qu'elle obtient la bonne réponse. Si une IA est utilisée pour analyser des dossiers médicaux, des graphiques financiers ou des schémas de sécurité, nous devons savoir pourquoi elle a pris une décision.

DRAGON est un outil pour forcer l'IA à arrêter de deviner et à commencer à « montrer son travail ». C'est une nouvelle norme pour garantir que lorsqu'une IA dit qu'elle comprend une image, elle peut réellement pointer la preuve.

Les limites

Les auteurs admettent que leur test n'est pas parfait. Ils utilisent de simples cadres rectangulaires pour marquer les preuves. Cela fonctionne pour de grandes barres ou blocs, mais il est difficile d'utiliser un cadre pour marquer un fil fin et sinueux dans un schéma de circuit ou une flèche courbe sur une carte. De plus, parfois, différents humains peuvent ne pas être d'accord sur exactement quelle partie de l'image est l'indice « le plus important », ce qui ajoute un peu de subjectivité au test.

En résumé : DRAGON est un nouveau code de règles qui dit : « Ne me donnez pas juste la réponse ; montrez-moi la preuve dans l'image. » Et pour l'instant, la plupart des élèves IA échouent à ce test.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →