← Nieuwste papers
💬 NLP

DRAGON: A Benchmark for Evidence-Grounded Visual Reasoning over Diagrams

Het artikel introduceert DRAGON, een benchmarkdataset en evaluatiekader dat is ontworpen om het vermogen van visueel-taalmodellen te beoordelen om hun antwoorden te verankeren in specifiek visueel bewijsmateriaal binnen diagrammen, waarmee de beperking van hoge nauwkeurigheid zonder betrouwbare redeneringsrechtvaardiging wordt aangepakt.

Oorspronkelijke auteurs: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Gepubliceerd 2026-04-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Anirudh Iyengar Kaniyar Narayana Iyengar, Tampu Ravi Kumar, Gaurav Najpande, Manan Suri, Dinesh Manocha, Puneet Mathur, Vivek Gupta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een toets maakt waarbij je naar een complex diagram moet kijken—zoals een kaart, een printplaat of een staafdiagram—en een vraag daarover moet beantwoorden.

In het verleden, als een computerprogramma (een AI) het juiste antwoord gaf, gingen we ervan uit dat het de afbeelding "begreep". Maar dit nieuwe paper, DRAGON, stelt dat het juiste antwoord geven niet genoeg is. De AI zou kunnen valsspelen. Het zou het antwoord kunnen raden op basis van de woorden in de vraag of patronen in de data, zonder daadwerkelijk naar de specifieke delen van de afbeelding te kijken die bewijzen dat het antwoord waar is.

Denk eraan als een student die een wiskundetoets maakt.

  • De Oude Manier: Als de student "42" als antwoord schrijft, geeft de leraar een vinkje. We weten niet of ze de som hebben uitgerekend of gewoon geraden hebben.
  • De DRAGON Manier: De leraar eist het werk van de student te zien. De student moet de specifieke getallen die ze hebben gebruikt omcirkelen, pijlen trekken naar de formules, en het deel van de grafiek dat leidde tot "42" markeren. Als ze niet kunnen wijzen naar het bewijs, hebben ze het probleem niet echt opgelost, zelfs niet als het eindgetal correct was.

Wat is DRAGON?

DRAGON is een nieuwe "toets" (benchmark) ontworpen om AI-modellen die gissen op te sporen. Het stelt een simpele maar moeilijke vraag: "Laat me precies zien waar in de afbeelding je het antwoord hebt gevonden."

Om deze toets te halen, moet de AI een kader trekken rond de specifieke visuele aanwijzingen die het heeft gebruikt. Deze aanwijzingen kunnen zijn:

  • Een specifieke staaf in een diagram.
  • Een label op een kaart.
  • Een draad op een schakelschema.
  • Een legenda of een titel.

Hoe Ze De Toets Bouwden

De onderzoekers vroegen de AI niet zomaar te raden; ze bouwden een enorme bibliotheek van meer dan 11.000 vragen uit zes verschillende soorten diagrammen (grafieken, kaarten, schakelingen, enz.).

Voor elke enkele vraag fungeerden mensen als de "waarheidsgetuigen". Ze keken naar het diagram en het juiste antwoord, en trokken vervolgens de exacte kaders rond het visuele bewijs dat nodig was om dat antwoord te bewijzen.

  • Vergelijking: Stel je een detective voor die een misdaad oplost. De menselijke annotatoren zijn degenen die zeggen: "Het bewijs is niet gewoon de hele kamer; het bewijs is dit specifieke modderige voetafdruk op de vloer." De AI moet dan datzelfde voetafdruk vinden.

De Drie Manieren waarop Ze de AI Vroegen

De onderzoekers probeerden drie verschillende "prompts" (manieren om de AI de taak te laten uitvoeren) om te zien of het kon leren om zijn werk te tonen:

  1. EDGE (De Directe Aanpak): "Hier is de afbeelding en het antwoord. Teken gewoon de kaders rond het bewijs." (Zoals een student vragen om gewoon het antwoord te schrijven).
  2. SAGE (De Stap-voor-Stap Aanpak): "Vertel me eerst wat dingen je moet bekijken (bijvoorbeeld 'de rode staaf' en 'het jaar 2020'). Teken daarna de kaders eromheen." (Zoals een student vragen om hun stappen op te sommen voordat ze oplossen).
  3. VERGE (De Zelfcorrectie Aanpak): "Teken je kaders. Kijk nu nog eens naar je tekening. Heb je iets gemist? Is je kader te groot? Maak het goed." (Zoals een student vragen om hun werk te dubbelchecken).

Wat Ze Vonden (De Resultaten)

De resultaten waren een beetje een wakkerbel voor de AI-gemeenschap:

  • AI is goed in raden, slecht in bewijzen: Veel AI-modellen kregen het juiste antwoord, maar toen ze werden gevraagd de kaders te tekenen, faalden ze jammerlijk. Ze wezen vaak naar het verkeerde deel van de afbeelding of misten cruciale details.
  • Het "Black Box" Probleem: Zelfs de slimste AI-modellen (zoals Claude Opus of Gemini) hadden moeite om hun werk te tonen. Ze konden zeggen "Het antwoord is 50", maar ze konden niet betrouwbaar wijzen naar de "50" op het diagram.
  • Sommige modellen zijn beter dan anderen: De "closed-source" modellen (de grote, dure modellen van bedrijven zoals Anthropic en Google) waren beter in het vinden van het bewijs dan de open-source modellen, maar geen enkele van hen was perfect.
  • Vriendelijk vragen helpt een beetje: Het gebruik van de stap-voor-stap (SAGE) of zelfcorrectie (VERGE) methoden hielp de AI iets vaker de juiste plekken te vinden, maar het loste het fundamentele probleem niet op. De AI miste nog steeds vaak delen van het bewijs.

Waarom Dit Belangrijk Is

Het paper concludeert dat we AI niet kunnen vertrouwen om redeneringen over diagrammen te maken, alleen omdat het het juiste antwoord geeft. Als een AI wordt gebruikt om medische charts, financiële grafieken of veiligheidsdiagrammen te analyseren, moeten we weten waarom het een beslissing heeft genomen.

DRAGON is een hulpmiddel om AI te dwingen te stoppen met raden en te beginnen met "het tonen van zijn werk". Het is een nieuwe standaard om ervoor te zorgen dat wanneer een AI zegt dat het een afbeelding begrijpt, het daadwerkelijk naar het bewijs kan wijzen.

De Beperkingen

De auteurs erkennen dat hun toets niet perfect is. Ze gebruiken eenvoudige rechthoekige kaders om bewijs te markeren. Dit werkt voor grote balken of blokken, maar het is moeilijk om een kader te gebruiken om een dunne, kronkelende draad in een schakelschema of een gebogen pijl op een kaart te markeren. Ook kunnen verschillende mensen soms het oneens zijn over welk deel van de afbeelding precies de "belangrijkste" aanwijzing is, wat een beetje subjectiviteit aan de toets toevoegt.

Kortom: DRAGON is een nieuw reglement dat zegt: "Geef me niet alleen het antwoord; laat me het bewijs in de afbeelding zien." En op dit moment slagen de meeste AI-studenten die toets niet.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →