← Nieuwste papers
💻 computer science

VISTAQA: Benchmarking Joint Visual Question Answering and Pixel-Level Evidence

Dit artikel introduceert VISTAQA, een uitgebreide benchmark, en de GROVE-evaluatiemetric die gezamenlijk de correctheid van het beantwoorden van visuele vragen en de precisie van pixelniveau-bewijsgronding beoordelen, waarbij een aanzienlijke prestatiekloof wordt blootgelegd in huidige multimodale modellen die het niet redden om antwoorden af te stemmen op visueel bewijs.

Oorspronkelijke auteurs: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Gepubliceerd 2026-05-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mozhgan Nasr Azadani, Yimu Wang, Yongpeng Zhu, Lihong Chen, Milan Ganai, Sean Sedwards, Marco Pavone, Krzysztof Czarnecki

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een detective inhuurt om een mysterie op te lossen op basis van één foto.

In het verleden, als de detective je de juiste naam van de dader gaf, zou je hen inhuren. Het maakte je niet uit hoe ze het wisten. Ze hadden misschien geraden op basis van een voorgevoel, een stereotiep of een gelukkig giswerk. Als ze zeiden: "Het was de butler," en ze hadden gelijk, kregen ze een gouden ster. Zelfs als ze op de verkeerde persoon in de foto wezen en zeiden: "Zie je? Dat is de butler!", gaf je hen toch de gouden ster, omdat de naam correct was.

Dit artikel stelt dat deze oude manier van testen van AI kapot is. Het is alsof je een detective huurt die het juiste antwoord krijgt, maar je de bewijzen niet kan tonen.

Het Probleem: De "Gelukkig Gistende" AI

De auteurs zeggen dat huidige AI-modellen (zogenaamde Multimodale Grootte Taalmodellen) goed zijn in het raden van de juiste woorden. Maar ze zijn slecht in het bewijzen waarom ze gelijk hebben.

  • De "Alleen-Text"-Valstrik: Als een AI zegt: "Er staan drie poten op die hond," maar de hond op de foto heeft duidelijk vier, kan de AI toch "drie" zeggen omdat het uit tekst heeft geleerd dat honden meestal vier poten hebben, of gewoon geraden. Als het het nummer per ongeluk goed raadt, belonen we het.
  • De "Alleen-Gronding"-Valstrik: Omgekeerd zijn sommige AI-modellen goed in het aanwijzen van dingen in een foto (zoals het tekenen van een cirkel om een hond), maar slecht in het beantwoorden van vragen. Ze kunnen perfect op de hond wijzen, maar zeggen: "Dit is een kat."

Het artikel noemt dit een "modaliteitskloof". Het brein van de AI (tekst) en zijn ogen (visie) praten niet goed met elkaar.

De Oplossing: VISTAQA (De "Laat Me Je Werk Zien"-Test)

Om dit op te lossen, hebben de auteurs een nieuwe test bedacht genaamd VISTAQA.

Denk aan VISTAQA als een strenge leraar die niet alleen je eindantwoord beoordeelt; ze beoordelen je werk.

  • De Regels: Om een voldoende te halen, moet de AI twee dingen tegelijkertijd doen:
    1. Het antwoord correct geven (bijv. "De auto is rood").
    2. Een masker tekenen (zoals een markeerstift) op de exacte pixels van de rode auto in de afbeelding om te bewijzen dat hij het zag.

Als de AI het antwoord goed heeft maar de verkeerde auto markeert, faalt hij. Als hij de juiste auto markeert maar zegt dat hij blauw is, faalt hij. Hij moet beide perfect doen om een hoge score te krijgen.

De Dataset: Een Mengeling van Uitdagingen

De test is niet slechts één type vraag. De auteurs bouwden een bibliotheek van 1.157 door experts samengestelde puzzels die de volgende aspecten omvatten:

  • Zes Denksoorten: Van simpele "Welke kleur is dit?" (Perceptie) tot complexe "Welk object ligt dichter bij de robotarm?" (Redenering).
  • Zes Verschillende Werelden: Binnenkamers, buitenstraten, wiskundediagrammen, wetenschappelijke grafieken, robotlaboratoria en scènes van zelfrijdende auto's.
  • De "Truc"-Vragen: Ongeveer 27% van de vragen is valstrikken. Ze vragen naar dingen die niet in de foto staan (bijv. "Hoeveel rode olifanten zijn er in deze keuken?"). Een slimme AI zou moeten zeggen: "Er zijn geen," en de foto leeg laten. Een "hallucinerende" AI zal proberen een rode olifant te tekenen die niet bestaat.

Het Scorebord: GROVE

Hoe beoordeel je een test waarbij je op twee verschillende manieren goed moet zijn? Je kunt de scores niet zomaar optellen. Als je 100% haalt op de tekst maar 0% op de foto, mag je geen hoog gemiddelde krijgen.

De auteurs bedachten een nieuw scoresysteem genaamd GROVE.

  • De Analogie: Stel je een kruk met twee poten voor. Als één poot gebroken is, valt de kruk om. Je kunt niet zeggen: "Nou, de andere poot is perfect, dus is de kruk prima."
  • Hoe het werkt: GROVE vermenigvuldigt de "Tekstscore" en de "Fotoscore". Als een van beide nul is (of erg laag), crasht de eindscore. Dit dwingt de AI om goed te zijn in beide of een slechte cijfer te krijgen.

De Resultaten: De AI Leert Nog Steeds

De auteurs testten de slimste AI-modellen van vandaag (inclusief modellen van Google, OpenAI en anderen) op deze nieuwe, strengere test.

Het oordeel? Zelfs de beste modellen hadden moeite.

  • Ze waren goed in het raden van de juiste woorden.
  • Ze waren okay in het aanwijzen van dingen.
  • Maar toen ze werden gevraagd om beide tegelijkertijd te doen, daalden hun scores aanzienlijk.

Het artikel concludeert dat hoewel AI slimmer wordt in het praten, het nog niet volledig heeft geleerd om zijn antwoorden tegelijkertijd te "zien" en te "bewijzen". Er is een enorme kloof tussen wat de AI zegt en wat hij daadwerkelijk ziet.

Samenvatting

  • Oude Manier: Kreeg je het juiste antwoord? Ja? Goed gedaan. (Negeert of je bedrogen of geraden hebt).
  • Nieuwe Manier (VISTAQA): Kreeg je het juiste antwoord EN kun je het bewijs in de foto aanwijzen?
  • De Score (GROVE): Als je een van beide onderdelen mist, faal je.
  • De Bevinding: Huidige AI is nog steeds als een student die het antwoordenboekje kan memoriseren maar de les niet begrijpt. Ze moeten leren hun werk te tonen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →