← Nieuwste papers
🤖 AI

Visual Credit Audit for Multimodal Spatial Reasoning

Dit artikel introduceert Visual Credit Audit (VCA), een trainings- en labelvrij framework dat de prestaties op het gebied van multimodale ruimtelijke redenering deelt op in juistheid, visuele ondersteuning en relatiespecifieke respons, waarbij wordt onthuld dat een aanzienlijk deel van de correcte benchmarkantwoorden feitelijk niet wordt toegeschreven aan het visuele bewijs.

Oorspronkelijke auteurs: Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

Gepubliceerd 2026-07-30
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Feixiang Liu, Qiang Qiu, Lanbo Sun, Nan Wei, Huawei Shen, Xueqi Cheng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een toets maakt waarbij een leraar je een foto laat zien van een kat die onder een tv zit en vraagt: "Zit de tv boven de kat?" Je antwoordt "Ja" en je krijgt een gouden ster. Maar wat als je die gouden ster niet kreeg omdat je echt naar de foto hebt gekeken, maar omdat je op basis van de woorden alleen maar het juiste had geraden? Misschien heb je die zin al een miljoen keer gehoord, of misschien weet je gewoon dat tv's meestal aan de muur hangen en katten op de vloer zitten. In de wereld van Kunstmatige Intelligentie, specifits met "Multimodale Large Language Models" (AI die kan zien en lezen), is dit een lastig probleem. Deze modellen zijn als superintelligente studenten die elk boek in de bibliotheek hebben gelezen, maar soms valsspelen door het antwoord te raden op basis van de bewoording van de vraag in plaats van de afbeelding echt te analyseren. Wetenschappers willen weten: zegt de AI "Ja" omdat hij echt de tv boven de kat ziet, of is het gewoon een gelukkige gok gebaseerd op tekst?

Dit is precies de puzzel waar een nieuw artikel over gaat: "Visual Credit Assignment for Multimodal Spatial Reasoning." De onderzoekers hebben een speciaal audit-instrument gebouwd genaamd Visual Credit Audit (VCA). Zie VCA als een strenge detective die niet alleen controleert of het antwoord juist is, maar ook onderzoekt waarom het juist was. Ze stellen twee belangrijke vragen: Ten eerste, gaf de afbeelding de AI daadwerkelijk extra hulp om die beslissing te nemen vergeleken met alleen de tekst lezen? Ten tweede, als je de relatie in de afbeelding zou omdraaien (zoals de kat boven de tv zetten), zou de AI dan van mening veranderen? Het artikel stelt vast dat zelfs wanneer de AI het juiste antwoord geeft, de AI vaak "vals speelt" door te vertrouwen op tekstuele aanwijzingen in plaats van visueel bewijs. In feite waren bij sommige modellen tot wel 26,25% van hun juiste antwoorden op ruimtelijke tests "uncredited"—ze hadden het juiste antwoord, maar de afbeelding hielp hen er niet bij.

De Gereedschapskist van de Detective: Hoe VCA werkt

Om te begrijpen hoe de onderzoekers deze "valsspelers" hebben betrapt, moet je je een spelletje "Zoek de verschillen" voorstellen, gespeeld met een zeer koppige robot.

De Opstelling: De "Geen-Afbeelding" Controles
De onderzoekers zetten een slim experiment op. Ze namen een vraag zoals "Zit de tv boven de kat?" en lieten deze op drie verschillende manieren aan de AI zien:

  1. De Origineel: De vraag plus de echte foto.
  2. Alleen Tekst: De vraag zonder foto (gewoon een lege ruimte).
  3. Het Lege Canvas: De vraag met een grijs, leeg vak waar de foto zou moeten staan.

Als de AI in alle drie de scenario's met dezelfde zekerheid "Ja" antwoordt, zeggen de onderzoekers: "Aha! De afbeelding heeft geen enkel werk verricht." De AI gokt gewoon op basis van de tekst. Maar als de AI veel zekerder is wanneer de foto er wel is, dan krijgt de afbeelding "credit" voor het antwoord. Dit is het eerste deel van de audit: Afhankelijkheid van de Afbeelding (Image Dependence).

De Wending: De "Relatieomdraaiing"
Maar wacht, er is nog een tweede valstrik. Wat als de AI wel gevoelig is voor de afbeelding, maar op een vreemde manier? Misschien ziet hij de tv en de kat, maar begrijpt hij niet echt welke er bovenop ligt. Om dit te vangen, gebruikten de onderzoekers een "factoriële" test. Ze creëerden scenario's waarin de tekst zei "Zit de tv boven de kat?", maar de foto liet de tv onder de kat zien.

Als de AI echt slim is, zou hij "Nee" moeten zeggen wanneer de foto de tekst tegenspreekt. Als hij nog steeds "Ja" zegt omdat hij de foto negeert, faalt hij voor de tweede test: Consistentie van de Relatie (Relation Consistency).

De Grote Onthulling: "Correct maar Ongecrediteerd"

De onderzoekers voerden deze audit uit op vier verschillende AI-modellen (Qwen, InternVL, LLaVA en Ministral) met behulp van twee verschillende benchmarks voor ruimtelijk redeneren. De resultaten waren onthullend.

Ze ontdekten dat een aanzienlijk deel van de "correcte" antwoorden van de AI eigenlijk Correct-maar-Ongecrediteerd (C-U) waren.

  • Op de GSR-COCO dataset had het Qwen-model 90,91% van de antwoorden goed. Maar toen ze de audit toepasten, werden slechts 78,18% van die antwoorden daadwerkelijk ondersteund door de afbeelding. Dat betekent dat het model in 12,73% van de gevallen het juiste antwoord had, maar de afbeelding er totaal niet bij hielp.
  • Voor het LLaVA-model op dezelfde dataset was de kloof zelfs groter: 26,25% van de correcte antwoorden waren ongecrediteerd.

Het artikel sluit de mogelijkheid expliciet uit dat deze modellen simpelweg "slecht" zijn in ruimtelijk redeneren. Sterker nog, de modellen zijn gevoelig voor visuele veranderingen. Wanneer de onderzoekers de posities van objecten in de foto's omschakelden (een "relatieomdraaiing"), veranderden 81,57% tot 100,00% van de modellen hun antwoord in de juiste richting. Dit bewijst dat de modellen het verschil kunnen zien, maar dat ze in de standaardtest vaak niet nodig hadden om te kijken om het juiste antwoord te krijgen. Ze vertrouwden op shortcuts.

Waarom dit Belangrijk is (Zonder Jargon)

Denk aan een student die een wiskundetoets maakt.

  • Nauwkeurigheid (Accuracy) is simpelweg het cijfer: "Hebben ze het juiste getal gegeven?"
  • VCA is de docent die naar het kladpapier van de student kijdt: "Hebben ze echt de berekening gemaakt, of hebben ze gewoon het antwoord geraden omdat ze weten dat de docent van het getal 42 houdt?"

Het artikel laat zien dat huidige AI-benchmarks lijken op een toets waarbij de docent per ongeluk de antwoorden weggeeft via de formulering van de vraag. De modellen halen hoge scores, maar ze leren niet noodzakelijkerwijs beter te "zien".

De onderzoekers testten ook wat er gebeurt als je de foto vervangt door een compleet andere, ongerelateerde afbeelding (zoals de foto van de kat/tv vervangen door een foto van een strand). Toen ze dit deden, daalde de "credit"-score van de modellen met 21,25 tot 47,80 punten. Dit bevestigt dat de oorspronkelijke foto inderdaad het zware werk deed voor die specifieke correcte antwoorden, en dat de modellen zonder de foto zouden struikelen.

De Conclusie

Het artikel zegt niet dat AI kapot is of dat het niet kan zien. In plaats daarvan biedt het een nieuwe manier om succes te meten. Het suggereert dat we niet alleen moeten tellen hoe vaak een AI het juiste antwoord geeft. We moeten tellen hoe vaak de AI de afbeelding nodig had om dat antwoord te geven.

Door "correctheid" te scheiden van "visuele ondersteuning", ontdekten de onderzoekers dat veel van wat wij denken dat "slim visie" is, eigenlijk gewoon "slim raden" is. Ze stellen voor dat toekomstige tests voor AI deze "credit-audits" moeten bevatten om ervoor te zorgen dat wanneer een AI zegt "Ik zie de kat", hij daarmee echt bedoelt dat hij naar de kat kijkt, en niet alleen een zin reciteert die hij heeft uit zijn hoofd geleerd. Het is een oproep om te stoen met het vieren van het cijfer en te beginnen met het controleren van het huiswerk.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →