← Nieuwste papers
🤖 machine learning

GroundBench: A Factorized, Counterfactual Benchmark for Locating VLM Affordance Failures

GroundBench is een gefactoriseerde, contrafactische benchmark die is ontworpen om de specifieke oorzaken van affordance-fouten in vision-language modellen te isoleren en te diagnosticeren door aan te tonen dat veel schijnbaar geslaagde grondingen eigenlijk worden gedreven door associaties tussen categorie en actie in plaats van door werkelijk visueel of mechanisch redeneren.

Oorspronkelijke auteurs: Sarthak Sattigeri

Gepubliceerd 2026-09-15
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Sarthak Sattigeri

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een robotarm voor die naar een koffiemok reikt. Om te slagen, moet de machine drie verschillende puzzels tegelijkertijd oplossen: hij moet beslissen welk deel van de mok ertoe doet (de handgreep, niet de rand), precies lokaliseren waar dat deel zich in de visuele wereld bevindt, en begrijpen welke actie dat deel uitnodigt (grijpen, niet duwen). Jarenlang hebben onderzoekers kunstmatige intelligentiesystemen op deze taken getest door hen te vragen te beschrijven wat een robot met een object zou moeten doen. Een recente begeleidende studie suggereerde dat als je de AI simpelweg de naam van het doelonderdeel vertelt — bijvoorbeeld "grijp de handgreep" in plaats van alleen maar "grijp de mok" — de prestaties van het systeem spectaculair stijgen. Dit leidde tot een hoopvolle conclusie: de AI leerde eindelijk naar de afbeelding te kijken en na te denken over de fysieke mechanica van het object.

Echter, een nieuw onderzoek genaamd GroundBench suggereert dat deze conclusie voortijdig is. De onderzoekers achter deze studie, onder leiding van Sattigeri aan de Manipal University Jaipur, vermoedden dat de AI niet daadwerkelijk beter leerde kijken naar het object. In plaats daarvan formuleerden zij de hypothese dat het systeem mogelijk vertrouwde op een shortcut: simpelweg onthouden dat bepaalde woorden, zoals "handgreep", bijna altijd worden gekoppeld aan de actie "grijpen", ongeacht wat de afbeelding daadwerkelijk laat zien. Om dit te testen, bouwden zij een rigoureuze nieuwe benchmark die ontworpen is om het vermogen om een onderdeel in een afbeelding te vinden te scheiden van het vermogen om een actie te raden op basis van een woord. Ze vroegen de AI niet alleen om een taak uit te voeren; ze haalden systematisch informatie weg, stukje bij beetje, om te zien welke specifieke aanwijzing de succesfactor was.

De onderzoekers construeerden een reeks van zes verschillende scenario's, of condities, om drie verschillende versies van een toonaangevend kunstmatig intelligentiemodel te testen. In het eerste scenario zag de AI alleen de afbeelding van een object, zoals een toetsenbord of een deur, zonder tekstinstructies. In het tweede scenario voegden ze de naam van het object toe, zoals "toetsenbord". In het derde noemden ze het specifieke onderdeel, zoals "de spatiebalk". In het vierde gaven ze de exacte locatie van het onderdeel op het scherm op — een specifiek punt en een kader eromheen — maar onthielden ze doelbewust de naam van het onderdeel. In het vijfde gaven ze zowel de naam als de locatie. Ten slotte voegden ze technische details toe over hoe het object beweegt, zoals of een gewricht een scharnier of een schuif is.

De resultaten waren opmerkelijk en contra-intuïtief. Wanneer de onderzoekers de AI de exacte locatie van het doelonderdeel gaven maar weigerden te vertellen wat het onderdeel werd genoemd, stortte de prestatie van het systeem in. Bij de drie geteste modellen daalde de nauwkeurigheid voor het kiezen van de juiste actie naar het niveau van een willekeurige gok, of zelfs lager. Eén model, dat de locatie van een knop kreeg maar niet de naam, scoorde slechts 0,26, terwijl een eenvoudige baseline die de afbeelding volledig negeerde, 0,53 scoorde. De AI kon de locatie die hem getoond werd perfect reproduceren door zijn "vinger" exact te plaatsen waar de onderzoekers naar wezen, maar het faalde in het begrijpen van wat men met die locatie moest doen. Het was alsof de robot de knop kon zien, maar geen idee had dat knoppen bedoeld zijn om ingedrukt te worden.

In scherp contrast hiermee: wanneer de onderzoekers de AI de naam van het onderdeel gaven maar de locatie achterhielden, schoot de prestatie omhoog. Dezelfde modellen die faalden met alleen locatiegegevens, sprongen naar nauwkeurigheidspercentages tussen de 0,68 en 0,74 wanneer ze te horen kregen dat het onderdeel een "knop" of een "deur" was, zelfs zonder te zien waar het was. Dit patroon hield stand over de hele linie: op het moment dat de AI de categorienaam van het onderdeel kreeg, kon het bijna altijd de juiste actie raden. De onderzoekers ontdekten dat in hun zorgvuldig samengestelde set objecten de naam van het onderdeel alleen al voldoende was om het antwoord te bepalen. De AI keek niet naar de afbeelding om de fysica te begrijpen; het las het woord en riep een vooraf geleerde associatie op.

Om dit vermoeden te bevestigen, voerden de onderzoekers een controletest uit waarbij ze de afbeelding volledig verwijderden en de modellen vroegen te antwoorden op basis van alleen tekst. Voor het meest geavanceerde geteste model maakte het verwijderen van de afbeelding geen verschil voor de prestaties in de condities waar de onderdelennaam werd verstrekt. Het model scoorde net zo goed, of zelfs iets beter, zonder het object te zien. Dit leverde sterk bewijs dat het systeem niet gebruik maakte van visuele gronding — het proces van het verbinden van woorden aan specifieken pixels in een afbeelding — maar in plaats daarvan vertrouwde op een tekstgebaseerde shortcut. De AI wist dat "scharnierdeur" impliceert "trekken" en "schuifknop" impliceert "duwen" omdat het die combinaties in zijn trainingsdata had gezien, en niet omdat het de mechanica van de specifieke deur of knop voor zich begreep.

De studie testte ook of de AI een strikvraag kon volgen. De onderzoekers namen een afbeelding van een object met meerdere onderdelen, zoals een toetsenbord met veel toetsen, en vroegen de AI een actie uit te voeren op een niet-standaard onderdeel, zoals een specifieke toets die zelden wordt gebruikt. Ze wilden zien of de AI daadwerkelijk naar die specifieke toets zou kijken of dat het zou terugvallen op de meest voorkomende actie voor het hele object. Hoewel de modellen de nieuwe instructie over het algemeen opvolgden, hadden ze aanzienlijke problemen wanneer de gevraagde actie ongebruikelijk was, zoals het verticaal optillen van een onderdeel. In die gevallen grepen de modellen vaak terug op de standaardactie, wat suggereert dat ze nog steeds leunden op hun meest voorkomende associaties in plaats van de visuele scène echt te analyseren.

Misschien wel de meest verrassende bevinding was dat het toevoegen van meer informatie niet altijd hielp. Wanneer de onderzoekers de AI de locatie en de naam van het onderdeel gaven, en vervolgens gedetailleerde mechanische beschrijvingen toevoegden over hoe het object bewoog, nam de prestatie feitelijk af. De modellen verbeterden niet; ze werden minder accuraat. Dit suggereert dat de extra informatie het systeem verwarde of afleidde van de eenvoudige, effectieve shortcut van alleen het gebruiken van de naam van het onderdeel. De onderzoekers concludeerden dat voor deze specifieke taken, meer data niet gelijk stond aan beter redeneren.

De implicaties van dit werk zijn aanzienlijk voor het vakgebied van robotica en kunstmatige intelligentie. Het onthult dat hoge scores op bepaalde tests misleidend kunnen zijn. Een AI kan lijken op een meester van het fysieke redeneren, terwijl het in werkelijkheid slechts een meester is van woordassociaties. De onderzoekers vonden dat de spectaculaire verbetering die in eerdere studies werd gezien, waarbij het benoemen van een onderdeel de nauwkeurigheid met een grote marge verhoogde, waarschijnlijk niet kwam doordat de AI plotseling beter leerde kijken. In plaats daarvan kwam het omdat de naam zelf het antwoord bevatte. De studie beweert niet dat deze modellen onbekwaam zijn in visueel redeneren, maar het laat wel zien dat ze dat onder deze specifieke omstandigheden niet deden.

GroundBench dient als een diagnostisch instrument, een manier om de lagen van de prestaties van een AI af te pellen om te zien wat er daaronder werkelijk gebeurt. Door de visuele locatie te scheiden van de semantische naam, legden de onderzoekers de kloof bloot tussen wat de modellen leken te doen en wat ze daadwerkelijk deden. Ze ontdekten dat wanneer de naam van het onderdeel werd verwijderd, de modellen niet in staat waren de actie te vinden, zelfs niet toen de locatie volkomen duidelijk was. Dit suggereert dat voor deze systemen de weg naar echt mechanisch redeneren langer is dan voorheen gedacht. Ze hebben nog niet geleerd om naar een object te kijken en de functie ervan te begrijpen; ze hebben geleerd om te luisteren naar een woord en de functie ervan te raden. De studie eindigt niet met een verklaring van falen, maar met een heldere kaart van waar het werk naartoe moet: het bouwen van systemen die de woorden die ze horen echt kunnen verbinden met de fysieke wereld die ze zien, in plaats van te vertrouwen op de shortcuts die hen tot nu toe zo goed hebben gediend.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →