VRIQ: Benchmarking and Analyzing Visual-Reasoning IQ of VLMs
De VRIQ-benchmark onthult dat huidige Vision Language Models slecht presteren op visuele redeneertaken, voornamelijk vanwege beperkingen in de perceptie in plaats van tekortkomingen in het redeneren, met een nauwkeurigheid variërend van 28% bij abstracte puzzels tot 45% bij natuurlijke afbeeldingen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een team hebt van ongelooflijk slimme robots die boeken kunnen lezen en naar plaatjes kunnen kijken. Je wilt weten of ze echt "slim" zijn of dat ze gewoon heel goed zijn in gokken. Om dit te ontdekken, hebben de auteurs van dit paper een speciale test gebouwd genaamd VRIQ (Visual Reasoning IQ).
Beschouw VRIQ als een gigantische, digitale "puzzelbox" die ontworpen is om deze robots te misleiden. De doos bevat twee soorten puzzels:
- Abstracte Puzzels: Deze zijn als klassieke IQ-testkaarten met vreemde vormen, lijnen en patronen. Er zijn hier geen echte objecten, alleen symbolen.
- Natuurlijke Puzzels: Deze gebruiken echte foto's van alledaagse dingen, zoals appels, auto's of mensen, maar stellen dezelfde lastige logische vragen.
De Grote Verrassing: De Robots Zijn "Blind"
Toen de onderzoekers de slimste AI-modellen die momenteel beschikbaar zijn (inclusief de beroemde modellen van OpenAI en Google) testten, ontdekten ze iets schokkends.
- Op Abstracte Puzzels: De robots presteerden bijna net zo slecht als wanneer ze puur willekeurig zouden gokken. Hun gemiddelde score was rond de 28% (waarbij 25% puur geluk is). Het is als een student die het woordenboek uit het hoofd heeft geleerd, maar geen enkele zin kan lezen.
- Op Natuurlijke Puzzels: Ze presteerden iets beter (rond de 45%), maar ze waren nog lang niet perfect.
Het paper onthult dat het probleem niet is dat de robots slecht zijn in denken (redeneren). Het probleem is dat ze slecht zijn in zien (perceptie).
Het Detectiewerk: Waarom Faalden Ze?
Om te achterhalen waar de robots precies faalden, handelden de onderzoekers als detectives. Ze vroegen niet alleen: "Wat is het antwoord?" Ze braken elke puzzel af in kleine stapjes met behulp van "onderzoeksvragen" (probe questions).
Stel je een robot voor die faalt bij een puzzel waarbij hij de vreemde vorm moet vinden. De onderzoekers vroegen:
- Perceptie-onderzoek: "Hoeveel rode cirkels zie je?"
- Redeneer-onderzoek: "Als er 3 rode cirkels zijn en de regel is 'verwijder er één', wat blijft er dan over?"
De Resultaten van het Onderzoek:
- 56% van de tijd: De robot faalde omdat hij de basis niet kon zien (bijv. hij kon de cirkels niet tellen of niet zien in welke richting een vorm wees).
- 43% van de tijd: De robot kon de basis niet zien én kon de logica niet begrijpen.
- Slechts 1% van de tijd: De robot zag alles perfect, maar zat er qua logica naast.
De Metafoor: Het is alsoam met een kok een recept voor een taart geven. De kok (de AI) kent de logica van het bakken perfect. Maar als de kok geblinddoekt is en niet kan zien dat er slechts 2 eieren zijn in plaats van 4, dan zal de taart mislukken. De fout lag niet in de baklogica; het was het onvermogen om de ingrediënten te zien.
De "Tool" Twist
De onderzoekers probeerden nog één ding. Ze gaven één specif kind specifiek AI-model (OpenAI's o3) een set digitale hulpmiddelen, zoals een vergrootglas, een schaar (om afbeeldingen bij te snijden) en een rekenmachine. Dit model mocht "denken met afbeeldingen" door de afbeelding actief te manipuleren voordat het antwoord gaf.
Het Resultaat: Deze gereedschap-gebruikende robot vloog er bovenuit. Hij sprong van een score van 28% naar meer dan 50% op abstracte puzzels en zelfs 80-100% op natuurlijke puzzels. Dit bewijst dat als je de robot betere "ogen" geeft (hulpmiddelen om duidelijk te zien), zijn "brein" (redeneren) veel beter werkt.
De Kern van het Verhaal
Het paper concludeert dat huidige AI-modellen niet falen omdat ze een gebrek aan intelligentie of logica hebben. Ze falen omdat ze moeite hebben met het nauwkeurig waarnemen van de visuele wereld. Ze kunnen niet betrouwbaar objecten tellen, 3D-diepte begrijpen of zien in welke richting iets gedraaid is.
Om AI werkelijk slim te maken in visueel redeneren, hebben we niet alleen grotere hersenen nodig; we moeten ze betere ogen geven.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.