VideoGameBench: Can Vision-Language Models complete popular video games?
Het artikel introduceert VideoGameBench, een benchmark waarbij vision-language-modellen video games uit de jaren 1990 moeten spelen uitsluitend aan de hand van ruwe visuele input en hoog-niveau instructies, wat aantoont dat zelfs de meest geavanceerde modellen aanzienlijke moeite hebben met real-time gameplay vanwege beperkingen in perceptie, ruimtelijke navigatie en inferentie-latentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een zeer slimme robot voor die elk boek in de bibliotheek heeft gelezen en complexe wiskundeproblemen kan oplossen. Je zou kunnen denken: "Geweldig! Laten we eens kijken of het videospellen kan spelen."
Dat is precies wat de onderzoekers aan de Princeton University hebben gedaan. Ze creëerden een nieuwe test genaamd VideoGameBench om te zien of deze geavanceerde AI-modellen (zogenaamde Vision-Language Models) in staat zijn populaire videospellen uit de jaren 90 te spelen, net zoals een mens dat zou doen.
Hier is de uitleg van hun experiment, de resultaten en wat dit betekent, met behulp van eenvoudige analogieën.
De Opzet: De "Blinddoekspeler"-test
Normaal gesproken geven wetenschappers bij het testen van AI op games een spiekbriefje. Ze vertellen de AI bijvoorbeeld: "De vijand bevindt zich op coördinaten X, Y," of geven ze een kaart van het niveau. Het is alsof je een videospel speelt met een handleiding op je schoot.
VideoGameBench veranderde de regels.
- De Regels: De AI krijgt alleen ruwe beelden van het scherm (alsof je naar een tv kijkt) en een eenvoudige tekstbeschrijving van wat de knoppen doen (bijvoorbeeld: "Druk op 'A' om te springen").
- De Uitdaging: De AI moet het spel uitzoeken, onthouden waar het al geweest is, en in real-time reageren op vijanden, precies zoals een menselijke speler.
- De Spellen: Ze kozen 10 klassieke spellen uit de jaren 90, variërend van Doom II (een snel schietspel) tot Civilization (een langzaam strategiespel) en Pokémon (een rollenspel-avontuur).
Ze verbergen zelfs drie geheime spellen voor de AI. Dit was om ervoor te zorgen dat de AI niet gewoon antwoorden uit zijn trainingsdata memoriseerde, maar echt leerde hoe hij nieuwe dingen onderweg moest spelen.
De Resultaten: Het "Nieuwgeborene"-probleem
De resultaten waren verrassend. Zelfs de slimste en krachtigste AI-modellen van vandaag (zoals Gemini 2.5 Pro en Claude 3.7) hadden enorme moeite.
- De Score: De beste modellen slaagden er slechts in ongeveer 0,48% van de spellen te voltooien.
- De Realiteit: In gewone taal betekent dit dat de AI vastliep aan het begin van het spel. Het kon niet eens het eerste level voltooien.
Stel je dit voor: je geeft een genie-wiskundige een gloednieuwe videospelconsole. Hij kan de baan van een raket berekenen, maar wanneer hij probeert Super Mario te spelen, loopt hij steeds van een klif af omdat hij niet begrijpt dat "omlaag" op het scherm betekent "vallen", of hij vergeet dat hij drie minuten geleden al een sleutel heeft opgepakt.
Waarom Mislukten Ze?
Het paper identificeert drie hoofdredenen waarom de AI vastliep:
- De "Weten-Doen"-kloof: De AI "wist" vaak wat het moest doen (bijvoorbeeld: "Ik moet naar de deur gaan"), maar bleef de verkeerde knop indrukken. Het was als een persoon die weet dat hij linksaf moet om bij de winkel te komen, maar zijn voet blijft naar rechts stappen.
- Visuele Verwarring: De AI kon soms niet zien wat hij zag. In Doom II zou een AI misschien schieten op een dode vijand die eruitziet als een hoop rotsen, waardoor al zijn munitie wordt verspild. In Zelda zou het denken dat het met een personage had gesproken, alleen omdat het ernaast stond, zelfs al vond er geen gesprek plaats.
- Kortetermijngeheugen: Videospellen vereisen dat je dingen lang onthoudt (bijvoorbeeld: "Ik moet de blauwe sleutel vinden om de rode deur te openen"). De AI vergat zijn hoofddoel na slechts een paar stappen, waarbij het zijn geheugen overschreef met nieuwe, minder belangrijke gedachten.
Het "Pauzeknop"-experiment
De onderzoekers beseften dat sommige spellen zeer snel zijn (real-time), terwijl de AI traag denkt. Tegen de tijd dat de AI besloot een knop in te drukken, had het spel zich al veranderd, waardoor de actie nutteloos werd.
Om dit op te lossen, creëerden ze VideoGameBench Lite.
- De Verandering: Ze drukten op de "pauze"-knop van het spel terwijl de AI dacht. Het spel bewoog alleen wanneer de AI een opdracht gaf.
- Het Resultaat: De scores stegen lichtjes (naar ongeveer 1,6%), maar de AI slaagde er nog steeds niet in de spellen te voltooien. Dit bewees dat het probleem niet alleen was dat de AI traag was; het was dat de AI simpelweg niet in staat was de spellogica effectief te doorgronden.
De "Oefentest"
Om te zien of de AI basisopdrachten kon uitvoeren, creëerden ze drie kleine, simpele oefenspellen:
- Klikken: Klik op een bewegend stipje.
- Sleepbeweging: Sleep een stipje langs een lijn.
- Labyrint: Beweeg een vierkantje door een eenvoudig labyrint.
Zelfs hier had de AI moeite. Hoewel sommige modellen het stipje konden aanklikken, faalden bijna allemaal bij het slepen of het navigeren door het labyrint. Dit suggereert dat de AI problemen heeft met basis fysieke interacties en ruimtelijk redeneren, niet alleen met complexe spellogica.
De Conclusie
Het paper concludeert dat AI, hoewel het geweldig is in wiskunde en coderen, momenteel verschrikkelijk slecht is in het spelen van videospellen wanneer het alleen moet vertrouwen op wat het ziet en zijn eigen geheugen.
De onderzoekers hopen dat ze door deze moeilijke test te creëren, AI-ontwikkelaars kunnen stimuleren systemen te bouwen die beter zijn in:
- Begrijpen wat ze zien (perceptie).
- Onthouden wat eerder is gebeurd (geheugen).
- Stappen vooruit plannen (strategie).
Zolang AI niet Doom of Pokémon kan verslaan zonder spiekbriefje, heeft het de menselijke vaardigheid om te leren en aan te passen aan nieuwe, complexe omgevingen nog niet echt onder de knie.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.