From Where Things Are to What They Are For: Benchmarking Spatial-Functional Intelligence in Multimodal LLMs
Dit artikel introduceert SFI-Bench, een op video gebaseerde benchmark met meer dan 1.500 door experts geannoteerde vragen die multimodale grote taalmodellen evalueert op gestructureerde ruimtelijke en functionele redenering, waarbij hun huidige onvermogen wordt blootgelegd om ruimtelijk geheugen effectief te integreren met functionele inferentie voor verankerde intelligentie.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert navigeren door je huis. Je zou denken dat het moeilijkste deel is om het een stoel of een koffiekopje te leren herkennen. Maar volgens dit artikel is dat eigenlijk het gemakkelijke deel. De echte uitdaging is de robot twee veel moeilijkere dingen te leren: waar alles zich ten opzichte van elkaar bevindt, en waarvoor alles eigenlijk dient.
De onderzoekers hebben een nieuwe test ontwikkeld genaamd SFI-Bench (Spatial-Functional Intelligence Benchmark) om te zien of de slimste AI-modellen van vandaag deze dingen kunnen. Denk hierbij aan een "rijbewijsexamen" voor AI, maar in plaats van een auto te besturen, moet de AI door een video van een kamer navigeren en lastige vragen over die video beantwoorden.
Hieronder volgt een uiteenzetting van wat ze hebben gevonden, met behulp van eenvoudige analogieën:
1. De twee grote vaardigheden: De kaart en de handleiding
Het artikel stelt dat ware intelligentie twee aanvullende vaardigheden vereist, die ze "Waar dingen zijn" en "Waarvoor ze dienen" noemen.
- Het "Waar" (Ruimtelijk redeneren): Dit is als het bouwen van een mentale kaart in je hoofd. Het gaat niet alleen om het zien van een bank; het gaat om het weten dat de bank links van de tv staat, dat er drie kussens op liggen, en dat als je langs de bank loopt, je tegen de muur zult lopen.
- De test: De AI krijgt een video van een kamer te zien en krijgt vragen zoals: "Hoeveel blauwe kussens liggen er op de bank die het verst van de deur verwijderd is?" of "Als ik van de keuken naar de slaapkamer loop, welk object kom ik dan eerst tegen?"
- Het "Waarvoor" (Functioneel redeneren): Dit is als het begrijpen van een gebruikershandleiding. Het gaat om het weten dat een afstandsbediening voor de tv is, niet voor de broodrooster, en precies te weten welke knoppen je moet indrukken om een wasmachinecyclus te annuleren.
- De test: De AI ziet een vreemd apparaat en moet uitzoeken: "Wat doet dit?" of "Mijn bril komt met een regenboogvlek uit de vaatwasser; wat is er mis en hoe los ik dit op?"
2. De resultaten: Goed in zien, slecht in denken
De onderzoekers hebben veel van 's werelds meest geavanceerde AI-modellen (zoals GPT-5, Gemini en open-source modellen) getest op deze benchmark. Hier is het oordeel:
- De "ogen" zijn open: De AI-modellen zijn uitstekend in eenvoudige waarneming. Als je vraagt: "Is er een kat in de video?", krijgen ze dit bijna elke keer goed.
- Het "brein" zit vast: Wanneer de vragen moeilijker worden, worstelen de modellen.
- Het geheugengat: Stel je voor dat je probeert een kamer te onthouden nadat je er doorheen bent gelopen. De AI vergeet vaak waar het begon. Als je vraagt om een punt te verbinden van het begin van de video tot het einde, raakt het vaak de weg kwijt of "teleporteert" het objecten naar de verkeerde plekken.
- De "overdenken"-valstrik: De onderzoekers ontdekten dat wanneer ze de AI vertelden om "harder na te denken" (door haar meer tijd te geven om een lange redeneringsketen te genereren), ze niet slimmer werd. Sterker nog, ze werd vaak dommer. Ze begon feiten te verzinnen of raakte in de war door haar eigen lange uitleg. Het is als een student die steeds meer op een toets blijft schrijven tot ze per ongeluk het juiste antwoord uitveegt.
- Het "handleiding"-probleem: Voor de "waarvoor"-vragen faalde de AI vaak tenzij ze een zoekmachine mocht gebruiken om echte handleidingen op te zoeken. Zonder die externe hulp raapte de AI het maar, vaak leunend op gezond verstand dat niet paste bij de specifieke situatie (bijvoorbeeld ervan uitgaan dat elke afstandsbediening werkt voor elke tv).
3. De verrassende bevindingen
- Tijd maakt niet veel uit: Mensen bouwen mentale kaarten door door de tijd te bewegen. Als je de videoframes door elkaar haalt zodat ze uit de volgorde worden afgespeeld, zou een mens volledig de weg kwijt zijn. Verrassend genoeg gaf de AI hier weinig om; ze keek gewoon naar alle plaatjes tegelijk en probeerde te raden. Ze lijkt de "stroom" van de tijd niet te begrijpen zoals wij dat doen.
- Plaatjes winnen van woorden: De onderzoekers probeerden de AI een tekstuele beschrijving van de kamer te geven in plaats van de video. De prestaties van de AI daalden aanzienlijk. Het blijkt dat, zelfs als je een kamer perfect in woorden beschrijft, de AI de video nog steeds moet zien om een correcte mentale kaart te bouwen.
- Groter is niet altijd beter: Soms presteerden kleinere, efficiëntere modellen net zo goed als enorme modellen, mits ze niet verstrikt raakten in lange, onnodige redeneringsketens.
Het oordeel
Het artikel concludeert dat AI, hoewel het steeds beter wordt in het "zien" van de wereld, nog steeds worstelt met het "begrijpen" van de wereld. Het kan een broodrooster herkennen, maar het begrijpt niet echt hoe de broodrooster past in de keuken of hoe je hem repareert als hij kapot gaat.
Om echt intelligente agenten te bouwen (robots of software die namens ons kunnen handelen), moeten we voorbij het louter leren van objectherkenning gaan. We moeten hen leren samenhangende mentale kaarten te bouwen, onthouden waar dingen zich in de loop van de tijd bevinden, en weten hoe ze gereedschap moeten gebruiken op basis van wereldkennis, niet op basis van gokwerk. Op dit moment zijn ze als een toerist die een prachtige foto van een bezienswaardigheid kan maken, maar niet weet hoe hij daar komt of wat hij moet doen zodra hij daar is.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.