← Nieuwste papers
🤖 AI

SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks

Het artikel introduceert SpatialWorld, een verenigde benchmark met 760 door mensen geannoteerde taken over acht simulatie-backends om het interactieve ruimtelijk redeneren van multimodale agenten in realistische scenario's grondig te evalueren, waarbij wordt onthuld dat zelfs state-of-the-art modellen worstelen met lage succespercentages en significante efficiëntie-mismatches in actieve exploratie en langetermijnplanning.

Oorspronkelijke auteurs: Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang
Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongcheng Gao, Hailong Qu, Jingyi Tang, Jiahao Wang, Zihao Huang, Hengkang Qiao, Shihong Huang, Junming Yang, Yi Li, Hongyixuan Yuan, Wenjie Li, Bohan Zeng, Wenbo Li, Bo Wang, Jianhui Liu, Olive Huang, Haoyang Huang, Wentao Zhang, Guoqing Huang, Nan Duan, Yinpeng Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert navigeren door een echt huis. Je kunt de robot niet simpelweg één foto van de woonkamer laten zien en vragen: "Waar is de koffiekop?" want de robot kan niet het hele huis vanuit één punt overzien. Hij moet rondlopen, achter deuren kijken en ontdekken waar dingen zich bevinden terwijl hij beweegt.

Dit artikel introduceert SpatialWorld, een enorme, rigoureuze "proefrit" die ontworongen is om te zien of de slimste AI-robots (Multimodale Grote Taalmodellen) dit soort realistische navigatie en probleemoplossing daadwerkelijk kunnen uitvoeren.

Hier is een uitsplitsing van wat ze hebben gedaan, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Statische Foto"-valstrik

Voorheen testten onderzoekers de ruimtelijke vaardigheden van AI met statische foto's (zoals een "Waar is Waldo?" puzzel) of simulatoren die de robot oneerlijke voordelen gaven (zoals een GPS-kaart of een lijst met alle objecten in de kamer).

  • De Analogie: Het is alsof je het vermogen van een bestuurder om een auto te parkeren test door hem één perfect bovenaanzicht van de parkeerplek te laten zien, in plaats van hem daadwerkelijk de auto te laten besturen, in de spiegels te laten kijken en in de parkeerplek te laten sturen.
  • Het Probleem: Het echte leven is "gedeeltelijk observeerbaar". Je kunt niet alles tegelijk zien. Je moet je hoofd en lichaam bewegen om aanwijzingen te verzamelen. Oude tests controleerden niet of de AI dit soort actieve exploratie kon uitvoeren.

2. De Oplossing: De "Acht-Werelden" Obstakelbaan

De auteurs hebben SpatialWorld gebouwd, een verenigde testomgeving die acht verschillende simulatieomgevingen (zoals verschillende videogame-engines) combineert in één enkele examen.

  • De Werelden: Het bevat simulaties van huizen binnen (zoals AI2-THOR), simulaties voor rijden buiten (zo zoals CARLA), en zelfs abstracte 3D-spellen (zoals Snake of een Rubiks kubus).
  • De Regels:
    • Alleen Visie: De AI krijgt alleen een camerabeeld (zoals de ogen van een mens). Geen GPS, geen röntgenvisie, geen "spiekbriefje" met de locaties van objecten.
    • Tekstcommando's: De AI moet beslissen wat hij gaat doen met behulp van eenvoudige tekstcommando's zoals "beweeg naar voren", "pak de kop op" of "draai rechts".
    • Het Doel: De AI moet een taak voltooien (bijv. "Zoek de sleutels en breng ze naar de tafel") door de wereld stap voor stap te verkennen.

3. De Resultaten: De "Realiteitscheck"

De onderzoekers hebben 15 van de slimste beschikbare AI-modellen getest (inclusief topmodellen van OpenAI, Google en Alibaba). De resultaten waren nuchter:

  • Het Scorebord: Zelfs het "slimste" model, GPT-5, slaagde in ongeveer 17% van de taken. Het beste open-source model slaagde in ongeveer 14%.
    • Analogie: Als je een mens een eenvoudige taak zou geven zoals "ga naar de keuken en haal een glas", zou die bijna altijd slagen. Deze AI's falen momenteel in 8 van de 10 gevallen.
  • De Efficiëntiekloof: Sommige modellen die wel slaagden, waren ongelooflijk inefficiënt. Ze zouden 50 stappen door het huis dwalen om een lichtschakelaar te vinden die vlak naast hen zat.
    • Analogie: Het is alsoat een bestuurder uiteindelijk de supermarkt vindt, maar 50 mijl om zijn route heen rijdt en veel benzine verbruikt, alleen maar om er te komen.
  • Specialisatie: Geen enkel model was goed in alles.
    • GPT-5 was goed in taken binnenshuis (het vinden van objecten in een kamer).
    • Gemini was verrassend goed in digitale spellen en navigatie buiten.
    • Analogie: Het is alsof je een chef hebt die geweldig is in het bakken van taarten maar verschrikkelijk is in het grillen van biefstuk, en een grillmeester die geen taart kan bakken wat hij ook doet.

4. Waarom ze falen: De "Vier Fatale Gebreken"

De onderzoekers analyseerden waarom de robots faalden en vonden vier hoofdoorzaken:

  1. Ruimtelijke Desoriëntatie: De robot raakt de weg kwijt. Hij vergeet waar hij is of kan niet uitzoeken hoe hij bij een doel kan komen.
  2. Objecthallucinatie: De robot probeert een object op te pakken dat er niet is (zoals een kop proberen te pakken die eigenlijk achter een muur staat).
  3. Voortijdige Beëindiging: De robot geeft te vroeg op. Hij denkt: "Ik ben wel dichtbij genoeg," en stopt voordat hij de taak daadwerkelijk heeft voltooid.
  4. Actie-loops: De robot zit vast in een cirkel en voert steeds dezelfde nutteloze beweging uit (zoals op zijn plek draaien) totdat de tijd om is.

5. De Kern van het Verhaal

SpatialWorld bewijst dat hoewel AI erg goed wordt in het kijken naar foto's en vragen daarover beantwoorden, het nog steeds erg slecht is in het handelen in een 3D-wereld.

Het artikel concludeert dat we moeten stoppen met AI te testen met statische foto's en moeten beginnen met het testen van deze actieve, "blinde" navigatietaken. Totdat de succesratio's aanzienlijk stijgen, kunnen we deze agenten niet vertrouwen om veilig of effectief te opereren in onze echte fysieke wereld.

Kortom: We hebben een zeer zware rijtest voor AI-robots gebouwd. Momenteel zakken zelfs de beste bestuurders voor de test, raken ze verdwaald of geven ze te vroeg op. We moeten ze leren hoe ze daadwerkelijk moeten navigeren, en niet alleen hoe ze een kaart moeten bekijken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →