← Nieuwste papers
🤖 AI

Imaginative Perception Tokens Enhance Spatial Reasoning in Multimodal Language Models

Dit artikel introduceert Imaginative Perception Tokens (IPT), intermediaire perceptuele representaties die Vision Language Models in staat stellen om ruimtelijk redeneren te verbeteren door niet-geobserveerde ruimtelijke configuraties te externaliseren, waardoor ze methoden gebaseerd op tekstuele chain-of-thought overtreffen bij taken zoals perspectiefnemen, padvolgen en meervoudig tellen vanuit verschillende gezichtspunten.

Oorspronkelijke auteurs: Mahtab Bigverdi, Lindsey Li, Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna

Gepubliceerd 2026-06-03
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mahtab Bigverdi, Lindsey Li, Weikai Huang, Yiming Liu, Jaemin Cho, Jieyu Zhang, Tuhin Kundu, Chris Dangjoo Kim, Zelun Luo, Linda Shapiro, Ranjay Krishna

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Idee: AI Leren "Zich het Ongeziene Voor te Stellen"

Stel je voor dat je een videogame speelt. Je staat in een kamer en kijkt naar een deur. De game vraagt je: "Als je door die deur loopt en naar links draait, wat zie je dan aan je rechterkant?"

Huidige AI-modellen (Vision-Language Models) zijn erg goed in het beschrijven van wat er recht voor hun "ogen" staat. Maar ze hebben moeite met deze vraag, omdat het antwoord niet in de afbeelding zit waar ze naar kijken. Ze moeten een nieuwe scène mentaal simuleren die ze nog niet hebben gezien.

Dit artikel stelt dat AI, om deze "ruimtelijke redeneerpuzzels" op te lossen, moet leren hoe het ontbrekende stukjes van de puzzel kan voorstellen, net zoals mensen dat doen. De auteurs noemen dit nieuwe hulpmiddel Imaginative Perception Tokens (IPT's).

Het Problek: AI is slecht in "Wat als?"

Denk aan de huidige AI als een zeer intelligente bibliothecaris die elke boekenplank perfect kan beschrijven. Maar als je vraagt: "Hoe zou de bibliotheek eruitzien als we de boekenplanken naar de achterwand verplaatsen?", loopt de bibliothecaris vast. Ze kunnen alleen beschrijven wat er op dit moment zichtbaar is.

Eerdere pogingen om dit op te lossen bestonden uit het vragen aan de AI om haar gedachten op te schrijven (zoals een "Chain of Thought"). De auteurs ontdekten dat het dwingen van de AI om een 3D-rotatie of een verborgen pad te beschrijven met behulp van woorden, voelt als het proberen te beschrijven van een complexe dansroutine via een simpel tekstbericht. Het is onhandig, verwarrend en leidt vaak tot fouten.

De Oplossing: Het "Mentale Schetsboek"

De auteurs introduceerden Imaginative Perception Tokens (IPT's). In plaats van de AI te vragen een lange beschrijving van het nieuwe gezichtspunt te schrijven, leren ze de AI om een snelle schets te tekenen van wat het denkt te gaan zien.

  • De Analogie: Stel je voor dat je een architect bent. Om te bepalen of een nieuwe muur past, praat je er niet alleen over; je tekent een snel blauwdruk van de nieuwe indeling.
  • Hoe het werkt: De AI wordt getraind om een tussenliggende afbeelding (de "schets") te genereren die het gezichtspunt vertegenwoordigt dat het nog niet echt heeft gezien.
    • Voorbeeld: Als de vraag gaat over het lopen door een gang, tekent de AI een "zij-aanzicht" schets van hoe de gang eruit ziet vanuit het midden van het pad, ook al heeft de AI alleen een kaart en foto's van het begin en het einde.
    • Voorbeeld: Als de vraag gaat over het tellen van stoelen in een rommelige kamer gezien vanuit drie verschillende hoeken, tekent de AI een "vogelvlucht" kaart om te zien waar elke stoel staat zonder dubbel te tellen.

Zodra de AI deze mentale schets heeft "getekend", kijkt de AI naar de eigen tekening om het uiteindelijke antwoord te geven.

De Drie "Imagination Gym" Taken

Om dit te testen, hebben de onderzoekers drie specifieke trainingsspellen (datasets) gemaakt waarbij de AI moest oefenen met het voorstellen:

  1. Perspectief Innemen (Het "Teleportatie"-spel):

    • De Opstelling: Je ziet een kamer vanuit één hoek.
    • De Taak: "Als je naar deze gemarkeerde plek teleporteert en 90 graden draait, is de bank dan links of rechts van je?"
    • De Verbeelding: De AI moet een afbeelding van de kamer genereren vanuit die nieuwe plek om het antwoord correct te geven.
  2. Pad Volgen (Het "Blinde Wandeling"-spel):

    • De Opstelling: Je hebt een plattegrond van een pad en foto's van het begin- en eindpunt.
    • De Taak: "Terwijl je langs dit pad loopt, welk object zie je aan je linkerzijde op het middelpunt van het pad?"
    • De Verbeelding: De AI moet een "eerste-persoonsperspectief" genereren van het midden van het pad, wat het nog nooit echt heeft gezien.
  3. Multiview Tellen (Het "Puzzel"-spel):

    • De Opstelling: Je krijgt drie verschillende foto's van een kamer genomen vanuit verschillende hoeken.
    • De Taak: "Hoeveel stoelen staan er in totaal in deze kamer?" (Sommige stoelen kunnen in één foto verborgen zijn, maar in een andere wel zichtbaar).
    • De Verbeelding: De AI moet een enkele "vogelvlucht kaart" genereren die alle drie de perspectieven combineert tot één compleet beeld om nauwkeurig te kunnen tellen.

Wat Ze Vonden

De onderzoekers trainden een krachtig AI-model (BAGEL) met deze "mentale schetsen" als leermiddel. Dit is wat er gebeurde:

  • Tekenen wint van Schrijven: Wanneer de AI werd gedwongen om te "denken" door een schets te tekenen (IPT), werd het veel beter in ruimtelijke vragen dan wanneer het werd gedwongen om te "denken" door woorden te schrijven (Text Chain-of-Thought). Sterker nog, het schrijven van woorden maakte de AI soms zelfs slechter in deze taken, omdat woorden een gebrekkige manier zijn om 3D-ruimte te beschrijven.
  • De Magie van Training: Zelfs toen de AI later werd getest zonder dat het de schets mocht tekenen (het moest alleen het antwoord geven), presteerde het nog steeds beter. Dit suggereert dat de handeling van het "tekenen" tijdens de training een sterkere interne kaart in het "brein" van de AI heeft opgebouwd.
  • Beter dan de Beste: Op sommige taken stelde deze methode de open-source modellen in staat om te concurreren met zeer dure, gesloten bronmodellen (zoals GPT-5) die deze benchmarks normaal gesproken domineren.

De Kernboodschap

Dit artikel laat zien dat als we willen dat AI ruimte en navigatie begrijpt, we het niet alleen moeten vragen om "harder na te denken" in woorden. In plaats daarvan moeten we de AI leren om het ongeziene te visualiseren. Door de AI een "mentaal schetsboek" te geven om nieuwe gezichtspunten voor te stellen, helpen we het een sterker begrip van de 3D-wereld op te bouwen, waardoor het puzzels kan oplossen die voorheen onmogelijk voor het waren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →