Chain of Spatial Thoughts: Modality-Agnostic Spatial Grounding for Vision Language Models
Dit artikel introduceert Space Tokens, een lichtgewicht en modaliteitsagnostisch framework dat de ruimtelijke redeneercapaciteiten van visie-taalmodellen verbetert door 3D-geometrie en objectattributen te distilleren naar continue latente tokens voor chain-of-thought-verwerking, waarmee state-of-the-art prestaties wordt behaald op ruimtelijke benchmarks zonder dat er aanvullende modules tijdens de inferentie vereist zijn.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert navigeren door een romige woonkamer. Je laat het een foto zien van een bank, een salontafel en een kat. Een basisrobot zou kunnen zeggen: "Ik zie een bank." Maar om een speelgoedje op te pakken zonder de tafel omver te stoten, moet de robot veel meer weten: Hoe groot is de bank? Hoe ver is hij van de muur verwijderd? Zit de kat op de tafel of onder de tafel? Dit is het verschil tussen simpelweg zien en echt ruimte begrijpen. In de wereld van kunstmatige intelligentie wordt dit "ruimtelijke intelligentie" genoemd. Lange tijd waren computers geweldig in het herkennen van objecten, maar slecht in het begrijpen van hoe die objecten samenpassen in een ผิด 3D-ruimte. Om dit op te lossen, hebben wetenschappers twee hoofdzaken geprobeerd: ofwel het brein van de computer (het model) enorm en duur maken, of speciale, zware gereedschappen toevoegen om afstanden te meten. Beider talen werken, maar ze zijn traag en log.
Nu heeft een team onderzoekers een slimme nieuwe truc bedacht genaamd "Space Tokens". Denk aan een standaard AI-model als een student die een toets maakt. Normaal gesproken, als de student moet weten hoe hij een kamer moet meten, moet hij een passer en een meetlint meenemen (extra gereedschap) of een enorme encyclopedie over meetkunde uit het hoofd leren (een enorm brein). Dit nieuwe onderzoek suggereert een andere aanpak: wat als de student gewoon in afmetingen zou kunnen denken? De onderzoekers hebben een manier gevonden om de AI te leren interne "mentale aantekeningen" te maken binnen zijn eigen denkproces. Deze aantekeningen, of "tokens", fungeren als kleine, continue fluisteringen van meetkunde die de AI kan gebruiken om na te denken over grootte, afstand en vorm, zonder dat hij extra gereedschap of een groter brein nodig heeft. Het is also kind de AI een ingebouwd gevoel voor ruimte te geven dat hij kan gebruiken terwijl hij praat, waardoor hij slimmer wordt over de fysieke wereld zonder dat hij vertraagt.
Het Probleem: Grote Breinen versus Zware Gereedschappen
Stel je voor dat je een zeer intelligente vriend hebt die erg goed is in het beschrijven van foto's. Je laat hem een foto van een keuken zien, en hij kan zeggen: "Dat is een koelkast, en dat is een broodrooster." Maar als je vraagt: "Kan ik een gigantische pizzadoos tussen de koelkast en de broodrooster passen?", dan raadt hij het misschien fout omdat hij de ruimte niet echt "voelt".
Om dit op te lossen, hebben wetenschappers twee hoofdpaden bewandeld. Het eerste pad is "schalen", wat is alsof je de vriend vertelt dat hij elk boek in de bibliotheek moet lezen en elke mogelijke kamerindeling moet onthouden. Dit werkt, maar het vereist een enorm brein dat er eeuwen over doet om te draaien. Het tweede pad is "gespecialiseerde gereedschappen", wat is alsof je de vriend een laserafstandsmeter en een 3D-scanner geeft telkens wanneer hij naar een foto kijkt. Dit is nauwkeurig, maar het is traag, duur, en de vriend kan het niet gebruiken als hij haast heeft of als de gereedschappen niet beschikbaar zijn.
De auteurs van dit paper stelden een simpele vraag: Kunnen we de vriend leren de ruimte gewoon in zijn hoofd te "weten", zonder de bibliotheek of de laserafstandsmeter nodig te hebben?
De Oplossing: Space Tokens
De onderzoekers introduceerden een methode genaamd Space Tokens. In plaats van nieuwe hardware toe te voegen of het AI-model groter te maken, hebben ze de AI geleerd om speciale "tokens" (wat simpelweg kleine stukjes data zijn) te genereren die de 3D-ruimte vertegenwoordigen.
Beschouw deze tokens als onzichtbare plaknotities die de AI op zijn eigen gedachten plakt.
- Scene-Level Notes: Sommige notities beschrijven de hele kamer. Ze leggen de vorm van de vloer vast, de positie van de muren en de diepte van de kamer.
- Object-Level Notes: Andere notities beschrijven specifieke voorwerpen. Ze bevatten informatie over waar een object zich bevindt, hoe groot het is en in welke richting het wijst.
De magie is dat deze notities "continu" zijn, wat betekent dat ze niet alleen eenvoudige labels zijn zoals "groot" of "klein". Ze zijn als precieze coördinaten en metingen die de AI kan gebruiken om in zijn hoofd met wiskunde te rekenen. De AI leert deze notities te maken door te kijken naar voorbeelden van een "leraar"-model (een zeer intelligent 3D-reconstructiesysteem) en vervolgens te oefenen tot hij het uit zichzelf kan.
Hoe ze de AI hebben onderwezen
De training vond plaats in drie fasen, als een videogame met drie levels:
- Level 1: De taal van de ruimte leren. De AI kreeg foto's te zien en werd geleerd om de "plaknotities" (tokens) te genereren die overeenkomen met de 3D-geometrie van de scène. Het leerde zijn interne gedachten af te stemmen op de precieze 3D-vormen van de wereld.
- Level 2: Denken met de notities. Zodra de AI wist hoe hij de notities moest maken, leerden ze hem deze te gebruiken om vragen te beantwoorden. Ze dwongen de AI om naar de notities te kijken en te zeggen: "Omdat de koelkast 2 meter verwijderd is, past de pizzadoos niet." Dit wordt "Chain-of-Thought" redeneren genoemd, maar nu bevatten de gedachten ruimtelijke data.
- Level 3: Beter worden door oefening. Ten slotte gebruikten ze een techniek genaamd Reinforcement Learning. De AI probeerde vragen te beantwoorden, en als hij de grootte of afstand goed had, kreeg hij een "beloning". Als hij het fout had, leerde hij van de fout. Dit hielp de AI om nog scherper te worden in het gebruiken van zijn ruimtelijke notities.
Wat ze ontdekten
De resultaten waren indrukwekkend. De onderzoekers testten hun nieuwe methode op een benchmark genaamd VSI-Bench, wat een zeer zware test is voor ruimtelijk begrip.
- Toen ze dit toepasten op een model genaamd Qwen3-VL-8B, steeg de score met 4,3%.
- Toen ze dit toepasten op een sterker model genaamd SenseNova-SI-1.3, steeg de score met 1,3%.
Maar de echte overwinning zat in specifieke taken. De nieuwe methode werd de beste ter wereld in het voorspellen van objectgrootte (waarbij 79,2% correct was) en kamergrootte (waarbij 75,7% correct was). Dit zijn taken die normaal gesproken zware 3D-tools vereisen, maar deze methode deed het enkel door de interne "plaknotities" te gebruiken.
Waarom dit ertoe doet
Het meest opwindende deel is dat de AI zijn brein niet hoefde te veranderen of extra gereedschap hoefde mee te dragen. Hij leerde simpelweg anders te denken. De onderzoekers lieten ook zien dat deze "plaknotities" echt zijn. Ze konden deze terug decoderen naar 3D-vormen en zagen dat de AI daadwerkelijk de geometrie van de kamer had geleerd. Het was niet slechts een gok; het had een echt begrip van de ruimte.
Dit suggereert dat we geen grotere, tragere of duurdere AI-modellen hoeven te bouwen om ze ruimtelijk intelligent te maken. We moeten ze alleen leren hoe ze hun interne ruimtelijke notities kunnen creëren en gebruiken. Het is een lichtere, snellere en flexibelere manier om machines het vermogen te geven om in onze 3D-wereld te navigeren, wat een enorme stap voorwaarts is voor zaken als robots die door onze huizen moeten bewegen of auto's die veilig moeten rijden.
Kortom, het paper laat zien dat door AI een manier te geven om "in 3D te denken" met eenvoudige, interne tokens, we ze veel beter kunnen maken in het begrijpen van de fysieke wereld zonder ze zwaarder of trager te maken. Het is een kleine verandering in hoe de AI denkt die leidt tot een grote sprong in wat hij kan doen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.