← Nieuwste papers
💻 computer science

3D Primitives are a Spatial Language for VLMs

Dit artikel introduceert 3D-geometrische primitieven, uitgedrukt in code als een krachtige ruimtelijke taal voor Vision-Language-modellen, en toont aan via de SpatialBabel-benchmark, de trainingsvrije Code-CoT-inferentiestrategie en de zelftoezichtende S3^{3}-FT-finetuningmethode dat deze intermediaire representatie het ruimtelijk redeneren aanzienlijk verbetert en generaliseert over diverse VLM-architecturen zonder menselijke labels.

Oorspronkelijke auteurs: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

Gepubliceerd 2026-05-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Junze Liu, Kun Qian, Florian Dubost, Kai Zhong, Arvind Srinivasan, Nan Chen, Anping Wang, Sam Zhang, Alejandro Mottini, Qingjun Cui, Tian Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme, artistieke robot hebt die naar een foto van een kamer kan kijken en deze voor je kan beschrijven. Maar hier is het vreemde: als je deze robot vraagt: "Hoeveel stoelen zijn er in deze foto?", kan hij verkeerd raden en "vijf" zeggen terwijl er slechts drie zijn. Hij lijkt verward.

Als je diezelfde robot echter vraagt om een computerprogramma te schrijven om die exacte kamer te bouwen met eenvoudige vormen (zoals kubussen, bollen en cilinders), doet hij een fantastische baan. Hij schrijft code die precies drie kubussen op de juiste plekken plaatst. Hij kent het antwoord perfect, maar kan het gewoon niet in gewoon Engels zeggen.

Dit paper, getiteld "3D Primitives are a Spatial Language for VLMs," onderzoekt deze vreemde tegenstrijdigheid en gebruikt deze om deze robots slimmer te maken.

Hier is de uiteenzetting van hun ontdekking en oplossing, met eenvoudige analogieën:

1. Het Probleem: De "Tweetalige" Robot

De onderzoekers ontdekten dat Vision-Language Models (VLM's) lijken op mensen die vloeiend zijn in een geheime taal (code), maar moeite hebben met een gemeenschappelijke taal (Engels) als het gaat om ruimte.

  • Het Paradox: De robot kan een perfect 3D-model van een scène bouwen met code (zoals LEGO-instructies), maar als je hem een simpele vraag stelt over diezelfde scène, hallucineert hij (maakt dingen uit zijn duim).
  • De Test (SpatialBabel): Ze creëerden een enorme test genaamd SpatialBabel. Stel je voor dat je de robot dezelfde foto geeft en vraagt hem deze te herbouwen met zes verschillende "talen" (zoals Three.js, Unity, of zelfs een speciaal JSON-formaat).
  • De Schok: De prestaties van de robot varieerden enorm, afhankelijk van welke taal hij moest gebruiken. In de ene taal was hij een meesterbouwer; in de andere een onhandige amateur. Dit bewees dat de "ruimtelijke hersenen" van de robot verstrikt zaten in zijn "code-gewoonten".

2. De Eerste Oplossing: "Code-CoT" (Eerst in Code Denken)

Omdat de robot beter is in het schrijven van code dan in het beantwoorden van vragen, probeerden de onderzoekers een nieuwe truc genaamd Code-CoT (Code Chain-of-Thought).

  • De Analogie: Stel je voor dat je een lastig wiskundig woordprobleem probeert op te lossen. In plaats van direct het antwoord te raden, schrijf je eerst de vergelijking op een stuk papier. Zodra de vergelijking staat, wordt het antwoord duidelijk.
  • Hoe het werkt: Als er een vraag wordt gesteld zoals "Is de rode kubus links van de blauwe bol?", wordt de robot gedwongen eerst de code te schrijven om de scène te bouwen. Zodra de code is geschreven, "leest" de robot zijn eigen code om het antwoord te vinden.
  • Het Resultaat: Dit werkte als een klap voor robots die al goed waren in coderen. Het verbeterde hun nauwkeurigheid aanzienlijk, omdat het hen dwong hun sterke "code-brein" te gebruiken om de "Engelse vraag" op te lossen.

3. De Tweede Oplossing: "S3-FT" (De Zelflerende Robot)

Wat nu met de robots die nog niet goed zijn in coderen? Ze kunnen de truc "eerst code schrijven" niet gebruiken, omdat hun code rommelig is.

De onderzoekers bedachten een methode genaamd S3-FT (Self-Supervised Spatial Fine-Tuning).

  • De Analogie: Stel je voor dat een student slecht is in tekenen. In plaats van een leraar in te huren, tekent de student een plaatje, kijkt daarna direct naar zijn eigen tekening om te zien wat hij goed en fout deed, en probeert het dan opnieuw te tekenen. Hij is zijn eigen leraar.
  • Hoe het werkt:
    1. De robot kijkt naar een eenvoudige foto van geometrische vormen (kubussen, bollen).
    2. Hij probeert code te schrijven om die foto te herbouwen.
    3. De onderzoekers nemen die code en zetten deze automatisch om in een "spiekbriefje" (een gestructureerde lijst met feiten: "Er is een rode kubus op positie X").
    4. Ze voeden dit spiekbriefje terug naar de robot als les, waardoor hij leert vragen correct te beantwoorden op basis van zijn eigen code.
  • Het Resultaat: De robot leerde ruimte te begrijpen zonder menselijke leraren of dure labels. Het nam de "ruimtelijke kennis" die verborgen zat in zijn coderingsvermogen en bracht deze over naar zijn algemene gespreksvaardigheden.

4. De Grote Conclusie

Het paper concludeert dat 3D-geometrische vormen (primitieven) die in code worden uitgedrukt, fungeren als een "universele vertaler" voor deze robots.

  • Als Diagnostisch Hulpmiddel: Als een robot faalt in het beantwoorden van een ruimtelijke vraag maar wel slaagt in het schrijven van code, weten we dat het probleem niet is dat hij de objecten "niet ziet"; het is gewoon dat hij zijn visie niet kan vertalen naar woorden.
  • Als Woordenschat: Door de robot te dwingen in termen van "kubussen, bollen en cilinders" te denken via code, geven we hem een gestructureerde woordenschat om de wereld te begrijpen.

Kortom: De onderzoekers ontdekten dat deze AI-modellen meer weten over ruimte dan ze laten blijken. Door ze te laten "spreken" in de taal van 3D-bouwstenen (code), kunnen ze die verborgen kennis vrijmaken en simpele vragen correct beantwoorden, allemaal zonder dat een mens hen de antwoorden hoeft te leren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →