← Nieuwste papers
💻 computer science

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D is een snel 4D world action model dat lichtgewicht ruimtelijke register tokens gebruikt om vooraf getrainde geometrische priors over te dragen naar een causale video-action transformer, waardoor het nauwkeurige 3D-manipulatievoorspellingen bereikt met efficiënte inferentie terwijl de computationele kosten van dichte geometrische decodering worden vermeden.

Oorspronkelijke auteurs: Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

Gepubliceerd 2026-06-15
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Jian Tang, Sirui Han, Shanghang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot leert hoe hij een breekbare beker moet oppakken en water in een glas moet schenken. Om dit goed te doen, moet de robot niet alleen begrijpen hoe de beker eruit ziet, maar ook waar deze zich in de 3D-ruimte bevindt, hoe zwaar hij kan aanvoelen en wat er gebeurt als hij tegen de tafel stoot.

Lange tijd waren de hersenen van robots (AI-modellen) als kunstenaars die een prachtig beeld van de toekomst konden tekenen, maar je niet precies konden vertellen hoe ver de beker weg was. Ze konden voorspellen "de beker zal hier zijn" in een 2D-video, maar ze misten vaak de verborgen delen of de exacte afstand die nodig is om iets te pakken zonder het te laten vallen.

WAM4D is een nieuw "robotbrein" dat ontworpen is om dit probleem op te lossen. Zo werkt het, met behulp van eenvoudige analogieën:

1. Het Probleem: De "Platte" Toekomst

De meeste huidige robotmodellen zijn als het kijken naar een film op een plat televisiescherm. Ze kunnen wel voorspellen hoe het volgende frame van de video eruit zal zien, maar ze begrijpen de diepte van de scène niet echt. Als een robot probeert een object te pakken dat gedeeltelijk achter een ander object verborgen is, kan een "plat" model de verkeerde locatie raden omdat het de 3D-vorm niet kan "zien".

2. De Oplossing: De "Geestarchitect" (Spatial Register Tokens)

De auteurs hebben een slimme truc bedacht genaamd Spatial Register Tokens. Denk aan deze als "Geestarchitecten" of "onzichtbare plaknotities" die de robot alleen gebruikt terwijl hij aan het leren is.

  • Tijdens de training: Stel je voor dat de robot leert om een videogame te spelen. Terwijl hij oefent, verschijnen deze "Geestarchitecten". Ze kijken naar de geschiedenis van wat de robot tot nu toe heeft gezien en vragen aan een superintelligente, vooraf getrainde 3D-expert (een geometrisch fundamentmodel): "Gebaseerd op wat we tot nu toe hebben gezien, hoe ziet de dieptekaart van de toekomst eruit?"
  • De Les: De robot probeert de toekomstige video te voorspellen. De "Geestarchitecten" controleren of de gok van de robot logisch is in de 3D-ruimte. Als de robot voorspelt dat de beker in de lucht zweeft terwijl hij op de tafel zou moeten staan, zeggen de Geestarchitecten: "Nee, dat klopt niet in 3D," en de robot leert van deze fout.
  • De Magie: Dit leert de robot om 3D-geometrie te begrijpen zonder dat hij elke keer een complexe 3D-kaart hoeft te genereren tijdens zijn bewegingen.

3. Het Resultaat: De "Lichtgewicht Piloot"

Dit is het beste deel: Zodra de robot klaar is met leren, verdwijnen de Geestarchitecten.

  • In de echte wereld: Wanneer de robot daadwerkelijk zijn werk doet (zoals het oppakken van de beker), hoeft hij geen complexe 3D-kaarten te berekenen of zware 3D-decodering uit te voeren. Hij gebruikt simpelweg het "spiergeheugen" dat hij heeft geleerd van de Geestarchitecten.
  • Waarom dit ertoe doet: Het is alsof een student urenlang met een bijlesdocent (de Geestarchitecten) heeft gestudeerd om de diepe wiskunde te begrijpen, maar op de dag van het examen gewoon de vragen snel beantwoordt zonder de bijlesdocent nodig te hebben. Dit maakt de robot snel en efficiënt, terwijl hij nog steeds slim genoeg is om met 3D-ruimte om te gaan.

4. De "Verkeersregelaar" (Causal Mixture Attention)

Om ervoor te zorgen dat de robot niet vals speelt, hebben de auteurs een "Verkeersregelaar"-systeem toegevoegd. In AI betekent "vals spelen" dat je naar de toekomst kijkt om het heden te raden. De Verkeersregelaar zorgt ervoor dat de robot alleen kijkt naar wat er al is gebeurd (de video uit het verleden en de acties) om te beslissen wat hij nu moet doen. Het verbiedt de robot strikt om in de "toekomstige diepte" of de "toekomstige video" te spieken tijdens het nemen van een beslissing, zodat de robot in real-time handelt, precies zoals een mens dat zou doen.

Wat hebben ze bewezen?

Het team heeft dit nieuwe robotbrein getest op een dual-armed robot (RoboTwin) en een echte robot (AstriBot).

  • Betere Nauwkeurigheid: De robot was veel beter in taken die een nauwkeurig contact vereisen, zoals het stapelen van blokken, het verwijderen van dopjes van pennen of het sorteren van voorwerpen, omdat hij de 3D-vorm van de wereld beter begreep.
  • Snelheid: Hoewel hij leerde van 3D-geometrie, draait hij net zo snel als andere snelle robots omdat de zware 3D-berekeningen tijdens de eigenlijke taak worden verwijderd.
  • Succes in de echte wereld: De robot voltooide succesvol moeilijke taken in de echte wereld, zoals het optillen van borden en het sorteren van LEGO-blokjes, waarbij hij eerdere modellen die deze 3D "Geestarchitect"-truc niet gebruikten, overtrof.

Samenvattend

WAM4D is een robotbrein dat leert de 3D-wereld te begrijpen door tijdens de training een tijdelijke, onzichtbare 3D-bijlesdocent te gebruiken. Eenmaal getraind, vergeet hij de zware wiskunde en wordt hij een snelle, efficiënte piloot die nog steeds in staat is om complexe, 3D-omgevingen met precisie te navigeren. Het overbrugt de kloof tussen "een video zien" en "het fysieke wereld begrijpen".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →