← Nieuwste papers
💻 computer science

WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors

Het artikel introduceert WholeBodyWAM, een humanoid wereld-actie model dat gebruikmaakt van een grootschalige, heterogene bewegingscorpus (UniMotion-4K) om een overdraagbare bewegingsprior voor te trainen, wat de data-efficiëntie en de prestaties bij manipulatie downstream aanzienlijk verbetert wanneer het wordt geïntegreerd met video- en actie-experts via asymmetrische Mixture-of-Transformers attention.

Oorspronkelijke auteurs: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

Gepubliceerd 2026-09-17
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Bowei Zhang, Qiyao Zhang, Shuanghao Bai, Xinhua Wang, Meng Li, Yilei Wang, Leiwang Zhang, Jian Tang, Lu Zhou, Lei Sun, Zhengping Che

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Om een robot te maken die beweegt als een mens, worden ingenieurs geconfronteerd met een fundamenteel probleem: het is ongelooflijk moeilijk om een machine te leren hoe ze haar hele lichaam moet coördineren. Een mens denkt niet na over het bewegen van elke individuele spier wanneer hij naar een kopje reikt of door een kamer loopt; het lichaam beweegt als één vloeiende eenheid. Voor robots moet echter elk gewricht en elk ledemaat afzonderlijk worden aangestuurd, en het verzamelen van de miljoenen uren aan oefendata die nodig zijn om een specifieke robot deze vaardigheid te leren, is traag, duur en vaak onmogelijk. Hoewel wetenschappers krachtige modellen hebben gebouwd die taal kunnen begrijpen en de wereld kunnen zien, worstelen deze systemen vaak met het voorspellen van hoe het eigen lichaam van een robot in de toekomst zal bewegen, waarbij ze in plaats daarvan vertrouwen op het reageren op wat er op dit moment gebeurt. Deze beperking maakt het moeilijk voor robots om complexe taken uit te voeren die vooruitplanning vereisen, zoals het dragen van een zware doos terwijl ze over oneffen grond navigeren of knielen om een object op te pakken zonder het evenwicht te verliezen.

Een team van onderzoekers heeft deze uitdaging aangepakt door een robot te leren leren van de enorme, gratis bibliotheek van menselijke bewegingen die op internet beschikbaar is, in plaats van uitsluitend te vertrouwen op dure demonstraties van de robot zelf. Ze creëerden een nieuw systeem genaamd WHOLEBODYWAM, dat fungeert als een voorspellende motor voor het lichaam van de robot. In plaats van alleen een video te bekijken en te gissen wat de volgende stap is, leert dit systeem de onderliggende fysica van hoe lichamen in de loop van de tijd bewegen. Het werd getraind op een enorme collectie bewegingsdata genaamd UniMotion-4K, die meer dan 4.100 uur aan bewegingen bevat, opgenomen uit menselijke video's, gespecialiseerde 3D-motion capture-datasets en andere humanoïde robots. Door al deze verschillende bronnen om te zetten naar een enkele, gedeelde taal van beweging, leerde het systeem een algemeen "intuïtie" voor hoe een lichaam moet overgaan van de ene houding naar de andere. Deze intuïtie werd vervolgens overgedragen naar een echte humanoïde robot, waardoor de robot zijn eigen toekomstige bewegingen kan anticiperen en complexe hele-lichaamstaken met veel meer vaardigheid en efficiëntie kan uitvoeren dan eerdere methoden.

De kern van dit werk ligt in een tweetraps trainingsproces dat het leren van de algemene regels van beweging scheidt van het leren hoe ze toe te passen op een specifieke machine. In de eerste fase bestudeerde het systeem de enorme dataset van menselijke en robotbewegingen zonder ooit een enkel voorbeeld te hebben gezien van de werkelijke commando's van de doelrobot. Het leerde te voorspellen wat een lichaam vervolgens zou doen op basis van een eenvoudige tekstuele beschrijving van een taak, zoals "pak het speelgoed op" of "ga knielen". Dit creëerde een krachtig fundament, een voorspellende prior die begreep welke gecoördineerde dans van ledematen en balans vereist was voor mensachtige beweging. In de tweede fase werd deze vooraf getrainde kennis gecombineerd met een video-begrijpendheidsmodule en een actiegenerator. Het systeem werd vervolgens getoond een klein aantal demonstraties van de specifieke robot, de TianGong 3.0, om te leren hoe het zijn algemene begrip van beweging kan vertalen naar de specifieke motoraansturing die de gewrichten van die robot nodig hebben om uit te voeren. Cruciaal is dat het systeem niet alleen reageert op de huidige scène; het gebruikt zijn geleerde kennis om de toekomstige staat van zijn eigen lichaam te visualiseren, waarbij het die voorspelling gebruikt om zijn acties in realtime te sturen.

Wanneer het werd getest op zes moeilijke taken in de echte wereld, waren de resultaten opmerkelijk. De robot kreeg de opdracht om acties uit te voeren zoals het oppakken van speelgoed, het laden van de was in een wasmachine, het overbrengen van een kussen naar een bank en het dragen van een doos naar een tafel. Deze taken vereisten dat de robot tegelijkertijd boog, liep, knielde en objecten manipuleerde. Het nieuwe systeem presteerde beter dan de beste bestaande methoden en behaalde een succespercentage dat aanzienlijk hoger lag over alle taken. Bijvoorbeeld, in de taak van het overbrengen van een doos, waarbij de robot een doos moest optillen, naar een zijtafel moest lopen en deze moest neerzetten, slaagde het nieuwe systeem in 73,3% van de gevallen, vergeleken met veel lagere percentages voor andere benaderingen. De onderzoekers ontdekten dat hoe meer bewegingsdata ze gebruikten om de initiële "bewegingsexpert" te trainen, hoe beter de robot presteerde, wat suggereert dat het systeem echt een schaalbare vaardigheid leerde in plaats van alleen specifieke voorbeelden te onthouden. Nog belangrijker is dat het systeem zeer efficiënt bleek met data; toen de onderzoekers de hoeveelheid specifieke robotdemonstraties die beschikbaar was voor training met de helft verminderden, presteerde de robot die vooraf was getraind op de enorme bewegingsdataset nog steeds beter dan andere robots die getraind waren op de volledige set demonstraties.

Deze aanpak toonde ook een opmerkelijk vermogen om om te gaan met veranderingen in de omgeving. Wanneer de onderzoekers de doelmand iets verplaatsten of de kleur en vorm van het speelgoed veranderden dat de robot moest oppakken, paste het systeem zich snel aan en behield het een hoge prestatie waar andere modellen moeite mee hadden. Het systeem bereikte dit zonder een video van de toekomst te hoeven genereren, wat computationeel duur en traag zou zijn. In plaats daarvan voorspelde het de toekomstige posities van zijn eigen gewrichten direct, waardoor het beslissingen kon nemen in ongeveer 363 milliseconden, een snelheid die snel genoeg is voor realtime controle. De studie bevestigt dat hoewel een robot menselijke bewegingen niet simpelweg kan kopiëren omdat zijn lichaam anders is, hij kan leren van de overvloedige patronen van menselijke beweging om een robuust, voorspellend begrip te ontwikkelen van hoe hij zijn eigen lichaam moet bewegen. Door gebruik te maken van de overvloed aan menselijke bewegingsdata die in de wereld beschikbaar is, biedt deze methode een nieuwe weg naar het creëren van humanoïde robots die niet alleen in staat zijn tot complexe taken, maar die deze ook kunnen leren met veel minder demonstraties dan voorheen mogelijk werd geacht.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →