← Nieuwste papers
💻 computer science

LD4WAM: Learning Latent Dynamics from Human Videos for World Action Models

LD4WAM is een nieuw framework dat menselijke video-priors en actiegerichte robotbesturing overbrugt door belichaamings-agnostische, bewegings-uitgelijnde latente dynamiek te leren, waardoor een mixture-of-transformers wereldmodel effectief kan generaliseren over diverse objecten, achtergronden en robotische belichamingen.

Oorspronkelijke auteurs: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

Gepubliceerd 2026-08-25
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zhenhao Shen, Jiaqi Liang, Jasper Lu, Feng Jiang, Yuran Wang, Chuanbo Wei, Jiayi Liu, Jianchun Yang, Qize Yu, Jiadi You, Ce Hao, Guanqi He, Chen Xie, Ruihai Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots worstelen al lange tijd met het leren van het observeren van mensen. Hoewel een machine geprogrammeerd kan worden met precieze instructies voor een enkele taak, is het aanleren van het begrip van de vloeiende, chaotische realiteit van menselijke beweging een enorme uitdaging geweest. Jarenlang hebben onderzoekers geprobeerd deze kloof te overbruggen door robots duizenden uren aan video te voeren, in de hoop dat de machine de regels van de fysica en oorzaak-gevolgrelaties zou leren door simpelweg te observeren. Echter, een fundamenteel probleem bleef hardnekkig aanwezig: wanneer een robot ziet hoe een menselijke hand een kopje oppakt, ziet hij slechts pixels die veranderen op een scherm. Hij begrijpt van nature niet dat de hand op een specifieke manier beweegt om een doel te bereiken, noch weet hij hoe hij die visuele observatie moet vertalen naar de specifieke motorische commando's die nodig zijn voor zijn eigen mechanische lichaam om te bewegen. De visuele wereld is rijk aan details, maar veel van die details—zoals de kleur van een shirt of de textuur van een tafel—zijn irrelevant voor de mechanica van de handeling zelf. Om een robot effectief te onderwijzen, hebben wetenschappers een manier nodig om de visuele ruis weg te filteren en de pure, onderliggende beweging te extraheren, waardoor een universele taal ontstaat die zowel menselijke video als robotmechanica kan begrijpen.

Een team van onderzoekers heeft een nieuw systeem ontwikkeld genaamd LD4WAM, dat dit probleem oplost door een tussenlaag van begrip te creëren tussen wat een robot ziet en wat hij doet. In plaats van te proberen het volgende frame van een video pixel voor pixel te voorspellen, wat vaak leidt tot modellen die goed zijn in het raden van afbeeldingen maar slecht in bewegen, hebben de onderzoekers hun systeem getraind om zich te concentreren op "bewegings-gealigneerde latente dynamiek" (motion-aligned latent dynamics). In eenvoudiger woorden: het systeem leert de verschijning van objecten en het specifieke uiterlijk van de omgeving te negeren, en focust in plaats daarvan op de essentiële veranderingen in beweging tussen het ene moment en het volgende. Het fungeert als een vertaler die de complexe visuele data van een mens die naar een object reikt, omzet in een compacte, abstracte representatie van die beweging. Deze representatie wordt vervolgens gebruikt om de eigen acties van de robot aan te sturen, waardoor het kan leren van menselijke video's zonder in de war te raken door de verschillen tussen een menselijk lichaam en een robotarm.

Om dit systeem te bouwen, hebben de onderzoekers eerst een enorme collectie gegevens verzameld, bestaande uit meer dan 5.000 uur aan video van zowel mensen als robots. Deze dataset bevatte diverse scenario's, van eenvoudige taken zoals het sorteren van items tot complexe manipulaties waarbij delicate gereedschappen betrokken waren. Ze hebben deze data grondig opgeschoond door fragmenten te verwijderen waarbij de camera te veel schokte of waar handen niet zichtbaar waren, om er zeker van te zijn dat het systeem alleen leerde van heldere, relevante voorbeelden. De kern van hun innovatie ligt in de manier waarop ze deze data verwerkten. Ze trainden een model om naar een sequentie van videoframes te kijken en de specifieke "delta" of verandering in positie te identificeren die optrad, waardoor het systeem effectief het verschil leerde tussen een statisch beeld en een bewegend beeld. Door deze geleerde veranderingen af te stemmen op werkelijke fysieke bewegingen die bij robots zijn opgenomen, creëerden ze een brug die de visuele wereld verbindt met de fysieke wereld. Deze brug stelt de robot in staat om te begrijpen dat een specifiek visueel patroon overeenkomt met een specifieke mechanische actie, ongeacht of de oorspronkelijke video een mens of een machine liet zien.

Het systeem werkt in twee hoofdfasen. Ten eerste analyseert een gespecialiseerd model de video om deze bewegingspatronen te extraheren, waarbij irrelevante details zoals rommel op de achtergrond of veranderingen in de verlichting worden weggegooid. Ten tweede gebruikt een groter "wereld-actiemodel" (world action model) deze geëxtraheerde patronen om te voorspellen wat er hierna zal gebeuren en om te beslissen welke actie genomen moet worden. Dit tweede model is ontworpen om flexibel te zijn; het kan een voorspelling genereren van de toekomstige video om te garanderen dat de fysica klopt, terwijl het tegelijkertijd de geëxtraheerde bewegingspatronen gebruikt om de precieze bewegingen te bepalen die nodig zijn om een doel te bereiken. De onderzoekers testten deze aanpak op twee manieren: in een zeer realistische computersimulatie met 50 verschillende taken, en op echte fysieke robots uitgerust met zowel eenvoudige tweevingerige grijpers als complexe, mensachtige handen. In de simulatie behaalde het systeem een succespercentage van 93,4 procent, waarmee het eerdere state-of-the-art methoden versloeg. Bij de inzet op echte robots toonde het een vermogen om langdurige, meerstaps-taken uit te voeren, zoals het opruimen van een bureau of het vouwen van een shirt, en presteerde het zelfs goed met behendige handen bij het manipuleren van objecten zoals een Rubiks kubus.

Een van de meest significante bevindingen was het vermogen van het systeem om te generaliseren naar situaties die het nog nooit eerder had gezien. Wanneer het werd getest met objecten die het tijdens de training niet was tegengekomen, of in kamers met andere achtergronden en verlichting, behield de robot een hoog niveau van prestatie. Dit suggereert dat het systeem werkelijk de onderliggende mechanica van de taken heeft geleerd, in plaats van enkel specifieke visuele scènes te hebben onthouden. Wanneer de robot bijvoorbeeld werd gevraagd een mok naar een nieuwe locatie te verplaatsen, kon hij dit doen, zelfs als de mok een andere vorm had of de tafel een andere textuur bezat. De onderzoekers ontdekten dat de sleutel tot dit succes de "bewegings-gealigneerde" aard van hun training was; door het leren te funderen in echte fysieke beweging, voorkwam het systeem de valkuil van overfitten op visuele details die er niet toe doen voor de taak. De resultaten wijzen erop dat deze aanpak robots in staat stelt om te leren van de enorme, onbenutte bron van menselijke video-data, en dit te transformeren naar een praktische gids voor robotbesturing.

De studie benadrukte ook wat minder goed werkt dan de nieuwe methode. Eerdere benaderingen die probeerden direct van pixelveranderingen te leren zonder deze af te stemmen op echte beweging, faalden vaak in het produceren van actiegerichte resultaten, waardoor de robot niet in staat was om te vertalen wat hij zag naar wat hij moest doen. Op dezelfde manier hadden methoden die zwaar leunden op het direct matchen van menselijke lichaamsdelen aan robotgewrichten moeite wanneer de robot een andere fysieke structuur had, zoals een grijper in plaats van een hand. Het nieuwe systeem vermijdt deze valkuilen door zich te concentreren op de abstracte dynamiek van beweging in plaats van op de specifieke anatomie van de actor. Hoewel het systeem enkele beperkingen vertoonde wanneer de achtergrondtextuur drastisch veranderde, presteerde het nog steeds aanzienlijk beter dan andere modellen onder deze uitdagende omstandigheden, wat bewijst dat de bewegings-gealigneerde aanpak een robuust fundament biedt voor robotleren.

Uiteindelijk vertegenwoordigt dit werk een verschuiving in hoe robots leren door observatie. Door een representatie te creëren die onafhankelijk is van het specifieke lichaam dat de handeling uitvoert, hebben de onderzoekers aangetoond dat een robot kan leren van een menselijke video en die kennis kan toepassen op zijn eigen unieke mechanische vorm. Het systeem vereist niet dat de robot een mensachtig lichaam heeft om te profiteren van menselijke demonstraties; het vereist alleen een manier om de intentie en de beweging achter de handeling te begrijpen. Met een dataset van meer dan 270 miljoen frames en succesvolle tests op echte hardware, hebben de onderzoekers aangetoond dat deze methode niet slechts een theoretische mogelijkheid is, maar een praktisch hulpmiddel voor het bouwen van meer capabele en aanpasbare robots. Het vermogen om te leren van een dergelijke enorme hoeveelheid menselijke data opent de deur naar een toekomst waarin robots getraind kunnen worden op een grote verscheidenheid aan taken zonder de noodzaak van dure, tijdrovende demonstraties voor elke nieuwe specifieke baan die ze tegenkomen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →