← Nieuwste papers
💻 computer science

OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining

Dit artikel introduceert OpenWAM, een open en modulaire onderzoeksstack die systematisch de pretraining van World-Action Models onderzoekt door middel van gecontroleerde experimenten om de belangrijkste ontwerpprincipes af te leiden, wat culmineert in de release van het hoogpresterende OpenWAM-α\alpha-model dat is getraind op 6.400 uur aan diverse belichaamde data.

Oorspronkelijke auteurs: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu
Gepubliceerd 2026-09-09
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yuran Wang, Siqiao Huang, Mingleyang Li, Chenhao Zhang, Jiaqi Liang, Weiyang Jin, Yue Chen, Xuemin Chi, Donghao Zhou, Qize Yu, Yu-Kai Wang, Yuhan Rui, Shenzhe Yao, Zhen Yuan, Zhenhao Shen, Kefei Zhu, Zijie Zhu, Ning Gao, Xiaowei Chi, Guanqi He, Shanghang Zhang, Hao Dong, Lin Shao, Hang Zhao

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Intelligentie gaat niet alleen over het zien van de wereld; het gaat over weten hoe je die moet veranderen. Decennialang hebben wetenschappers computersystemen gebouwd die objecten in een foto kunnen herkennen of een scène in een zin kunnen beschrijven. Recentelijk hebben ze modellen gecreëerd die kunnen voorstellen hoe een scène zich in de loop van de tijd zou kunnen ontwikkelen, waarbij het volgende frame van een video wordt voorspeld op basis van het vorige. Deze systemen leren de fysica van de wereld — hoe een beker valt, hoe een deur zwaait — door enorme hoeveelheden video te bekijken. Er is echter een kloof tussen het bekijken van de wereld en het handelen binnen die wereld. Een robot heeft meer nodig dan alleen een voorspelling van wat er zal gebeuren; hij moet weten welke specifieke bewegingen die voorspelling werkelijkheid zullen maken. Dit is de uitdaging van belichaamd leren (embodied learning): het overbruggen van de kloof tussen het begrijpen van een visuele toekomst en het genereren van de fysieke acties om die te bereiken.

Een team van onderzoekers heeft een nieuwe aanpak geïntroduceerd genaamd OpenWAM om dit probleem op te lossen. In plaats van één enkele, rigide robotbrein te bouwen dat moeilijk te veranderen of te begrijpen is, creëerden zij een open, modulair systeem dat het ontwerp van een robotcontroller behandelt als een set uitwisselbare onderdelen. Ze braken de complexe taak van het aanleren van handelingen aan een robot af in drie duidelijke vragen: welke kennis moet de robot erven door het kijken naar video's, hoe moeten het begrip van de robot van de wereld en zijn vermogen om te bewegen samenwerken, en hoe kan dit leren worden opgeschaald naar verschillende soorten robots en omgevingen? Door deze vragen te beantwoorden via gecontroleerde experimenten, destilleerden ze een reeks principes die leidden tot de creatie van OpenWAM-α, een krachtig nieuw model dat kan leren objecten te manipuleren in zowel gesimuleerde als echte omgevingen.

De onderzoekers begonnen met de vraag welk soort "wereldkennis" een robot als startpunt zou moeten hebben. Ze testten of de robot moest leren van een massale videogenerator die miljoenen uren aan beeldmateriaal heeft gezien, of dat het zou moeten vertrouwen op een simpelere visuele encoder. Ze ontdekten dat de beste resultaten voortkwamen uit het gebruik van een grote, vooraf getrainde videogenerator als fundament. Dit model begrijpt al hoe objecten bewegen en interageren, wat een rijke voorsprong biedt. Het simpelweg koppelen van een robotarm aan dit videomodel was echter niet genoeg. De onderzoekers ontdekten dat de robot ook een compacte, efficiënte manier nodig had om te representeren wat hij ziet. Ze testten verschillende methoden om visuele informatie te comprimeren tot een kleinere, meer beheersbare vorm, en ontdekten dat een specifiek type compressie dat de essentiële details van de wereld behield terwijl de ruis werd weggefilterd, het beste werkte. Dit stelde de robot in staat om zich te concentreren op de belangrijke delen van een scène zonder overweldigd te raken door data.

Vervolgens onderzocht het team hoe de "hersenen" van de robot gestructureerd moesten worden om het begrip van de wereld te verbinden met het vermogen om te bewegen. Ze vergeleken verschillende architecturale ontwerpen, variërend van modellen waarbij de video- en actieonderdelen volledig gescheiden waren tot modellen waarbij ze diep verweven waren. Hun experimenten toonden aan dat het meest effectieve ontwerp een duaal systeem was. In deze opstelling richtt één deel van het model zich op het voorspellen van de toekomstige visuele staat van de wereld, terwijl een toegewijd deel zich richt op het genereren van de sequentie van bewegingen. Cruciaal was dat deze twee delen constant met elkaar mochten communiceren. De actiegenerator kon naar de voorspelde toekomst kijken om te beslissen wat te doen, en de wereldvoorspeller kon de geplande acties gebruiken om zijn visie op wat er zou gebeuren te verfijnen. Deze constante, tweezijdige conversatie stelde het model in staat om een echte synergie tussen zien en handelen te leren, in plaats van ze slechts naast elkaar te leren.

De onderzoekers verkenden ook hoe ze deze modellen konden trainen met verschillende soorten data. Ze hadden toegang tot twee hoofdbronnen: video's van mensen die taken uitvoeren vanuit een eerste-persoonsperspectief, die een grote variëteit aan visuele scènes boden maar geen robotactiedata bevatten, en opnames van daadwerkelijke robots die taken uitvoeren, die precieze bewegingsinstructies boden maar minder soorten scènes besloegen. Ze testten of het beter was om alleen op robotdata te trainen, alleen op menselijke data, of op een combinatie van beide. Ze ontdekten dat het combineren van de twee bronnen in een enkele trainingssessie de krachtigste strategie was. De menselijke video's leerden het model over de brede diversiteit van de wereld, terwijl de robotdata die kennis verankerde in de fysieke realiteit. Deze combinatie stelde het model in staat om veel beter te generaliseren naar nieuwe, onbekende situaties dan wanneer het op slechts één type data zou zijn getraind.

Met behulp van deze principes bouwden het team OpenWAM-α, een model dat is getraind op meer dan 500 miljoen frames van video en robotdata. Ze testten dit model over acht verschillende simulatiebenchmarks en op echte robots met enkele armen, twee armen en zelfs behendige handen. De resultaten waren consistent en indrukwekkend. In simulaties presteerde het model op het hoogste niveau bij een breed scala aan taken, van het stapelen van blokken tot het manipuleren van complexe objecten. Wanneer het naar de echte wereld werd verplaatst, behield het deze hoge prestaties en voltooide het succesvol taken op fysieke robots die het nog nooit eerder had gezien. Het model toonde een bijzondere kracht in het aanpassen aan nieuwe omgevingen, wat suggereerde dat de combinatie van video-gebaseerde wereldkennis en actie-gebaseerde verankering een robuust fundament voor algemene intelligentie creëerde.

Een van de meest significante bevindingen was hoe deze aanpak vergeleken werd met andere populaire methoden. Sommige systemen leunen zwaar op taal en visueel begrip maar modelleren de toekomst niet expliciet, terwijl andere zich puur richten op de mechanica van beweging. De onderzoekers ontdekten dat hun video-gebaseerde aanpak uitblonk in het fitten van de trainingsdata en goed presteerde in vertrouwde omgevingen, terwijl andere methoden soms beter generaliseerden naar volledig nieuwe, chaotische omgevingen. Ze concludeerden echter dat geen van beide benaderingen op zichzelf perfect was. De sleutel tot toekomstige vooruitgang ligt in het combineren van de sterke punten van beide: het gebruik van de rijke visuele en fysieke priors van videogeneratie om actie te sturen, terwijl men ervoor zorgt dat het systeem wordt getraind op diverse, hoogwaardige data die het volledige spectrum van de echte wereld dekt.

Het OpenWAM-project presenteert meer dan alleen een nieuwe robotcontroller; het biedt een complete toolkit voor de wetenschappelijke gemeenschap. Door de infrastructuur, de trainingsdata en de evaluatieprotocollen vrij te geven, hebben de onderzoekers de ontwikkeling van wereld-actie-modellen veranderd in een transparante, reproduceerbare wetenschap. Dit stelt andere wetenschappers in staat om specifieke ideeën te testen, componenten te vervangen en precies te begrijpen waarom bepaalde ontwerpen beter werken dan andere. Het werk suggereert dat de weg naar meer capabele robots niet ligt in het bouwen van grotere, meer ondoorzichtige systemen, maar in het zorgvuldig begrijpen van hoe verschillende stukken kennis en leren met elkaar interageren. Door de geest van de robot te behandelen als een verzameling samenstelbare onderdelen, hebben de onderzoekers de deur geopend naar een nieuw tijdperk van systematische exploratie in kunstmatige intelligentie, waarin elke ontwerpkeuze getest, gemeten en verbeterd kan worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →