← Nieuwste papers
🤖 machine learning

Motus2: A Self-Evolving General World Model for Dexterous Manipulation

Motus2 is een zelfevoluerend algemeen wereldmodel voor behendige manipulatie dat beleid, simulatie en evaluatie verenigt in een gesloten beslissings- en leerlus, waarbij gebruik wordt gemaakt van geschaalde modelarchitecturen en progressief uitgebreide multimodale datasets om continue verbetering mogelijk te maken door zowel expertdemonstraties als zelf gegenereerde interactiedata.

Oorspronkelijke auteurs: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiab
Gepubliceerd 2026-09-01
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Hongzhe Bi, Zihao Zhou, Yihang Tang, Jingrui Pang, Shuhe Huang, Haitian Liu, Runqing Wang, Shuai Huang, Yichen Wang, Yiming Cheng, Ruowen Zhao, Zhenghua Li, Hengkai Tan, Xiaolong Liu, Jinhui Wan, Jiabao Liu, Min Zhao, Fan Bao, Jun Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Om een robot te bouwen die werkelijk de rommelige, onvoorspelbare wereld van menselijke taken kan aanpakken, zoeken wetenschappers al lang naar een systeem dat meer doet dan alleen een lijst met instructies volgen. Het doel is om een machine te creëren die zijn omgeving kan waarnemen, kan voorstellen wat er vervolgens zou kunnen gebeuren, een actie kan ondernemen, en vervolgens kan leren van het resultaat om het de volgende keer beter te doen. Dit concept, bekend als een "wereldmodel", fungeert als een interne simulator voor de robot. In plaats van alleen te reageren op wat hij op dit moment ziet, voert de robot mentale simulaties uit om de uitkomst van zijn bewegingen te raden voordat hij ze daadwerkelijk uitvoert. Hoewel eerdere versies van deze systemen de toekomst konden voorspellen of een zet konden suggereren, werkten ze vaak in een rechte lijn: zien, raden, handelen en stoppen. Ze misten een manier om terug te kijken naar hun eigen voorspellingen, te oordelen of die goed of slecht waren, en die beoordeling te gebruiken om hun besluitvormingsvaardigheden te verbeteren zonder dat daar elke keer een mens aan te pas hoefde te komen om hen de juiste weg te wijzen.

Een team van onderzoekers heeft nu een systeem geïntroduceerd genaamd Motus2, een zelf evoluerend robotbrein dat specifiek is ontworpen voor delicate, complexe taken zoals het gebruiken van gereedschap of het hanteren van objecten met mensachtige handen. Dit systeem vormt een belangrijke stap voorwaarts omdat het de cirkel tussen denken en leren sluit. In plaats van slechts een passieve waarnemer of een eenvoudige volger te zijn, fungeert Motus2 als zijn eigen leraar. Het stelt een reeks mogelijke bewegingen voor, simuleert hoe die bewegingen er in de toekomst uit zouden zien, en evalueert vervolgens of die geïmagineerde uitkomsten tot succes zouden leiden. Als de simulatie een mislukking laat zien, leert de robot van die fout. Als de simulatie succes laat zien, versterkt het die weg. Deze cyclus stelt de robot in staat om zijn eigen beleid, of zijn set regels voor handelen, te verbeteren door voortdurend zijn eigen ideeën te testen en te verfijnen, zelfs wanneer er geen mens is om hem bij elke stap te begeleiden.

De basis van dit systeem is gebouwd op een enorme hoeveelheid gegevens verzameld van menselijke handen. De onderzoekers begonnen de robot te leren hoe mensen met de wereld omgaan met behulp van video's opgenomen vanuit een eerste-persoonsperspectief, alsof de camera op iemands hoofd was bevestigd. Ze begonnen met eenvoudige, enkelvoudige lensvideo's die een grote verscheidenheid aan taken toonden, van koken tot organiseren, en gingen daarna over naar meer geavanceerde, gesynchroniseerde stereovideo's die een gevoel van diepte bieden, vergelijkbaar met het menselijke binoculaire zicht. Dit stelde de robot in staat om de subtiele fysica te leren van hoe handen objecten grijpen, tillen en manipuleren. Echter, alleen het kijken naar mensen is niet genoeg voor een robot met een ander lichaam. De onderzoekers begeleidden het systeem vervolgens door een middelste trainingsfase waarin het leerde die menselijke bewegingen te vertalen naar de specifieke mechanica van zijn eigen robotarmen en -handen. Dit proces omvatte het tonen van duizenden uren aan menselijke data aan de robot, gevolgd door specifieke voorbeelden van hoe mensen en robots samen kunnen werken, waardoor de kloof tussen menselijke intuïtie en robotische uitvoering effectief werd overbrugd.

Wat Motus2 uniek maakt, is hoe het deze kennis gebruikt. Het systeem is gebouwd rond een enkel, verenigd model dat tegelijkertijd drie verschillende petten draagt. Ten eerste fungeert het als een beleid (policy), dat suggereert welke actie als volgende genomen moet worden. Ten tweede fungeert het als een simulator, die voorspelt hoe de wereld eruit zal zien nadat die actie is uitgevoerd. Ten derde fungeert het als een evaluator, die oordeelt of die voorspelde toekomst goed of slecht is. In traditionele systemen zijn deze functies vaak gescheiden of losgekoppeld, maar hier zijn ze nauw met elkaar verweven. Wanneer de robot een beweging overweegt, voert hij onmiddellijk een mentale simulatie uit om de gevolgen te zien. Vervolgens vraat hij zichzelf af of dat gevolg wenselijk is. Als het antwoord nee is, verwerpt hij dat pad en probeert hij een ander. Als het antwoord ja is, voert hij de actie uit. Deze interne dialoog vindt zo snel plaats dat de robot enkele stappen vooruit kan plannen en de beste route kiest voordat hij ook maar één spier beweegt.

De onderzoekers testten dit systeem op een volledig robotisch platform uitgerust met twee armen, twee behendige handen en sensoren die aanraking kunnen voelen, vergelijkbaar met menselijke vingertoppen. Ze daagden de robot uit met een reeks moeilijke taken, zoals het plaatsen van een bal op een specifieke plek, het indraaien van een gloeilamp in een fitting, of het bevestigen van een gum aan een pen. In deze tests bleek het vermogen van de robot om te leren van zijn eigen simulaties cruciaal. Wanneer het systeem de mogelijkheid kreeg om zijn interne evaluator te gebruiken om de beste opties tijdens een taak te selecteren, verbeterde het succespercentage aanzienlijk. Nog indrukwekkender was dat wanneer het systeem zijn eigen voorspellingen mocht gebruiken om zijn eigen leerregels bij te werken, het nog beter werd in de taak. De robot had niet alleen geluk; hij leerde echt om fouten die hij had gesimuleerd te vermijden en acties te herhalen die hij gesimuleerd had als succesvol.

Een belangrijk onderdeel van dit succes was het vermogen van de robot om te onthouden wat er eerder in een taak is gebeurd, zelfs als die informatie tijdelijk uit het zicht was. In veel complexe banen kan een hand het zicht op een object blokkeren, of kan een cruciale stap lang voor het uiteindelijke resultaat plaatsvinden. Om dit aan te pakken, gaven de onderzoekers de robot een vorm van werkgeheugen dat belangrijke visuele details uit het verleden kon vasthouden. Ze testten verschillende manieren om dit geheugen te beheren, van het bijhouden van een kort, rollend venster van recente gebeurtenissen tot het onderhouden van een langere, gedetailleerdere geschiedenis. De resultaten toonden aan dat toegang tot een dergelijke langere geschiedenis de robot in staat stelde taken op te lossen die een geheugen vereisten voor een sequentie van gebeurtenissen over een langere periode, wat bewees dat het vermogen om het verleden te herinneren net zo belangrijk is als het voorspellen van de toekomst.

Het systeem incorporeerde ook een gespecialiseerde module voor tastzin. Hoewel visie krachtig is, kan het niet altijd vertellen of een greep slipt of dat een oppervlak te zacht is. De robot werd uitgerust met een lichtgewicht expertsysteem dat gewijd is aan het verwerken van tactiele feedback. Dit stelde de robot in staat om zijn bewegingen in realtime te verfijnen, waarbij hij zijn grip aanpaste op het moment dat hij een slip of een verandering in druk voelde. Deze combinatie van zien, voelen, denken en leren creëerde een robuust systeem dat in staat was om de onzekerheid van de echte wereld aan te kunnen.

De bevindingen suggereren dat de weg naar werkelijk capabele robots niet alleen ligt in het verzamelen van meer data, maar in het bouwen van systemen die die data kunnen gebruiken om zichzelf te bevragen en te verbeteren. Door grootschalige menselijke interactiedata te combineren met een zelfcorrigerende lus van voorspelling en evaluatie, demonstreerde Motus2 dat robots kunnen leren om de fysieke wereld te manipuleren met een niveau van aanpassingsvermogen dat voorheen onbereikbaar was. De onderzoekers ontdekten dat naarmate zij de hoeveelheid stereo-videodata die voor training werd gebruikt vergrootten, het vermogen van de robot om menselijke acties te voorspellen op een consistente, voorspelbare manier verbeterde. Deze schaling suggereert dat deze systemen met nog meer data nog bekwamer kunnen worden. Uiteindelijk toont het werk aan dat een robot niet geprogrammeerd hoeft te worden met elke mogelijke oplossing voor elk mogelijk probleem. In plaats daarvan, als het in staat is om de toekomst te simuleren, de uitkomst te beoordelen en te leren van het verschil, kan het zijn eigen vaardigheden ontwikkelen om de uitdagingen van een complexe, behendige wereld het hoofd te bieden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →