← Nieuwste papers
🤖 AI

DreamDojo: A Generalist Robot World Model from Large-Scale Human Videos

DreamDojo is een fundamenteel wereldmodel getraind op 44.000 uur aan egocentrische menselijke video's dat diverse behendige interacties leert door middel van continue latente acties, wat real-time simulatie, precieze actiecontroleerbaarheid en effectieve beleidsplanning mogelijk maakt voor generalistische robots in open-wereld, contactrijke omgevingen.

Oorspronkelijke auteurs: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie
Gepubliceerd 2026-02-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Shenyuan Gao, William Liang, Kaiyuan Zheng, Ayaan Malik, Seonghyeon Ye, Sihyun Yu, Wei-Cheng Tseng, Yuzhu Dong, Kaichun Mo, Chen-Hsuan Lin, Qianli Ma, Seungjun Nah, Loic Magne, Jiannan Xiang, Yuqi Xie, Ruijie Zheng, Dantong Niu, You Liang Tan, K. R. Zentner, George Kurian, Suneel Indupuru, Pooya Jannaty, Jinwei Gu, Jun Zhang, Jitendra Malik, Pieter Abbeel, Ming-Yu Liu, Yuke Zhu, Joel Jang, Linxi "Jim" Fan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot wilt leren alles te doen wat een mens kan: koken, schoonmaken, dingen repareren en met speelgoed spelen. Het probleem is dat robots duur zijn, gemakkelijk kapot gaan en we niet genoeg uren aan robotbeelden hebben om ze alle vaardigheden te leren.

DreamDojo is een nieuwe "hersenen" voor robots die dit oplost door te leren van menselijke video's in plaats van robotvideo's. Denk aan een robot die leert door miljoenen uren naar mensen te kijken die dagelijkse taken uitvoeren op YouTube en TikTok, in plaats van dat de robot elke taak zelf moet uitvoeren.

Zo werkt het, onderverdeeld in eenvoudige concepten:

1. De enorme bibliotheek (De Data)

Normaal gesproken is robot trainingsdata als een kleine bibliotheek met slechts een paar boeken over "hoe je een rode blokje oppakt". De bibliotheek van DreamDojo is een enorme, oneindige bibliotheek met 44.000 uur aan menselijke video's.

  • De Schaal: Het is alsof je een enkel schriftje vergelijkt met de gehele Library of Congress.
  • De Variëteit: Het dekt alles af, van koken in een keuken tot het repareren van een auto in een garage, waarbij duizenden verschillende objecten en vaardigheden betrokken zijn.
  • Het Geheime Sausje: Omdat deze video's niet zijn voorzien van "robotinstructies", heeft het team een speciale vertaler uitgevonden genaamd Latent Actions. Stel je voor dat je een video bekijkt van iemand die een pot opent. Hoewel de robot de exacte spierbewegingen niet kan zien, ontdeft deze vertaler de intentie en de fysica van "draaien en trekken" door simpelweg te kijken naar hoe de pot en de hand bewegen. Het verandelt de video in een universele instructiehandleiding die elke robot kan begrijpen.

2. De Simulator (Het Wereldmodel)

Zodra de robotbrein heeft geleerd van deze video's, wordt het een Wereldmodel.

  • De Analogie: Denk aan een Wereldmodel als een vluchtsimulator voor een piloot. Voordat een piloot een echt vliegtuig bestuurt, oefent hij in een simulator. Als hij een fout maakt in de simulator, raakt er niemand gewond.
  • Hoe DreamDojo werkt: Je kunt tegen DreamDojo zeggen: "Stel je voor dat de robot naar de beker reikt, maar deze mist." Het model genereert dan een video van wat er daarna zou gebeuren. Het begrijpt fysica: als je een beker duwt, glijdt deze; als je er te hard tegen duwt, valt hij van de tafel. Het kan deze uitkomsten direct simuleren, zelfs voor objecten of omgevingen die het nog nooit eerder heeft gezien.

3. De Snelheidsboost (Distillatie)

De originele "hersenen" zijn erg slim maar traag, zoals een geniale professor die 10 minuten nodig heeft om een wiskundeprobleem op te lossen. Voor een robot om in real-time te bewegen, moet hij zo snel denken als een mens.

  • De Oplossing: Het team heeft een proces gebruikt dat Distillatie wordt genoemd. Ze hebben de trage, geniale professor genomen en een snelle, jonge student (het "Student Model") getraind om hem na te bootsen.
  • Het Resultaat: De student kan de toekomst nu voorspellen met 10,81 frames per seconde. Dit is snel genoeg om in real-time te draaien. Je kunt een virtuele robot besturen met een VR-controller, en de robot zal direct bewegen en reageren, net als een echt persoon.

Wat kan het doen? (Op basis van de claims in het paper)

Het paper benadrukt drie belangrijke manieren waarop deze technologie wordt gebruikt:

  1. Beleid Testen (De "Vluchtsimulator" voor Robots):
    Voordat je een robot de echte wereld in stuurt om fruit te verpakken, kun je het "brein" testen in DreamDojo. Het paper laat zien dat als een robotstrategie goed werkt in de DreamDojo-simulatie, deze bijna zeker ook goed werkt in de echte wereld (99,5% correlatie). Dit bespaart tijd en voorkomt dat robots dingen kapot maken tijdens het leren.

  2. Vooruitplannen (De "Schaker"):
    Wanneer een robot een complexe taak moet uitvoeren, kan hij DreamDojo gebruiken om over verschillende uitkomsten te "dromen". Hij kan in zijn geest vijf verschillende manieren proberen om een appel te pakken, zien welke de beste resultaten oplevert, en vervolgens die specifieke beweging uitvoeren. Dit maakt de robot veel slimmer en succesvoller bij moeilijke taken.

  3. Live Teleoperatie (De "Virtuele Tweeling"):
    Omdat het model zo snel is, kan een mens een VR-headset dragen en een virtuele robot in real-time besturen. Als de mens zijn hand beweegt, beweegt de virtuele robot onmiddellijk mee. Dit stelt mensen in staat om de robot op afstand te "zijn", wat nuttig is voor taken die te gevaarlijk of te moeilijk zijn voor mensen om direct uit te voeren.

Samenvatting

DreamDojo is een brug tussen de rommelige, diverse echte wereld en de precieze wereld van robots. Door te leren van de enorme hoeveelheid menselijke activiteiten online en door een speciale "vertaler" te gebruiken om acties te begrijpen zonder dat er labels nodig zijn, creëert het een robotbrein dat de toekomst kan voorstellen, ideeën veilig kan testen en in real-time kan handelen. Het verandert de robot van een rigide machine die alleen weet wat hem expliciet is geleerd, in een flexibele agent die begrijpt hoe de wereld werkt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →