← Nieuwste papers
💻 computer science

DREAM: Deployment-Time Demonstration Generation via Real-to-Sim for Scalable Policy Adaptation

DREAM is een framework dat de schaalbare adaptatie van vision-language-action modellen naar nieuwe werkruimtes mogelijk maakt door automatisch fine-tuning data te genereren via real-to-sim reconstructie, LLM-gestuurde taakplanning en trajectrendering, waardoor de noodzaak voor kostbare menselijke teleoperatie-demonstraties wordt geëlimineerd.

Oorspronkelijke auteurs: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

Gepubliceerd 2026-09-01
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Makoto Sato, Tatsuya Matsushima, Yutaka Matsuo, Yusuke Iwasawa

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters in herhaling; ze voeren duizenden keren dezelfde precieze beweging uit in een fabriek, maar ze worstelen wanneer ze gevraagd wordt om zich aan te passen aan een nieuwe kamer of een licht andere opstelling van objecten. Om een robot een nieuwe taak te leren, vertrouwen ingenieurs traditioneel op een methode genaamd teleoperatie, waarbij een mens de machine fysiek door de stappen begeleidt en elke beweging opneemt om een trainingsdataset te creëren. Hoewel effectief, is dit proces traag, duur en vereist het de aanwezigheid van een persoon voor elke nieuwe omgeving. Het vakgebied van de robotica richt zich nu op een andere aanpak: het gebruik van kunstmatige intelligentie-modellen die taal en visie tegelijkertijd kunnen begrijpen. Deze modellen, getraind op enorme hoeveelheden data, kunnen al raden hoe ze een robotarm moeten bewegen op basis van een eenvoudige zin als "leg de blauwe blok in de kom". Echter, zelfs deze geavanceerde systemen falen vaak wanneer ze in een realistische omgeving worden geplaatst die ze nog nooit eerder hebben gezien, omdat de specifieke indeling van de kamer, de verlichting en de exacte positie van de objecten een unieke uitdaging vormen die generieke training niet kan oplossen.

Onderzoekers aan de Universiteit van Tokio hebben een systeem ontwikkeld genaamd DREAM om dit probleem op te lossen zonder dat een mens de robot hoeft te begeleiden. In plaats van een persoon te vragen om de taak te demonstreren, neemt het systeem een korte video op van de lege werkruimte en een eenvoudige tekstinstructie. Vervolgens bouwt het een nauwkeurige digitale kopie van die kamer, compleet met de exacte camerahoeken die de robot zal gebruiken om te kijken. Met behulp van een geavanceerde planningsmotor berekent de computer een logische volgorde van bewegingen om het doel te bereiken, zoals het oppakken van een object en het ergens anders neerleggen. Het genereert vervolgens duizenden variaties van deze taak, waarbij verschillende startposities voor de objecten worden gesimuleerd en de succesvolle bewegingen van de robot in deze virtuele wereld worden opgenomen. Deze gesimuleerde bewegingen worden vervolgens omgezet in realistische afbeeldingen en actiedata, die worden gebruikt om de hersenen van de robot te verfijnen voordat hij de echte wereld überhaupt aanraakt.

De kern van deze methode ligt in het creëren van een "digitale tweeling" van de fysieke ruimte. De onderzoekers beginnen met het opnemen van een korte video van de tafel of werkruimte met een standaard handcamera. Het systeem analyseert deze beelden om de scène in drie dimensies te reconstrueren, waarbij de textuur en positie van elk oppervlak en object wordt vastgelegd. Cruciaal is dat het deze digitale reconstructie afstemt op het eigen coördinatensysteem van de robot, zodat de virtuele camera precies ziet wat de camera's van de echte robot zullen zien. Dit stelt het systeem in staat om trainingsdata te genereren die eruitziet en aanvoelt als de echte omgeving, waardoor de kloof tussen de computersimulatie en de fysieke wereld wordt overbrugd. Zodra de omgeving is gebouwd, gebruikt het systeem een groot taalmodel om de menselijke instructie te vertalen naar een reeks logische doelen. Als de instructie bijvoorbeeld is om fruit in te pakken, begrijpt het systeem dat het eerst naar de banaan moet reiken, dan naar de perzik, en de vruchten vervolgens op het bord moet leggen.

Zodra de doelen zijn gedefinieerd, gebruikt het systeem een taak- en bewegingsplanner om de fysieke stappen te bepalen die nodig zijn om te slagen. Deze planner werkt als een zeer logische ingenieur, die de taak opdeelt in een reeks acties en de exacte gewrichtsbewegingen berekent die de robot moet maken om botsingen te vermijden en zijn doelen te bereiken. Het genereert een kleine set initiële succesvolle paden, bekend als bron-demonstraties. Om genoeg data te creëren om een robuuste robot te trainen, breidt het systeem deze enkele voorbeelden uit naar een enorme dataset. Het neemt de succesvolle bewegingen en past deze toe op honderden nieuwe, gerandomiseerde scenario's waarbij de objecten op verschillende plaatsen staan. Het controleert elk nieuw poging om te waarborgen dat het fysiek mogelijk en veilig is, en verwijdert de pogingen die falen. Ten slotte rendert het deze succesvolle pogingen in fotorealistische videoframes, waardoor een volledige dataset van beeld-en-actie paren ontstaat waar de robot van kan leren.

De onderzoekers testten deze aanpak op een echte robotarm die twee verschillende taken uitvoerde: een blauw blokje in een rode kom leggen, en een banaan en een perzik in een specifieता volgorde op een bord verpakken. Ze vergeleken robots die getraind waren op data gegenereerd door DREAM met robots die getraind waren op data verzameld door menselijke operators die de machine aanstuurden. De resultaten toonden aan dat de digitale tweeling een betrouwbare voorspeller was van de prestaties in de echte wereld; als een robot goed presteerde in de simulatie, presteerde hij ook goed in de echte wereld. Belangrijker nog, het systeem bewees zeer schaalbaar te zijn. Terwijl een menselijke operator ongeveer honderd demonstraties kan produceren in een redelijke tijd, genereerde het DREAM-systeem duizend hoogwaardige trainingsvoorbeelden. Wanneer getraind op dit grotere volume aan automatisch gegenereerde data, behaalden de robots hogere succespercentages dan de robots die getraind waren op de kleinere set menselijke demonstraties.

De studie benadrukt een significante verschuiving in hoe robots leren. Hoewel menselijke teleoperatie een geldzame manier blijft om data te verzamelen, wordt het beperkt door de tijd en aandacht van de operator. Het DREAM-systeem vereist daarentegen slechts één video-opname en een tekstinstructie om een enorme bibliotheek aan trainingsvoorbeelden te produceren. De initiële opstelling duurt enkele minuten, maar zodra het systeem draait, kan het duizenden trainingsscenario's genereren in de tijd die een mens nodig heeft om slechts een handvol op te nemen. De onderzoekers ontdekten dat voor eenvoudige taken de automatisch gegenereerde data ervoor zorgde dat de robot vaker slaagde dan de door mensen verzamelde data, simpelweg omdat het volume aan oefening veel groter was. Voor complexere, meerstaps-taken presteerde het systeem nog steeds beter dan menselijke datacolectie, hoewel de complexiteit van de taak meer computationele tijd vereiste om de initiële bewegingen te plannen.

Dit werk suggereert een toekomst waarin robots met minimale menselijke interventie in nieuwe omgevingen kunnen worden ingezet. In plaats van te wachten tot een specialist uren besteedt aan het leren van een robot hoe hij door een specifieke keuken of werkplaats moet navigeren, zou een gebruiker simpelweg de kamer aan de robot kunnen laten zien en vertellen wat hij moet doen. Het systeem zou vervolgens het zware werk op zich nemen om de trainingsdata te creëren, waardoor de robot wordt voorbereid op de specifieke uitdagingen van die ruimte. De onderzoekers erkennen dat hun huidige systeem het beste werkt met rigide objecten op statische tafels, en dat toekomstig werk meer complexe scenario's moet aanpakken waarbij zachte of bewegende objecten betrokken zijn. Echter, het vermogen om een eenvoudige video en een zin om te zetten in een volledig getraind robotbeleid vertegenwoordigt een grote stap naar het werkelijk aanpasbaar en toegankelijk maken van robotische assistenten voor dagelijks gebruik.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →