← Nieuwste papers
💻 computer science

Scene2Demo: Self-Evolving Embodied Data Generation via Object-Action Graph

Scene2Demo is een zelf-evoluerend framework dat object-actie grafen en feedbackgestuurde verfijning gebruikt om automatisch hoogwaardige, uitvoerbare embodied data te genereren vanuit enkele afbeeldingen, wat het succes van taakplanning aanzienlijk verbetert en effectief leren van downstream robotbeleid mogelijk maakt.

Oorspronkelijke auteurs: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

Gepubliceerd 2026-08-27
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiang Liu, Sen Cui, Guocai Yao, Zhong Cao, Jingheng Ma, Min Zhang, Changshui Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots die door onze huizen kunnen bewegen en helpen bij dagelijkse klussen zijn al lang een droom van sciencefiction, maar het bouwen ervan is een hardnekkig moeilijke realiteit gebleken. Het kernprobleem is niet alleen het leren van een machine hoe hij een arm moet bewegen, maar het leren hoe een machine een rommelige, onvoorspelbare wereld begrijpt en beslist wat de volgende stap is. Om deze vaardigheden te leren, hebben robots traditioneel enorme hoeveelheden data nodig: duizenden uren aan video waarin een mens een taak uitvoert, of miljoenen pogingen tot vallen en opstaan in een computersimulatie. Het handmatig verzamelen van deze data is traag, duur en vaak onmogelijk voor zeldzame of gevaarlijke scenario's. Onderzoekers hebben zich tot kunstmatige intelligentie gewend om deze data automatisch te genereren, maar vroege pogingen produceerden vaak simulaties die er weliswaar echt uitzagen, maar de natuurwetten overtraden, of instructies die een robot feitelijk niet kon opvolgen. De uitdaging is geweest om een systeem te creëren dat een enkele foto van een kamer en een simpel verzoek kan nemen, en vervolgens een werkende, op fysica gebaseerde simulatie kan bouwen waar een robot de taak succesvol kan oefenen, falend en zichzelf corrigerend totdat hij het goed krijgt.

Een team van onderzoekers heeft een nieuw systeem geïntroduceerd genaamd SCENE2DEMO, dat dit probleem aanpakt door te fungeren als een zelfverbeterende datafabriek. Het proces begint met een enkele foto van een echte kamer, zoals een keuken, en een eenvoudige tekstopdracht van een gebruiker, zoals "pak het glas op". Het systeem gebruikt eerst geavanceerde computer vision om die foto te reconstrueren tot een volledig interactieve 3D-simulatie. Het identificeert de objecten, hun vormen en hun locaties, en creëert zo een digitale tweeling van de scène die de natuurkundige wetten zoals zwaartekracht en botsing respecteert. Zodater deze virtuele kamer is gebouwd, raadt het systeem niet alleen hoe een robot moet bewegen; het breekt het verzoek van de gebruiker af in een logische sequentie van kleine, beheersbare stappen. Het behandelt de taak als een kaart, waarbij elke stop op de reis een specifieke actie is, zoals het openen van een deur of het optillen van een object, en zorgt ervoor dat het einde van de ene stap perfect de aanvang van de volgende stap vormt.

Het systeem probeert vervolgens dit plan uit te voeren in de simulatie. Als de robot slaagt, legt het systeem de volledige sequentie van bewegingen en camerabeelden vast als een perfect voorbeeld voor toekomstig leren. De ware kracht van SCENE2DEMO ligt echter in wat er gebeurt wanneer de robot faalt. In veel eerdere systemen werd een fout simpelweg weggegooid. Hier zet het systeem een zelfevolutiemechanisme in. Wanneer een stap misgaat — bijvoorbeeld als de robot tegen een deur botst of een object laat vallen — treden er twee gespecialiseerde digitale agenten op om onderzoek te doen. Eén agent fungeert als een veiligheidsinspecteur en bekijkt de video van de fout vanuit meerdere camerahoeken om precies te pinpointen wat er misging. De andere agent fungeert als een supervisor en gebruikt dat visuele bewijs om het plan te herschrijven. Het kan suggereren om de basis van de robot iets naar links te verplaatsen, of de arm iets verder uit te strekken, voordat de taak opnieuw wordt geprobeerd. Deze lus van proberen, falen, analyseren en corrigeren gaat automatisch door totdat de robot de taak succesvol voltooit.

De onderzoekers testten deze aanpak op meer dan honderd verschillende scenario's, variërend van eenvoudige taken zoals het oppakken van een kopje tot complexe, meerstaps klussen zoals het plaatsen van een glas in een koelkast. Zonder de zelfcorrectiefunctie slaagde het systeem in ongeveer 72 procent van de eenvoudige taken. Wanneer ze de zelfevolutielus toevoegden voor complexere, langdurige taken, verbeterde het succespercentage aanzienlijk en werd de kwaliteit van de individuele stappen veel betrouwbaarder. Het systeem was in staat om hoogwaardige trainingsdata te genereren die vervolgens werden gebruikt om een echte robotpolicy te onderwijzen. Wanneer een robot leerde van deze automatisch gegenereerde voorbeelden, behaalde hij een succespercentage van 96 procent bij het openen van een koelkast en een succespercentage van 92 procent bij het oppakken van een glas, wat bewees dat de door de machine gecreëerde data robuust genoeg was om een robot te leren de taak in de echte wereld uit te voeren.

Dit werk suggereert dat we niet handmatig elke mogelijke manier hoeven op te nemen waarop een robot met de wereld kan interageren. In plaats daarvan kunnen we, door een realistische simulatie te combineren met een feedbacklus die het systeem toestaat te leren van zijn eigen fouten, enorme bibliotheken van betrouwbare trainingsdata genereren. Het systeem vertrouwt niet op magie of perfect visie; het vertrouwt op een gestructureerd proces van problemen afbreken, testen en de oplossing verfijnen op basis van visueel bewijs. Hoewel het huidige systeem beperkt is tot specifieke soorten bewegingen en objecten, en nog steeds worstelt met de meest complexe fysieke beperkingen, toont het een duidelijke weg vooruit. Door de creatie van trainingsdata te automatiseren, zou deze aanpak robots uiteindelijk in staat kunnen stellen om nieuwe vaardigheden snel en veilig te leren, simpelweg door naar een foto van een kamer te kijken en te horen wat ze moeten doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →