← Nieuwste papers
💻 computer science

IM-ENGINE: Image Editing for Embodied Data Generation

IM-ENGINE is een op simulatie gebaseerde pipeline die beeldbewerking als een intermediaire representatie benut om schaalbare, semantisch betekenisvolle en fysiek uitvoerbare supervisie te genereren voor belichaamd robotleren, specifiek gericht op het mogelijk maken van behendige greepsynthese en doeltoestandgeneratie.

Oorspronkelijke auteurs: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

Gepubliceerd 2026-09-09
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yian Wang, Junyi Cao, Xiaowen Qiu, Chuang Gan

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots worstelen al lang met de eenvoudige handeling van het oppakken van een kopje of het ophangen van een jas. Hoewel machines met ongelooflijke snelheid en precisie kunnen bewegen, missen ze vaak het intuïtieve begrip van hoe men een object moet vasthouden om het bruikbaar te maken. Een robot kan er misschien in slagen een spuitfles op te tillen, maar als hij de behuizing vastpakt in plaats van de trekker, kan hij niet spuiten. Deze kloof tussen fysieke bekwaamheid en functionele intentie is een grote hindernis bij het aanleren van taken aan robots. Traditioneel hebben onderzoekers geprobeerd dit op te lossen door ofwel mensen te filmen terwijl zij taken uitvoeren, of door computers miljoenen willekeurige bewegingen te laten simuleren totdat er één werkt. De eerste aanpak is traag en duur, terwijl de tweede vaak resultaten oplevert die fysiek mogelijk zijn maar praktisch nutteloos, zoals een hand die een mok bij de rand vasthoudt in plaats van bij het oor.

Een team onderzoekers aan de University of Massachusetts Amherst en Genesis AI heeft een nieuwe manier ontwikkeld om deze kloof te overbruggen, genaald IM-ENGINE. Hun aanpak behandelt het leerproces van de robot als een gesprek tussen een creatieve kunstenaar en een strikte ingenieur. Ze beginnen met een computersimulatie van een kamer met objecten, en gebruiken vervolgens een beeldbewerkingsprogramma om een menselijke hand te tekenen die een object vastpakt of op een specifieke plek plaatst. Dit bewerkte beeld dient als een visuele instructie, die het systeem precies vertelt hoe de gewenste uitkomst eruit moet zien. Het systeem neemt dit 2D-beeld en werkt achteruit, waarbij het de bekende regels van de simulatie gebruikt om de exacte 3D-positie en oriëntatie van de hand en het object te bepalen. Ten slotte controleert een physics engine of de voorgestelde actie daadwerkelijk mogelijk is, waarbij ideeën worden afgewezen die zouden ervoor zorgen dat het object zweeft, valt of door een tafel heen breekt. Het resultaat is een bibliotheek van robotbewegingen die niet alleen fysiek geldig zijn, maar ook semantisch correct: het leert de robot een boormachine bij het handvat vast te pakken of een mok aan een boomtak te hangen, precies zoals een mens dat zou doen.

De kern van deze methode rust op een vierstaps-proces dat een eenvoudige tekening transformeert naar een instructie die klaar is voor de robot. Eerst rendert het systeem een scène vanuit een simulatie, compleet met nauwkeurige metingen van diepte en geometrie. Een beeldbewerkingsmodel wijzigt deze afbeelding vervolgens door een menselijke hand in een functionele houding in te voegen of een object in een gewenste eindtoestand te verplaatsen, zoals het in een vaatrek schuiven van een bord. Deze stap levert de "intentie" aan, die de menselijke wens vastlegt om op een specifieke manier met de wereld te interageren. Vervolgens gebruikt het systeem de oorspronkelijke simulatiedata als gids om de scène in drie dimensies te reconstrueren. Omdat de computer precies weet waar de camera stond en hoe diep de objecten in de oorspronkelijke afbeelding zaten, kan het nauwkeurig berekenen waar de hand of het object zich in de echte wereld zou bevinden, zelfs nadat de afbeelding is gewijzigd.

Zodra het systeem een 3D-model van de gewenste actie heeft, onderwerpt het deze aan een strenge fysieke test. De computer simuleert de beweging en controleert op botsingen en stabiliteit. Als de voorgestelde greep zou slippen, of als het object zou omvallen wanneer het geplaatst wordt, verwerpt het systeem die poging en probeert het opnieuw. Dit zorgt ervoor dat elke gegenereerde beweging niet slechts een mooi plaatje is, maar een fysiek uitvoerbare actie. Voor taken die complexe bewegingen vereisen, zoals het rijgen van een mok aan een smalle tak, plant het systeem een pad dat obstakels vermijdt, zodat de robot het doel kan bereiken zonder iets omver te stoten. De uiteindelijke output is een reeks trajecten die een echte robot kan volgen, compleet met de noodzakelijke vingerposities en armbewegingen om de taak te voltooien.

De onderzoekers testten dit systeem op een verscheidenheid aan uitdagende taken, waaronder het grijpen van gereedschap, spuitflessen en wijnglazen, evenals het plaatsen van objecten in containers zoals vaatrekken en mokkenrekken. In tests met een ShadowHand-robot behaalde het systeem een succespercentage van 99,4% bij het optillen van objecten en een succespercentage van 83,2% bij het uitvoeren van de juiste functionele greep. Dit is een aanzienlijke verbetering ten opzichte van eerdere methoden, die vaak wel slaagden in het optillen van een object, maar faalden in het op de juiste manier vastpakken ervan. Zo slaagden andere systemen er bijvoorbeeld in om een spuitfles 97% van de tijd op te tillen, maar pakten ze de trekker slechts 7% van de tijd correct vast. De nieuwe methode pakte de trekker daarentegen 69% van de tijd correct vast, wat aantoont dat de visuele begeleiding de robot effectief de specifieke nuances van functionele interactie heeft geleerd.

Het systeem bleek ook effectief voor het genereren van eindtoestanden (goal-state generation), waarbij de robot een object in een specifieke configuratie moet plaatsen, zoals het ophangen van een schaar aan een rek of het invoeren van een buis in een houder. Bij deze relatie-gevoelige taken, waarbij de definitieve positie afhangt van de precieze uitlijning van twee objecten, slaagde de nieuwe methode in 35 van de 40 pogingen. Dit presteerde veel beter dan andere benaderingen die vertrouwden op het raden van de positie of het gebruik van eenvoudige visuele aanwijzingen, die vaak faalden omdat ze geen rekening hielden met de nauwe beperkingen van de taak. De onderzoekers ontdekten dat door te beginnen met een duidelijk visueel doel en dit te verfijnen door middel van fysica, het systeem problemen kon oplossen die voorheen te moeilijk waren voor automatische datageneratie.

Om te verifiëren of deze gesimuleerde lessen konden worden vertaald naar de echte wereld, trainde het team een robot met de door IM-ENGINE gegenereerde data en testte deze vervolgens met fysieke objecten. De robot voerde taken zoals het oppakken van mokken en het ophangen van kledinghangers succesvol uit, met succespercentages van respectievelijk 80% en 70%. Dit bewees dat de door de computer gecreëerde data uit de virtuele wereld robuust genoeg waren om een fysieke robot te leren hoe hij met echte objecten moet omgaan. De onderzoekers merkten op dat hoewel het systeem zeer effectief is, het niet perfect is; het kan af en toe een afbeelding genereren die een onmogelijke interactie weergeeft, of de fysica-simulatie kan een subtiele botsing missen. Desalniettemin biedt het algemene raamwerk een krachtige nieuwe manier om de hoogwaardige, taakspecifieke data te genereren die robots nodig hebben om complexe manipulatietaken te leren.

De implicaties van dit werk reiken verder dan alleen betere robotarmen. Door aan te tonen dat beeldbewerking kan dienen als een brug tussen menselijke intentie en machinale uitvoering, hebben de onderzoekers een nieuw pad voor robotleren geopend. In plaats van te vertrouwen op dure menselijke demonstraties of eindeloze willekeurige pogingen, kunnen robots nu leren van visuele voorbeelden die geworteld zijn in de fysieke realiteit. Deze aanpak maakt de snelle generatie van diverse trainingsdata mogelijk, die een breed scala aan objecten en taken beslaat zonder de noodzaak van constante menselijke interventie. Naarmate robots meer geïntegreerd raken in ons dagelijs leven, zal het vermogen om hen niet alleen te leren hoe ze moeten bewegen, maar ook hoe ze betekenisvol met de wereld omgaan, essentieel zijn. Het IM-ENGINE-systeem biedt een veelbelovende stap naar die toekomst, door eenvoudige visuele instructies om te zetten in betrouwbare, fysieke acties.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →