← Nieuwste papers
💻 computer science

A Sim-to-Real Integration Pipeline for Training and Deployment of Chunk-Based VLA Manipulation Policies

Dit artikel presenteert een open-source sim-to-real pipeline die de bottleneck van gegevensschaarsheid bij het trainen van chunk-gebaseerde Vision-Language-Action (VLA) manipulatiebeleid aanpakt door expert-simulatietrajecten op echte hardware te herafspelen om gepaarde datasets te genereren, wat efficiënte beleidstraining, evaluatie en directe meting van de sim-to-real kloof mogelijk maakt.

Oorspronkelijke auteurs: Mathilde Kappel, Clémence Grislain, Mohamed Chetouani, Olivier Sigaud, Louis Annabi, Fa\"ız Ben Amar, Stéphane Doncieux, Mahdi Khoramshahi

Gepubliceerd 2026-09-21
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mathilde Kappel, Clémence Grislain, Mohamed Chetouani, Olivier Sigaud, Louis Annabi, Fa\"ız Ben Amar, Stéphane Doncieux, Mahdi Khoramshahi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots zijn al lang meesters in herhaling en zijn in staat om duizenden keren dezelfde precieze beweging uit te voeren in een fabriek. Maar het aanleren van het begrip van de rommelige, onvoorspelbare wereld van een menselijk huis is moeilijk gebleken. Moderne robotica richt zich steeds vaker op een nieuwe aanpak waarbij machines leren door te kijken en te luisteren, waarbij ze combineren wat ze zien met wat hen wordt verteld te doen. Deze methode, bekend als vision-language-action (visie-taal-actie), stelt een robot in staat om een visuele scène en een gesproken instructie, zoals "beweeg de rode blok", te nemen en deze direct te vertalen naar een fysieke beweging. De uitdaging ligt in het verzamelen van genoeg voorbeelden om de robot te onderwijzen. Meestal vereist dit dat een mens de arm van de robot fysiek door elke taak leidt, een proces dat traag, duur en moeilijk schaalbaar is. Bovendien, wanneer onderzoekers proberen robots in een computersimulatie te trainen en ze vervolgens naar de echte wereld te verplaatsen, mislukt het resultaat vaak omdat de digitale wereld te perfect is. De kloof tussen de simulatie en de realiteit wordt zelden nauwkeurig gemeten, waardoor wetenschappers er niet zeker van zijn of een fout komt door een slechte robothersenen of simpelweg omdat de echte tafel te glad is.

Een team onderzoekers aan het Institute of Intelligent Systems and Robotics in Parijs heeft een nieuwe manier ontwikkeld om deze kloof te overbruggen. In plaats van te vertrouwen op menselijke leraren of ongeteste simulaties, creëerden zij een systeem dat een computergegenereerde expert gebruikt om een echte robot te onderwijzen. In hun opstelling plant een virtuele robotarm in een simulatie een perfect pad om een kubus te duwen. Dit digitale plan wordt vervolgens naar een echte Franka FR3 robotarm in een laboratorium gestuurd. De echte robot probeert het digitale plan exact te volgen, zonder menselijke begeleiding of realtime correcties. Terwijl de robot beweegt, legt het team vast wat de echte robot ziet en voelt, waardoor ze een dataset creëren waarbij het "juiste" antwoord uit de simulatie komt, maar de "ervaring" uit de echte wereld komt. Dit stelt hen in staat om nieuwe robotbeleid (policies) te trainen met behulp van echte wereldgegevens zonder de kosten van menselijke teleoperatie. Cruciaal is dat, omdat ze precies weten welk pad de robot had moeten volgen, ze het verschil tussen het plan en de realiteit met hoge precisie kunnen meten.

De onderzoekers testten deze methode door de echte robot 200 verschillende gesimuleerde trajecten te laten herhalen, waarbij telkens een kubus of naar links of naar rechts werd geduwd. Ze ontdekten dat de echte robot het digitale plan met opmerkelijke nauwkeurigheid volgde. Gemiddeld week het pad dat de echte arm nam minder dan één centimeter af van het beoogde pad. De grootste fouten traden alleen op wanneer de robot het object aanraakte, waar de real-world fysica van wrijving en gewicht, die niet perfect in de computer waren gemodelleerd, zorgden voor lichte afwijkingen. Ondanks deze kleine fouten voltooide de robot elke een van de 200 taken succesvol. Dit bewees dat de fysieke kloof tussen de simulatie en de echte wereld klein genoeg was om te worden beheerst, en dat het systeem automatisch hoogwaardige trainingsgegevens kon genereren.

Om te bewijzen dat het systeem end-to-end werkte, gebruikte het team de verzamelde gegevens vervolgens om vanaf nul een nieuw robotbeleid te trainen. Ze leerden een model genaamd ORCHID om dezelfde kubus-duwende taken uit te voeren met enkel de 200 echte wereldvoorbeelden die ze hadden verzameld. Wanneer ze deze nieuw getrainde robot testten in een closed loop—waarbij de robot de scène moest bekijken, moest beslissen wat hij moest doen en dienovereenkomstig moest bewegen—slaagde hij in 6 van de 20 pogingen. De onderzoekers merkten op dat dit lagere succespercentage waarschijnlijk te wijten was aan de kleine hoeveelheid trainingsdata en variaties in verlichting, in plaats van een fundamenteel gebrek aan de methode. Het experiment diende als een proof of concept, waarmee werd aangetoond dat een robot getraind kan worden op real-world data gegenereerd door een simulatie, en dat dezelfde softwarestack gebruikt kan worden om zowel de data te verzamelen als de uiteindelijke robot aan te sturen.

De studie benadrukt dat de grootste uitdagingen bij het verplaatsen van robots van de computer naar de echte wereld niet liggen in de hoogwaardige planning, maar in de specifieke fysieke interacties. De fouten waren niet willekeurig; ze kwamen consequent voor wanneer de robot contact maakte met het object, wat suggereert dat betere modellen van objectgewicht en tafelwrijving de prestaties meer zouden verbeteren dan het verfijnen van de beweging van de robot in de lege ruimte. Door een open-source protocol en een dataset van gekoppelde gesimuleerde en echte trajecten te verstrekken, hebben de onderzoekers de gemeenschap een hulpmiddel gegeven om deze fysieke mismatches te meten en te verminderen. Hun werk laat zien dat het mogelijk is om enorme hoeveelheden real-world trainingsdata te genereren zonder menselijke tussenkomst, mits het systeem is ontworpen om de kleine verschillen tussen het digitale plan en de fysieke realiteit te meten en te verantwoorden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →