← Nieuwste papers
💻 computer science

FetchMan: Learning Visual Humanoid Loco-Manipulation Policies from Simulated Experiences

Het artikel introduceert FetchMan, een end-to-end sim-to-real-pipeline die de prestatiebeperkingen van synthetische behavior cloning overwint door beleid te verfijnen met Flow-GRPO reinforcement learning, waardoor een Unitree G1 humanoïde in staat wordt gesteld om 73,3% zero-shot succes te behalen in loco-manipulatietaken over ongeziene scènes heen.

Oorspronkelijke auteurs: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Gepubliceerd 2026-09-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Omar Rayyan, Zhi Li, Max Argus, Yuxin Jiang, Chang Yu, Chenfanfu Jiang, Yuchen Cui

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

De droom van een robot die een kamer binnen kan lopen, een specifiek object kan spotten en het kan oppakken, is al lang een centraal doel in de robotica. Decennialang hebben onderzoekers geprobeerd machines dit soort complex gedrag aan te leren, omdat het twee moeilijke vaardigheden vereist die tegelijkertijd moeten samenwerken: het bewegen van het lichaam door de ruimte en het gebruiken van de handen om met de wereld te interageren. Hoewel robots behoorlijk goed zijn geworden in het zelfstandig lopen, creëert het toevoegen van het vermogen om te reiken en dingen vast te pakken terwijl men op twee benen balanceert, een chaotische mix van fysica die ongelooflijk moeilijk handmatig te programmeren is. Het verzamelen van de benodigde gegevens om een robot op deze manier te onderwijzen is ook een enorme hindernis; het zou jaren duren en het risico lopen de robot te breken als een mens elke mogelijke manier zou moeten demonstreren om naar een kom te lopen en deze op te pakken in elke mogelijke kamer. Om dit op te lossen, hebben wetenschappers zich tot computersimulaties gewend, waarbij digitale werelden worden gecreëerd waarin robots miljoens keren kunnen oefenen zonder angst voor schade. Een grote vraag bleef echter: kan een robot die volledig in een digitale wereld is getraind, daadwerkelijk leren omgaan met de rommelige, onvoorspelbare realiteit van een echt huis?

Een team onderzoekers aan de University of California, Los Angeles, samen met medewerkers van het Allen Institute for AI en de University of Washington, heeft deze uitdaging aangepakt met een nieuw systeem dat ze FetchMan noemen. Hun werk richt zich op een humanoïde robot, de Unitree G1, die er veel uitziet en beweegt als een mens. Het team wilde weten of ze deze robot konden leren om een kamer te navigeren en een doelobject te grijpen door hem simpelweg duizenden voorbeelden te tonen in een computersimulatie, en hem vervolgens de taak perfect te laten uitvoeren in de echte wereld zonder verdere training. Ze ontdekten dat het simpelweg tonen van steeds meer voorbeelden van de taak aan de robot niet genoeg was. Zelfs nadat de robot op meer dan 150.000 verschillende scènes was getraind, stootte de prestatie van de robot tegen een hard plafond aan. De robot kon de digitale leraar imiteren, maar kon de subtiele timing niet leren die nodig is om soepel over te gaan van lopen naar reiken. De robot probeerde het object vaak te vroeg te grijpen of stopte te vroeg met lopen, waardoor hij faalde omdat hij probeerde een leraar te kopiëren die gebruikmaakte van geheime informatie die de robot niet kon zien.

Om deze barrière te doorbreken, voegden de onderzoekers een tweede fase toe aan het trainingsproces. In plaats van alleen de digitale leraar te kopiëren, lieten ze de robot zelfstandig oefenen in de simulatie en beloonden ze hem alleen wanneer hij de volledige taak van het lopen naar het object en het oppakken ervan succesvol voltooide. Deze methode, die gebruikmaakt van een techniek genaamd reinforcement learning (versterkend leren), stelde de robot in staat om de juiste timing en beweging zelf uit te vogelen. De robot leerde dichter bij het object te lopen voordat hij uitreikte, waarmee hij de fouten corrigeerde die hij maakte toen hij alleen maar aan het imiteren was. Toen het team deze verfijnde robot in de echte wereld testte, waren de resultaten opmerkelijk. De robot, die tijdens zijn training nog nooit een echte kamer of een echt object had gezien, was in staat om onbekende ruimtes te betreden, een doel-kom te identificeren en deze met een succespercentage van meer dan 73 procent vast te pakken. Dit was een significante verbetering ten opzichte van de initiële trainingsmethode, die in realiteitstests slechts ongeveer 57 procent van de tijd slaagde.

De onderzoekers verkenden ook of deze aanpak zou werken voor veel verschillende soorten objecten, niet alleen kommen. Ze trainden een versie van het systeem om items zoals brood, flessen en boeken te herkennen en op te pakken door de robot de naam van het object als aanwijzing te geven. Hoewel deze versie met meerdere objecten niet zo succesvol was als de versie met één enkel object, slaagde het er toch in om de taak in een verscheidenheid aan situaties uit te voeren, wat bewees dat de methode kan worden opgeschaald. De studie benadrukt dat hoewel het kopiëren van een leraar een goed startpunt is, dit niet genoeg is om complexe fysieke taken te beheersen. De robot heeft de vrijheid nodig om te exploreren en te leren van zijn eigen successen en mislukkingen om echt te begrijpen hoe hij zich door de wereld moet bewegen. Door een enorme hoeveelheid gesimuleerde oefening te combineren met een laatste fase van zelfcorrectie, heeft het team een duidelijke weg gewezen naar het creëren van robots die zich kunnen aanpassen aan nieuwe omgevingen zonder dat er een mens nodig is om hen bij elke stap aan de hand te houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →