← Nieuwste papers
🤖 AI

HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface

HIL-UMI introduceert een robotvrij, human-in-the-loop framework voor post-training Vision-Language-Action modellen dat een handgehouden Universal Manipulation Interface en een beleidsgestuurde energiescore gebruikt om efficiënt gerichte data te verzamelen en advantage-schatters te verfijnen, waardoor de beperkingen van statische supervised fine-tuning worden overwonnen en schaalbare, iteratieve verbetering mogelijk wordt gemaakt zonder fysieke robotimplementatie.

Oorspronkelijke auteurs: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Gepubliceerd 2026-09-18
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zimu Han, Yiming Zeng, Jiyao Zhang, Zihao Zhao, Yuanfei Wang, Yixiang Jin, Shiqi Li, Shuangben Chen, Wei Huang, Ruodai Li, Hui Shen, Hao Dong

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Robots worden steeds beter in staat om de wereld te begrijpen door middel van zicht en taal, waarbij ze leren van enorme hoeveelheden data om complexe taken uit te voeren. Er blijft echter een aanzienlijke kloof bestaan tussen wat deze kunstmatige intelligentiesystemen in algemene zin leren en wat ze daadwerkelijk kunnen doen in een specifieke keuken, werkplaats of fabriek. Wanneer een robot in een echte omgeving wordt ingezet, komt hij vaak situaties tegen die hij nog nooit eerder heeft gezien, wat leidt tot fouten die kunnen opstapelen totdat de taak mislukt. Om dit op te lossen, vertrouwen onderzoekers traditioneel op "supervised fine-tuning", een proces waarbij mensen de juiste handelingen op de robot zelf demonstreren, en de machine leert deze na te bootsen. Hoewel dit helpt, is het traag, duur en mist het vaak de specifieke momenten waarop de robot het meest waarschijnlijk zal falen, omdat de robot alleen leert van de voorbeelden die hem zijn gegeven, en niet van de fouten die hij maakt terwijl hij probeert het probleem zelfstandig op te lossen.

Een team van onderzoekers heeft een nieuwe aanpak ontwikkeld genaamd HIL-UMI die de manier waarop robots van mensen leren verandert, door de noodzaak voor de robot tijdens de trainingsfase weg te nemen. In plaats van te kijken hoe een robot worstelt en hem vervolgens te corrigeren, gebruikt deze methode een draagbaar, handbediend apparaat dat eruitziet als een robotische grijper maar wordt vastgehouden door een menselijke operator. De operator voert de taak uit met dit apparaat, terwijl een computerprogramma, dat draait op het huidige "brein" van de robot, dezelfde videofeed bekijkt en probeert te raden wat de mens als volgende zal doen. Het systeem beweegt de robot niet; het vergelijkt simpelweg de werkelijke bewegingen van de mens met zijn eigen voorspellingen. Wanneer de mens iets doet wat de computer niet verwachtte, markeert het systeem dat moment als een leermoment en legt het dit vast. Hierdoor kan de robot leren van zijn eigen blinde vlekken zonder dat hij de taak fysiek hoeft te proberen en het risico op falen loopt.

De kern van deze methode omvat een continue lus van observatie en verfijning. Terwijl de mens een taak demonstreert, controleert de computer voortdurend of zijn eigen voorspellingen overeenkomen met de acties van de mens. Als de gok van de computer sterk afwijkt van wat de mens doet, weet het systeem dat het zich in een "blinde vlek" bevindt—een situatie die de robot niet goed begrijpt. Op dat punt wordt de mens gevraagd om de demonstratie voort te zetten, en het systeem slaat dit specifieiek segment van de data op. De onderzoekers hebben ook een tweede laag intelligentie toegevoegd: een manier om te beoordelen hoe goed de taak vordert. Als het systeem denkt dat de taak slecht verloopt, zelfs als de mens zich correct beweegt, legt het dat moment vast om de computer te helpen leren hoe hij succes beter kan beoordelen. Door deze twee soorten data te combineren, leert de robot niet alleen wat hij moet doen, maar ook welke acties het meest nuttig zijn voor het voltooien van de klus.

Om dit idee te testen, pasten de onderzoekers het toe op vier verschillende real-world taken met behulp van een standaard robotarm. De taken varieerden van het vouwen van een handdoek en het opruimen van een tafel tot het stapelen van kubussen en het met hoge precisie stempelen van een stuk papier. In alle gevallen begon de robot met een basisset instructies en ging hij vervolgens door verschillende rondes van training met behulp van de nieuwe handheld-methode. De resultaten toonden een duidelijke verbetering ten opzichte van traditionele methoden. Waar standaard trainingsmethoden vaak een plafond bereiken waarbij het toevoegen van meer data niet meer helpt, stelde de nieuwe methode de robot in staat om met elke trainingsronde consistent beter te worden. De robot leerde langere, complexe reeksen acties en delicate, precieze bewegingen effectiever aan te kunnen dan voorheen.

Een van de meest opmerkelijke bevindingen was de snelheid waarmee deze nieuwe methode nuttige informatie verzamelde. Traditionele methoden die vereisen dat een robot fysiek beweegt en door een mens wordt gecorrigeerd, zijn traag en moeilijk op te schalen. In contrast hiermee bleek de handheld-benadering meer dan vijf keer sneller bij het verzamelen van de benodigde data. Dit komt doordat de menselijke operator het apparaat vrij kan bewegen zonder te hoeven wachten tot een robot reset of totdat een mens fysiek moet ingrijpen bij een zware machine. Het systeem identificeerde succesvol de exacte momenten waarop de robot hulp nodig had, waardoor de training werd gericht op de moeilijkste delen van de taak in plaats van tijd te verspillen aan onderdelen die de robot al begreep.

De studie suggereert dat deze aanpak een schaalbaar pad biedt voor het aanleren van nieuwe vaardigheden aan robots op verschillende locaties en door verschillende mensen. Omdat de training plaatsvindt op een handheld-apparaat, zouden meerdere operators potentieel gelijktijdig data kunnen verzamelen op verschillende plaatsen, die allemaal bijdragen aan het leerproces van dezelfde robot. De onderzoekers ontdekten dat door zich te concentreren op de specifieke hiaten in de kennis van de robot en door een systeem te gebruiken dat progressie beloont, zij een robot konden creëren die betrouwbaarder en efficiënter is. Dit werk wijst naar een toekomst waarin robots snel en veilig kunnen worden aangepast aan nieuwe omgevingen, zonder de noodzaak van herhaalde, kostbare en tijdrovende fysieke proeven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →