WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
Het artikel introduceert WARP-RM, een volledig zelfgesuperviseerd beloningsmodel dat dichte relatieve voortgangssignalen genereert uit tijdgewarpte succesvolle demonstraties om WARP-BC mogelijk te maken, een behavior cloning-methode die de robotprestaties op langetermijn-taken aanzienlijk verbetert door actiechunks uit gemengde kwaliteitsdata te filteren en te herwegen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lang met het leren van het observeren van mensen. Terwijl een persoon naar een taak kan kijken en de flow van een beweging begrijpt, leert een robot die getraind is op videodata vaak ook de fouten aan te leren naast de successen. Als een menselijke operator even pauzeert om na te denken, rommelt met een object, of een onhandige greep probeert voordat hij slaagt, ziet de robot deze aarzelingen als onderdeel van het juiste pad. Dit is een bijzonder probleem voor lange, complexe taken zoals het vouwen van wasgoed of het assembleren van objecten, waarbij één moment van verwarring de hele sequentie kan ontregelen. Jarenlang hebben onderzoekers geprobeerd robots te leren om deze slechte momenten te negeren, maar de meeste methoden vereisten dure menselijke labels om precies aan te geven waar een fout plaatsvond, of ze gooiden hele videoclips weg als deze enige fouten bevatten, waardoor waardevolle herstelbewegingen verborgen in imperfecte demonstraties verloren gingen.
Een team van onderzoekers aan de Universiteit van Californië, Berkeley, en Stanford University heeft een nieuwe manier ontwikkeld om robots het onderscheid te leren tussen productieve beweging en verspilde tijd zonder dat daar menselijke labels voor nodig zijn. Ze creëerden een systeem genaamd WARP, wat staat voor Warp-Augmented Relative Progress. In plaats van een mens te vragen om uren aan video te bekijken en kaders te tekenen rond goede en slechte momenten, hebben de onderzoekers de computer geleerd om de snelheid en richting van progressie te begrijpen door de video's af te spelen op verschillende snelheden en zelfs achterstevoren. Door de robot te trainen om te herkennen hoe "voorwaartse" progressie eruitziet in vergelijking met "achterwaartse" of stilstaande beweging, leerde het systeem een score toe te kennen aan elk enkel frame van een video. Deze score vertelt de robot hoe snel de taak vooruitgaat, of het vastzit, of dat het eigenlijk achteruit beweegt.
De onderzoekers testten dit idee op een fysieke robot met twee armen, waarbij ze de opdracht gaven om T-shirts te vouwen die verfrommeld in een bak zaten. Ze creëerden trainingsdatasets van variërende kwaliteit. In de beste datasets waren de menselijke demonstraties snel en efficiënt. In de slechtste datasets waren de menselijke demonstraties vol pauzes, pogingen opnieuw en lange perioden van geknoei. Wanneer ze een standaard robotleersysteem trainden op deze slordige, kwalitatief minderwaardige video's, faalde de robot bijna volledig. De robot raakte vast in lussen van kleine, nutteloze aanpassingen, niet in staat de taak te voltooien. Echter, toen ze het nieuwe WARP-systeem gebruikten om de data te filteren, veranderden de resultaten drastisch. Het systeem identificeerde automatisch de trage, aarzelende delen van de video's en verminderde hun belang, terwijl het de snelle, besliste momenten behield. Op de slordige datasets waar de standaardrobot twintig van de twintig keer faalde, slaagde de met WARP getrainde robot negentien van de twintig keer. Het vouwde shirts ook bijna achttien keer sneller dan de standaardrobot wanneer ze dezelfde slechtwaardige data kregen.
Het team stopte niet bij T-shirts. Ze testten de methode ook op een taak waarbij de robot plastic flessen in een bak moest plaatsen. In de echte wereld plaatste het nieuwe systeem vierenzeventig van de tachtig flessen, terwijl het standaard systeem er slechts negenen vijftig wist te plaatsen. De nieuwe robot plaatste de flessen sneller en met meer consistentie. Om er zeker van te zijn dat deze resultaten niet slechts een toevalstreffer waren van de specifieke robothardware, draalden de onderzoekers een massale simulatie met vijfhonderdtwaalf verschillende scenario's. In deze virtuele test plaatste het nieuwe systeem 290 flessen per uur, wat aanzienlijk beter was dan het standaard systeem, dat er 237 per uur plaatste. Zelfs wanneer vergeleken met andere geavanceerde methoden die proberen data op te schonen, produceerde de nieuwe aanpak consequent de snelste en meest betrouwbare resultaten.
Een belangrijk deel van waarom dit werkt, is hoe het systeem progressie herkent. De onderzoekers vertelden de computer niet hoe een "gevouwen shirt" eruitziet. In plaats daarvan namen ze succesvolle video's van mensen die shirts vouwen en speelden deze af op willekeurige snelheden, soms vertraagd tot een kruipje en soms versneld. Ze speelden ook enkele video's in reverse. De computer kreeg vervolgens de opdracht te raden hoeveel tijd er was verstreken tussen het begin van een clip en het huidige moment. Door te leren de verstreken tijd te voorspellen in deze gewarpte, door elkaar gehusselde versies van de video, leerde de computer het natuurlijke ritme van de taak te begrijpen. Het leerde dat een snelle, vloeiende beweging meestal betekent dat de taak vooruitgaat, terwijl een trage, schokkerige beweging of een achterwaartse beweging betekent dat de taak stagneert of faalt. Dit stelde het systeem in staat om een continue score te genereren voor elk frame van de video, waardoor de robot precies wist welke delen van de demonstratie hij aandacht moest schenken en welke hij moest negeren.
De onderzoekers ontdekten dat het simpelweg weggooien van slechte video's niet genoeg was. De meest effectieve strategie was om de slordige video's te behouden, maar de manier waarop de robot ervan leerde te veranderen. Het systeem neemt een stuk actie uit de video en kijkt naar de progressiescore aan het einde van dat stuk. Als de score hoog was, wat betekende dat de taak snel vooruitging, leerde de robot met volledige intensiteit van dat stuk. Als de score laag of negatief was, wat betekende dat de robot aarzelde of achteruit bewoog, zou het systeem dat stuk ofwel volledig negeren of er zeer licht van leren. Deze aanpak stelde de robot in staat om te leren van de herstelbewegingen die mensen maakten wanneer ze een shirt lieten vallen en het weer oppakten, zonder te leren van de paniek en aarzeling die de val veroorzaakten.
Dit werk suggereert dat robots geen perfecte menselijke demonstraties nodig hebben om complexe vaardigheden te leren. Ze kunnen leren van slordige, real-world data als ze een manier hebben om de flow van tijd en progressie binnen die data te begrijpen. De onderzoekers merkten op dat hun methode steunt op een specifiek type data-augmentatie waarbij video's achterstevoren worden afgespeeld, wat fysiek onmogelijk is voor een echte robot om te doen. Echter, het systeem leerde nog steeds nuttige patronen uit deze kunstmatige training. Hoewel de methode geen magische oplossing is die voor elke mogelijke taak werkt, biedt het een krachtig nieuw instrument om robots te leren de ruis van menselijke fouten te negeren en zich te concentreren op het signaal van succesvolle actie. Het team heeft hun code en data beschikbaar gesteld zodat andere onderzoekers deze ideeën op hun eigen robots en taken kunnen testen, wat potentieel kan leiden tot een nieuwe generatie robots die snel kunnen leren van de imperfecte, alledaagse wereld.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.