REFACTOR-VLA: Unsupervised Library Learning of Typed Motor Programs
REFACTOR-VLA is een wake/sleep-framework dat herbruikbare, getypeerde motorische programma's leert door actiefragmenten te clusteren via een gedrags-equivalentiekernel en een latent wereldmodel, waarmee het de state-of-the-art prestaties bereikt op langdurige LIBERO-taken door middel van een bibliotheek-geconditioneerde decoder en een trainingsdoelstelling die de kwaliteit van het clusteren prioriteert boven modelcapaciteit.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worden steeds beter in het zien van de wereld en het bewegen erdoorheen, maar ze worstelen nog steeds met het soort complexe, meerstaps-taken die mensen met gemak afhandelen. Wanneer een persoon een sandwich maakt, denkt diegene niet na over elke individuele spiertrek die nodig is om het brood te pakken, de boter te smeren of de tomaat te snijden. In plaats daarvan vertrouwen ze op een mentale bibliotheek van vertrouwde handelingen—grijpen, smeren, snijden—die ze in verschillende volgordes kunnen achter elkaar plaatsen. Huidige kunstmatige intelligentiemodellen voor robots missen vaak dit vermogen om gedrag te organiseren. Ze hebben de neiging om rauwe, moment-tot-moment commando's te genereren zonder ze te groeperen in herbruikbare, goed gedefinieerde vaardigheden. Dit maakt het voor hen moeilijk om vooruit te plannen voor langdurige taken of om uit te leggen wat ze hebben geleerd. Onderzoekers proberen nu machines te leren hun eigen interne bibliotheken van vaardigheden op te bouwen, waardoor ze complexe taken kunnen opdelen in kleinere, beheersbare stukjes die kunnen worden hergebruikt en gecombineerd.
Een team van onderzoekers bij Apple heeft een nieuw systeem ontwikkeld genaamd REFACTOR-VLA dat probeert dit probleem op te lossen door een robot te leren zijn eigen vaardigheden te ontdekken zonder menselijke labels. Het systeem werkt in twee afwisselende fasen, vergelijkbaar met hoe een mens een nieuwe beweging kan oefenen en daarna rust om het brein de herinnering te laten organiseren. In de eerste fase leert de robot te voorspellen wat er vervolgens zal gebeuren als hij een bepaalde sequentie van bewegingen uitvoert. Hij bouwt een mentaal model van de wereld, waarbij hij begrijpt hoe zijn acties de omgeving veranderen. In de tweede fase bekijkt het systeem de enorme hoeveelheid bewegingsdata die het heeft verzameld en probeert patronen te vinden. Het stelt een eenvoudige maar moeilijke vraag: produceren twee verschillende sequenties van bewegingen hetzelfde resultaat? Als een robot zijn arm in een cirkel beweegt om een kopje op te pakken, of in een rechte lijn beweegt om hetzelfde te doen, moet het systeem herkennen dat beide paden hetzelfde doel bereiken.
Om dit te beantwoorden, hebben de onderzoekers een speciale tool ontwikkeld die de uitkomst van acties meet in plaats van alleen hun verschijning. In plaats van naar de ruwe video te kijken van de beweging van de robot, simuleert het systeem de actie in zijn geleerde mentale model om te zien waar de robot eindigt en welke beloning hij krijgt. Als twee verschillende bewegingspaden leiden tot dezelfde eindtoestand en dezelfde beloning, beschouwt het systeem deze als equivalent. Het groepeert vervolgens deze vergelijkbare paden tot een enkele, herbruikbare vaardigheid. Zodra een groep is gevormd, probeert het systeem een eenvoudig, gestructureerd programma te schrijven dat het gemeenschappelijke patroon van die vaardigheid beschrijft. Dit programma wordt vervolgens toegevoegd aan een bibliotheek. De robot kan deze bibliotheek later gebruiken om nieuwe taken te plannen, waarbij hij gebruikmaakt van deze vooraf verpakte vaardigheden in plaats van elke kleine beweging vanaf nul te berekenen.
De onderzoekers testten deze aanpak op een standaardset robottaken waarbij objecten in een gesimuleerde omgeving worden verplaatst. Ze ontdekten iets verrassends over hoe deze systemen leren. Een algemeen geloof in kunstmatige intelligentie is dat het groter en complexer maken van een model altijd leidt tot betere prestaties. Echter, toen de onderzoekers de omvang van hun wereldmodel vergrootten van ongeveer 188 miljoen parameters naar 430 miljoen, presteerde het systeem op elke testsuite slechter. Het grotere model slaagde er niet in de vaardigheden correct te organiseren, wat suggereert dat het simpelweg toevoegen van meer rekenkracht niet de oplossing is.
In plaats daarvan lag de sleutel tot succes in de manier waarop het model werd getraind. De onderzoekers ontdekten dat het toevoegen van een specifiek type leerdoel tijdens de initiële trainingsfase de resultaten drastisch verbeterde. Dit leerdoel hielp het systeem om verschillende taken duidelijker te onderscheiden, waardoor het vergelijkbare bewegingen veel effectiever bij elkaar kon groeperen. Met deze verandering presteerde het systeem beter dan de sterkste bestaande methoden op alle vier de belangrijke testsuites, waarbij het het gemiddelde score met een aanzienlijke marge verbeterde. Het systeem slaagde erin een bibliotheek van drie verschillende, herbruikbare vaardigheden op te bouwen voor een specifieke taak, en een robot die deze bibliotheek gebruikte, was in staat om elke demonstratie die het had gezien met deze nieuwe vaardigheden te herschrijven.
De studie onthulde ook dat het vermogen van het systeem om deze vaardigheden te vinden sterk afhangt van het type data dat het analyseert. Hoewel het systeem erin slaagde een bibliotheek van taalgebaseerde instructies te creëren, zoals "pak het object op en plaats het in de mand", slaagde het er niet in om herbruikbare patronen te vinden in de ruwe motorische commando's zelf. Dit suggereert dat het systeem beter is in het begrijpen van de hoge doelen van een taak dan in de lage fysieke details van hoe te bewegen. De onderzoekers maten de consistentie van hun resultaten over vele verschillende trainingsruns en vonden dat het systeem betrouwbaar vergelijkbare vaardigheidsgroeperingen ontdekte, met een hoge mate van overeenstemming tussen verschillende versies van het model.
Dit werk demonstreert dat de manier waarop een robot zijn ervaringen organiseert belangrijker is dan de loutere omvang van zijn brein. Door zich te richten op de uitkomsten van acties en een gestructureerde methode te gebruiken om deze te groeperen, kan het systeem een bibliotheek van vaardigheden opbouwen die het helpt complexe, langdurige taken aan te pakken. De bevindingen dagen het idee uit dat groter altijd beter is en wijzen naar een toekomst waarin robots kunnen leren denken in termen van herbruikbare acties, net zoals mensen dat doen. De onderzoekers hebben hun code en data beschikbaar gesteld, zodat anderen deze resultaten kunnen verifiëren en voort te bouwen op deze nieuwe benadering van robotisch leren.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.