HaWMPO: Hallucination-Aware World Model-based Policy Optimization for Generalist Robot Policy
Het artikel stelt HaWMPO voor, een hallucinatie-bewust wereldmodel-gebaseerd beleidsoptimalisatiekader dat generalistische robotbeleid verbetert door voorspellingshallucinaties tijdens geïmagineerde rollouts te schatten en te onderdrukken, waardoor de succespercentages in complexe langetermijnmanipulatietaken op zowel benchmarks als echte robots aanzienlijk worden verbeterd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots die kunnen leren om een grote verscheidenheid aan taken uit te voeren, van het stapelen van blokken tot het vouwen van de was, zijn al lang een doel van kunstmatige intelligentie. Om dit te bereiken, hebben onderzoekers "generalistische" beleidsregels ontwikkeld, die in essentie hersenachtige systemen zijn die getraind zijn om taal en visie te begrijpen om te beslissen hoe een robot moet bewegen. Het onderwijzen van deze systemen in de echte wereld is echter traag, duur en riskant. Elke keer dat een robot een nieuwe actie probeert, kan hij iets kapotmaken of zichzelf beschadigen, waardoor het proces van vallen en opstaan gevaarlijk is. Om dit op te lossen, hebben wetenschappers zich gericht op "wereldmodellen", wat digitale simulators zijn waarmee robots in een computer kunnen oefenen. Deze modellen voorspellen wat er vervolgens zal gebeuren op basis van huidige acties, waardoor een veilige ruimte voor leren ontstaat. Toch zijn deze digitale simulators niet perfect; naarmate ze verder in de toekomst voorspellen, beginnen ze vaak details te verzinnen die nooit hebben plaatsgevonden, een fenomeen dat bekend staat als "hallucinatie". Als een robot leert van deze nepscenario's, kan hij acties leren die in de computer wel werken, maar in de echte wereld volledig falen.
Een team van onderzoekers heeft een nieuwe methode ontwikkeld om robots te helpen effectief te leren van deze imperfecte digitale simulaties zonder door hun fouten te worden misleid. Ze noemen hun aanpak HaWMPO, een systeem dat ontworpen is om robots zich bewust te maken van wanneer hun digitale trainingsgrond tegen hen liegt. In plaats van elk verbeeld scenario als even waardevol te behandelen, bevat het nieuwe systeem een speciaal onderdeel dat fungeert als een kwaliteitscontroleur. Deze inspecteur kijkt naar de sequentie van afbeeldingen die de simulator genereert en wijst een score toe die aangeeft hoe betrouwbaar die sequentie is. Als de simulator begint af te dwalen in fantasie en afbeeldingen creëert die niet overeenkomen met de natuurwetten of de verwachte uitkomst, markeert de inspecteur dit. Het systeem gebruikt deze informatie vervolgens om het leerproces aan te passen, waarbij het de robot effectief vertelt om de delen van de simulatie die te onbetrouwbaar lijken te negeren en zich te concentreren op de delen die er realistisch uitzien.
De onderzoekers testten deze methode met behulp van een standaard set robottaken in een computermgeving genaamd LIBERO, die het verplaatsen van objecten naar specifieke locaties omvat. Ze vergeleken hun nieuwe systeem met andere methoden die wereldmodellen gebruiken maar niet over deze kwaliteitscontrolefunctie beschikken. De resultaten toonden een duidelijk voordeel voor de nieuwe aanpak. In de simulatie behaalde de robot die gebruikmaakte van het hallucinatie-bewuste systeem een succespercentage van 63,7 procent, wat aanzienlijk hoger was dan de op één na beste methode. De verbetering was bijzonder merkbaar in taken die ruimtelijk redeneren en objectmanipulatie vereisen, waarbij het vermogen van de robot om onderscheid te maken tussen echte en nepscenario's het hem hielp om robuustere strategieën te leren. De onderzoekers ontdekten dat door de robot te straffen wanneer hij vertrouwde op sterk gehallucineerde scenario's, het systeem voorkwam dat de robot slechte gewoonten aanleerde die alleen zouden werken in een defecte simulatie.
Om te waarborgen dat deze methode ook buiten de computer werkte, testte het team het ook op een fysieke robot in een echte omgeving. Ze gaven de robot twee specifieke uitdagingen: het plaatsen van een tissue in een doos en het zetten van een koptelefoon op een standaard. Zonder het nieuwe systeem slaagde de robot in deze taken ongeveer 60 procent van de tijd bij de koptelefoontaken. Na het toepassen van de hallucinatie-bewuste training steeg het succespercentage naar een gemiddelde AUC van 0,8, waarbij de robot 85% behaalde bij de tissue-taak en 75% bij de koptelefoon-taak. Deze sprong in prestaties laat zien dat de lessen geleerd in de digitale wereld daadwerkelijk overdraagbaar waren naar de fysieke wereld, omdat de robot had geleerd de digitale ruis te negeren die deze systemen gewoonlijk in de war brengt. De onderzoekers merkten op dat het systeem werkt door constant de consistentie van de gesimuleerde toekomst te controleren, waardoor wordt gewaarborgd dat de robot alleen leert van trajecten die fysiek plausibel ogen.
De studie benadrukt dat de sleutel tot beter robotleren niet alleen het hebben van een simulator is, maar het hebben van een manier om deze te vertrouwen. Door een systeem te bou
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.