Guided Riemannian Optimization (GuRO): Bridging Model Predictive Control and Decision Transformers
Dit artikel introduceert Guided Riemannian Optimization (GuRO), een nieuw framework dat Model Predictive Control integreert met Decision Transformers en krommingsbewuste Riemanniaanse optimalisatie gebruikt om snellere, robuustere training en superieure prestaties te bereiken in hoogdimensionele, niet-lineaire robotica-besturingstaken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots die zich door de echte wereld bewegen, staan voor een constante, moeilijke evenwichtsoefening. Ze moeten beslissen hoe ze moeten stappen, draaien of klimmen in omgevingen die vaak ongelijk, glad of onvoorspelbaar zijn. Om deze beslissingen te nemen, hebben ingenieurs zich traditioneel op twee hoofdaanpakken vertrouwd. De eerste is als een zorgvuldige navigator die voortdurend een kaart controleert en het beste pad vooruit herberekent op basis van een bekend model van de wereld. Deze methode is efficiënt en gemakkelijk te begrijpen, maar heeft moeite wanneer de kaart niet klopt of wanneer het terrein verandert op manieren die de kaart niet had voorspeld. De tweede aanpak is meer als een kind dat leert lopen: het probeert veel dingen, valt, staat weer op en leert langzaam wat werkt door middel van vallen en opstaan. Deze methode kan uiteindelijk zeer complexe bewegingen beheersen, maar vereist een enorme hoeveelheid tijd en oefening, en faalt vaak wanneer de taak te moeilijk is of de fouten te kostbaar zijn.
Jarenlang hebben onderzoekers geprobeerd het beste van twee werelden te combineren: de zorgvuldige planning van de navigator en de aanpassingsvermogen van de leerling. Een nieuwer idee is naar voren gekomen dat de geschiedenis van bewegingen en beloningen van een robot behandelt als een verhaal, waarbij krachtige computermodellen die oorspronkelijk zijn ontworpen om menselijke taal te lezen, worden gebruikt om de volgende beste actie te voorspellen. Hoewel veelbelovend, zijn deze "verhaallezende" modellen berucht moeilijk te trainen. Ze raken vaak gevangen in een cyclus van traag, instabiel leren, waarbij ze niet in staat zijn om de meest efficiënte weg naar een oplossing te vinden. Een team van onderzoekers aan de Universiteit van Manchester heeft nu een nieuwe manier ontwikkeld om deze modellen te begeleiden, waardoor ze complexe robotbewegingen veel sneller en betrouwbaarder kunnen leren dan voorheen.
De onderzoekers richtten zich op het aanleren van bewegingen aan een viervoetige robot, een zogenaamde quadruped, om door uitdagende omgevingen te navigeren. Ze wilden dat de robot over ruig terrein liep, trappen beklom en gladde hellingen beklom zonder te vallen. Hiervoor creëerden ze een hybride systeem dat de kloof overbrugt tussen de zorgvuldige planner en de leerling door vallen en opstaan. Ze gebruikten een techniek genaamd Model Predictive Control, die fungeert als een realtime gids. Op elk moment berekent deze gids een kort, lokaal perfect pad voor de robot om te volgen, wat de robot in essentie laat zien wat een goede zet is op dit moment. Deze gids hoeft niet de hele toekomst te kennen; hij hoeft alleen de volgende paar stappen te kennen.
Deze korte, hoogwaardige paden gegenereerd door de gids werden vervolgens gevoed aan een Decision Transformer, het "verhaallezende" model. In plaats van dat de robot alles vanaf nul moet leren door rond te dwalen en fouten te maken, leerde het model door te studeren van de uitstekende voorbeelden die de gids bood. Dit elimineerde de noodzaak voor enorme hoeveelheden offline data of eindeloze uren van vallen en opstaan in de echte wereld. De robot kon leren van de suggesties van de gids en zo zijn eigen begrip van hoe hij efficiënt beweegt, verfijnen. Het trainen van deze grote modellen is echter nog steeds een wiskundig moeilijk probleem. Het landschap van mogelijke oplossingen is gevuld met scherpe pieken en diepe dalen, waardoor het voor standaard leeralgoritmen gemakkelijk is om vast te komen zitten of te traag te bewegen.
Om dit op te lossen, introduceerden de onderzoekers een nieuwe manier om het leerproces zelf te navigeren. Ze behandelden de wiskundige ruimte waar het brein van de robot zich bevindt niet als een plat, eenvoudig rooster, maar als een gekromd oppervlak, vergelijkbaar met het oppervlak van de aarde. Standaard leermethoden bewegen in rechte lijnen, wat inefficiënt kan zijn op een gekromd oppervlak. De nieuwe methode, die de auteurs Guided Riemannian Optimization noemen, begrijpt de kromming van deze ruimte. Het past de richting van het leren aan om de natuurlijke contouren van het probleem te volgen, waardoor het brein van de robot veel sneller de beste oplossing kan vinden. Deze aanpak is als een wandelaar die de lay-out van het landschap kent en de meest directe route een heuvel op neemt, in plaats van in een rechte lijn te lopen die tot een doodlopend spoor of een steile klif kan leiden.
Het team testte dit systeem op een Unitree AlienGo-robot, een viervoetige machine, in een gesimuleerde omgeving die de fysica van de echte wereld nabootst. Ze stelden de robot drie verschillende uitdagingen: lopen over ongelijk terrein, een trap beklimmen en een helling met lage wrijving beklimmen. Ze vergeleken hun nieuwe methode met verschillende gevestigde technieken, inclusclusief standaard reinforcement learning-algoritmen en andere versies van de decision transformer die geen gebruik maakten van de leerbenadering met het gekromde oppervlak. De resultaten toonden een duidelijk voordeel voor het nieuwe systeem. In elke taak bereikte de robot die getraind was met de geleide, krommingsbewuste methode een hoger prestatieniveau en deed dit met minder pogingen dan de andere methoden.
De gegevens toonden aan dat de robot met grotere stabiliteit en snelheid leerde te lopen op ruig terrein, trappen te beklimmen en hellingen met weinig wrijving te bedwingen. Het trainingsproces zelf was aanzienlijk efficiënter, waarbij de loss function — een maatstaf voor hoe foutief de voorspellingen van de robot waren — veel sneller daalde dan bij traditionele methoden. Statistische analyse bevestigde dat deze verbeteringen niet op toeval berustten. De nieuwe methode presteerde consequent beter dan de beste bestaande alternatieven, wat bewees dat het combineren van een realtime planner met een verhaallezend model, en vervolgens het leerproces optimaliseren met een begrip van de onderliggende geometrie, een krachtig instrument voor robotbesturing creëert.
Dit werk suggereert dat de toekomst van robotisch leren wellicht niet ligt in de keuze tussen zorgvuldige planning en vallen en opstaan, maar in het samenweven van beide. Door een planner te gebruiken om hoogwaardige voorbeelden te bieden en een gespecialiseerde wiskundige benadering te gebruiken om het leerproces te navigeren, kunnen robots complexe fysieke taken sneller en robuuster beheersen. De onderzoekers hebben aangetoond dat deze aanpak effectief werkt in simulatie, wat een veelbelovend pad biedt voor het inzetten van intelligente, aanpasbare robots in de echte wereld, waar de omstandigheden zelden perfect zijn en de kosten van falen hoog zijn.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.