Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control
Dit artikel introduceert een runtime-incrementeel transformer-mechanisme dat tijdens reinforcement learning aandachtskoppen dynamisch laat groeien en wegknippen op basis van de representatieve capaciteit van de context en kop-redundantie, waardoor catastrofale fouten in de langetermijn adaptieve controle van robotische manipulatoren met niet-observeerbaar wrijvingsgeheugen worden geëlimineerd en de noodzaak voor kostbare offline hyperparameter-afstemming wordt weggenomen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots die met precisie bewegen, zoals de armen die in fabrieken worden gebruikt om auto's te assembleren of delicate materialen te hanteren, vertrouwen op complexe wiskunde om te weten hoeveel kracht ze moeten uitoefenen. Decennialang hebben ingenieurs een methode gebruikt genaamd computed-torque control, die de exacte duw of trek berekent die nodig is om een gewricht naar een gewenste plek te bewegen. Dit werkt goed wanneer de beweging van de robot voorspelbaar is, maar machines in de echte wereld worden geconfronteerd met een verborgen probleem: wrijving. Terwijl een deel van de wrijving eenvoudig en constant is, hangt ander type wrijving, zoals het stroeve-slipgedrag dat bekend staat als Stribeck-wrijving, af van een verborgen interne staat die in de loop van de tijd verandert. Omdat de sensoren van een robot deze verborgen staat niet direct kunnen zien, verliest het systeem zijn vermogen om zijn eigen toekomstige gedrag te voorspellen op basis van alleen de huidige positie. Om dit op te lossen, hebben onderzoekers zich tot kunstmatige intelligentie gewend, specifiek een vorm van leren genaamd reinforcement learning, waarbij een computerprogramma leert door middel van trial-and-error. Deze programma's maken echter vaak gebruik van een specifiek architecturaal kenmerk genaamd een attention mechanism (aandachtsmechanisme), dat werkt als een spotlight, waardoor de AI zich kan concentreren op verschillende delen van zijn recente geschiedenis. Het aantal van deze spotlights, of "heads", staat meestal vast voordat de training begint, gekozen via een langdurig en kostbaar zoekproces. Als het gekozen aantal te klein is, slaagt de robot er niet in te leren; als het te groot is, wordt het systeem inefficiënt.
De onderzoekers achter deze studie zetten zich in om deze starheid te doorbreken door een systeem te creëren dat van gedachten kan veranderen terwijl het leert. Ze ontwikkelden een nieuwe controller die niet vooraf beslist over het aantal attention heads. In plaats daarvan observeert het de eigen prestaties tijdens het leerproces en voegt nieuwe heads toe wanneer het zich overweldigd voelt door de complexiteit van de taak, of verwijdert ze wanneer het merkt dat sommige niets doen. Dit gebeurt in realtime, zonder het leerproces te onderbreken. Het systeem gebruikt twee eenvoudige signalen om deze beslissingen te nemen. Ten eerste meet het hoeveel nieuwe informatie er binnenkomt vanuit de geschiedenis van de robot; als de informatie te complex is voor het huidige aantal heads om te verwerken, groeit het systeem een nieuwe head aan. Ten tweede controleert het hoeveel elke head bijdraagt aan de uiteindelijke beslissing; als een head nauwelijks werk verricht, verwijdert het systeem deze geruisloos. Cruciaal is dat de onderzoekers het systeem zo hebben ontworpen dat het toevoegen of verwijderen van een head geen plotselinge sprong of fout in het gedrag van de robot veroorzaakt. Wanneer een nieuwe head wordt toegevoegd, begint deze met nul invloed, wat ervoor zorgt dat de beweging van de robot vloeiend blijft. Wanneer een head wordt verwijderd, is de verandering zo klein dat het het leerproces niet verstoort.
Het team testte deze aanpak op een gesimuleerde twee-gewrichtige robotarm die te maken kreeg met verschillende niveaus van wrijvingsgeheugen, variërend van kortetermijn- tot langetermijnvertragingen. In eerdere experimenten met een vast aantal heads faalde het systeem volledig in de meest uitdagende scenario's met een lang geheugen, waarbij de robot vaak de controle verloor of het gewicht dat het droeg negeerde. Met het nieuwe, tijdens de uitvoering aanpasbare systeem slaagde de robot in elke test, zelfs in de moeilijke gevallen waar de oude methode faalde. De onderzoekers ontdekten dat het systeem geen specifiek "natuurlijk" aantal heads ontdekte dat inherent is aan de taak; in plaats daarvan bereikte het bij elke run van de hoofdcampagne de maximale limiet van het aantal heads, en de prune trigger (verwijderingsprikkel) werd nooit geactiveerd om ongebruikte heads te verwijderen. Interessant genoeg kwam het voordeel niet voort uit de uiteindelijke grootte van het systeem, maar uit de manier waarop het groeide. Het geleidelijke proces van het toevoegen van heads fungeerde als een trainingscurriculum, waardoor de robot stap voor stap kon leren in plaats van in één keer in een complexe taak te worden geworpen. Dit sugggeert dat het vermogen om de architectuur tijdens het leren aan te passen belangrijker is dan het hebben van een massieve, vooraf gebouwde structuur. Het resultaat is een robuustere en efficiëntere manier om robots te leren omgaan met de rommelige, onvoorspelbare wrijving van de echte wereld, waardoor de noodzaak voor kostbare trial-and-error zoektochten naar de juiste instellingen voordat de robot überhaupt beweegt, wordt weggenomen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.