SmoothRL: Online Reinforcement Learning During Asynchronous Execution
SmoothRL is een online reinforcement learning-framework dat de sample-efficiënte fijnafstelling van vooraf getrainde robotpolicies mogelijk maakt binnen asynchrone inferentielussen door de uitvoeringstijdlijn expliciet te modelleren en gradiënten alleen te propageren door de nieuw uitgevoerde actieregio's om realtime betrouwbaarheid en vloeiende controle te garanderen.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lang met het bewegen met de vloeiende gratie van levende wezens. Hoewel kunstmatige intelligentie machines heeft geleerd om taal te begrijpen en objecten met verbazingwekkende nauwkeurigheid te herkennen, blijft het vertalen van dat begrip naar fysieke beweging een hardnekkige hindernis. Het probleem is niet alleen dat robots slim moeten zijn; ze moeten ook snel en soepel zijn. In de echte wereld kan een robotarm niet pauzeren om na te denken tussen elke kleine beweging. Als hij stopt om zijn volgende stap te berekenen, wordt de beweging schokkerig en mislukt de taak. Om vloeiend te bewegen, moet een robot een reeks toekomstige bewegingen voorspellen en deze uitvoeren terwijl hij tegelijkertijd de volgende set berekent. Dit creëert een complex timingprobleem: de robot handelt op basis van instructies die een moment geleden zijn gegenereerd, terwijl de computer al werkt aan de instructies voor het moment daarna. Als de robot probeert te leren van zijn fouten terwijl hij onder deze omstandigheden opereert, loopt het leerproces vaak vast, omdat de robot wordt beoordeeld op acties die hij nooit echt heeft voltooid, of acties die hij gedwongen werd halverwege te staken.
Een team onderzoekers bij Astribot heeft een nieuwe methode ontwikkeld genaamd SmoothRL om dit specifieke timingpuzzel op te lossen. Hun werk stelt robots in staat om in realtime te leren van ervaring, zelfs terwijl ze draaien op een complex, overlappend schema waarbij denken en bewegen tegelijkertijd plaatsvinden. De onderzoekers richtten zich op een fundamentele mismatch in hoe robots worden getraind versus hoe ze worden gebruikt. In het verleden trainden wetenschappers robots door ervan uit te gaan dat de machine zou stoppen, nadenken en dan bewegen in een perfect, gesynchroniseerd ritme. Maar in de echte wereld gebruiken robots om de beweging vloeiend te houden een systeem waarbij ze een "chunk" van toekomstige bewegingen genereren, het eerste deel naar de motoren sturen, en onmiddellijk beginnen met het berekenen van de volgende chunk terwijl het eerste deel nog wordt uitgevoerd. Dit creëert een situatie waarin de robot voortdurend delen van zijn eigen plannen weggooit omdat een nieuwere, versere planning is gearriveerd. De onderzoekers realiseerden zich dat voor een robot om effectief te leren in deze omgeving, hij moet stoppen met proberen te leren van de delen van zijn plan die weggegooid zijn en zich alleen te concentreren op de delen die hij daadwerkelijk heeft uitgevoerd.
De kern van hun oplossing is een manier om de robot te leren de "ghost" acties te negeren die hij genereerde maar nooit gebruikte. Wanneer de robot een plan maakt voor de komende paar seconden, verdeelt hij dat plan in drie duidelijke zones. De eerste zone bevat acties die al zijn beslist door de vorige berekeningscyclus; de robot kan deze nu niet meer veranderen. De tweede zone bevat de nieuwe acties die de robot daadwerkelijk uitvoert terwijl de volgende berekening plaatsvindt. De derde zone bevat de resterende toekomstige acties die waarschijnlijk vervangen zullen worden door de volgende berekening voordat de robot er ooit aan toe komt. De onderzoekers bouwden een trainingssysteem dat alleen naar de tweede zone kijkt – de acties die de robot daadwerkelijk heeft uitgevoerd. Ze leren de robot zijn gedrag aan te passen op basis van enkel de consequenties van de bewegingen die hij echt heeft gemaakt, waardoor het leersignaal van de delen van het plan die werden weggegooid effectief wordt afgesneden. Dit zorgt ervoor dat de robot leert van de realiteit, en niet van een hypothetische toekomst die nooit heeft plaatsgevonden.
Om dit te testen, zetten de onderzoekers drie uitdagende fysieke taken op met een mobiele robot met twee armen. De eerste taak hield in dat een object in een bak werd gegooid, een beweging die een continue, ononderbroken zwaai vereist. Als de robot aarzelt of schokt op het moment dat hij tussen berekeningscycli schakelt, mislukt de worp. De tweede taak vereiste dat de robot een pen dichtdeed met extreme precisie, waarbij twee kleine objecten binnen een tolerantie van slechts enkele millimeters werden uitgelijnd. De derde taak hield in dat een kartonnen doos werd opengesneden door een mes langs een minuscule naad te leiden, een klus die millimeterprecisie vereist om de doos zelf niet te beschadigen. In alle drie de gevallen begon de robot met een vooraf getraind brein dat goed maar niet perfect was. Toen de onderzoekers de robot lieten oefenen met hun nieuwe asynchrone leermethode, waren de resultaten spectaculair. Het vermogen van de robot om het object succesvol te gooien sprong van negenendertig procent naar vierennegentig procent. Zijn vaardigheid bij het dichtdoen van de pen steeg van een magere acht procent naar drieentachtig procent, en zijn succespercentage bij het openen van de doos verbeterde van dertig procent naar negentig procent.
De verbetering ging niet alleen over het vaker volbrengen van de taak; het ging over hoe de robot bewoog. De onderzoekers maten de vloeiendheid van de beweging van de robot en vonden dat de nieuwe methode plotselinge schokken en schokkerige versnellingen met bijna de helft verminderde. Deze vloeiendheid was cruciaal voor de dynamische werptaken, waarbij een pauze in de beweging zou ervoor zorgen dat het object te kort kwam. Het systeem bleek ook flexibel genoeg om menselijke hulp te verwerken. Als een menselijke operator moest ingrijpen om een fout te corrigeren, kon de robot die menselijke actie direct absorberen in zijn leerproces zonder dat deze vertaald hoefde te worden naar een andere code. De correctie van de mens werd simpelweg een ander voorbeeld van de juiste manier om te bewegen, waardoor de robot tegelijkertijd kon leren van zowel zijn eigen pogingen als menselijke begeleiding.
De onderzoekers ontdekten dat het leerproces van de robot niet altijd een rechte lijn was. Bij de taak van het openen van de doos daalde de prestatie van de robot eerst voordat deze verbeterde, wat suggereerde dat het systeem nieuwe manieren om te bewegen verkende die aanvankelijk slechter leken voordat het het juiste pad vond. Dit geeft aan dat de robot echt leerde te adapteren in plaats van alleen een vaste set bewegingen te memoriseren. De onderzoekers merkten echter ook de beperkingen van hun aanpak op. Het vermogen van de robot om te leren is nog steeds gekoppeld aan de kwaliteit van zijn initiële vooraf getrainde brein. Als de basisrobot fundamenteel in de war is over een taak, kunnen de kleine aanpassingen die dit leersysteem maakt mogelijk niet genoeg zijn om het probleem op te lossen. Bovendien vertroukt het systeem erop dat de berekeningen van de robot binnen een strikte tijdslimiet worden voltooid; als de computer te traag wordt, kan de timing van de bewegingen uit de pas lopen, wat het hele proces destabiliseert.
Uiteindelijk demonstreert dit werk dat voor robots echt bruikbaar te worden in de echte wereld, hun leeralgoritmen moeten aansluiten bij de rommelige, overlappende realiteit van hoe zij bewegen. Door de robot te leren zich alleen te concentreren op de acties die hij daadwerkelijk heeft voltooid en de acties te laten negeren die hij heeft weggegooid, hebben de onderzoekers een pad gecreëerd voor machines om complexe, snelle taken te leren zonder de vloeiendheid op te offeren die nodig is om ze uit te voeren. Het resultaat is een robot die kan gooien, doppen en snijden met een niveau van betrouwbaarheid en vloeiendheid dat voorheen onbereikbaar was, wat bewijst dat de sleutel tot beter leren bij robots ligt in het begrijpen van het exacte moment waarop een plan werkelijkheid wordt.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.