SmoothRL: Online Reinforcement Learning During Asynchronous Execution
SmoothRL ist ein Online-Reinforcement-Learning-Framework, das die probeneffiziente Feinabstimmung vortrainierter Roboter-Policies innerhalb asynchroner Inferenzschleifen ermöglicht, indem es den Ausführungszeitplan explizit modelliert und Gradienten nur durch die neu ausgeführten Aktionsregionen propagiert, um Echtzeitzuverlässigkeit und eine glatte Steuerung zu gewährleisten.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Roboter hatten lange Zeit damit zu kämpfen, sich mit der fließenden Anmut lebender Wesen zu bewegen. Während künstliche Intelligenz Maschinen beigebracht hat, Sprache zu verstehen und Objekte mit verblüffender Genauigkeit zu erkennen, bleibt die Übersetzung dieses Verständnisses in physische Bewegung eine hartnäckige Hürde. Das Problem ist nicht nur, dass Roboter intelligent sein müssen; sie müssen auch schnell und geschmeidig sein. In der realen Welt kann ein Roboterarm nicht zwischen jeder winzigen Bewegung innehalten, um nachzudenken. Wenn er stoppt, um seinen nächsten Schritt zu berechnen, wird die Bewegung ruckartig und die Aufgabe schlägt fehl. Um sich flüssig zu bewegen, muss ein Roboter eine Serie zukünftiger Bewegungen vorhersagen und diese ausführen, während er gleichzeitig den nächsten Satz Bewegungen berechnet. Dies erzeugt ein komplexes Zeitproblem: Der Roboter handelt nach Anweisungen, die vor einem Moment generiert wurden, während der Computer bereits an den Anweisungen für den Moment danach arbeitet. Wenn der Robelt versucht, aus seinen Fehlern zu lernen, während er unter diesen Bedingungen arbeitet, bricht der Lernprozess oft zusammen, weil der Roboter nach Aktionen beurteilt wird, die er nie wirklich abgeschlossen hat oder die er mitten im Prozess aufgeben musste.
Ein Forschungsteam bei Astribot hat eine neue Methode namens SmoothRL entwickelt, um dieses spezifische Zeiträtsel zu lösen. Ihre Arbeit ermöglicht es Robotern, in Echtzeit aus Erfahrung zu lernen, selbst wenn sie nach einem komplexen, überlappenden Zeitplan arbeiten, bei dem Denken und Bewegen gleichzeitig stattfinden. Die Forscher konzentrierten sich auf eine grundlegende Diskrepanz in der Art und Weise, wie Roboter trainiert werden im Vergleich dazu, wie sie eingesetzt werden. In der Vergangenheit trainierten Wissenschaftler Roboter unter der Annahme, dass die Maschine anhalten, denken und dann in einem perfekten, synchronisierten Rhythmus agieren würde. Aber in der realen Welt nutzen Roboter, um die Bewegung flüssig zu halten, ein System, bei dem sie einen „Chunk“ zukünftiger Bewegungen generieren, den ersten Teil an die Motoren senden und sofort mit der Berechnung des nächsten Chunks beginnen, während der erste noch ausgeführt wird. Dies führt zu einer Situation, in der der Roboter ständig Teile seiner eigenen Pläne verwirft, weil ein neuerer, frischerer Plan eingetroffen ist. Die Forscher erkannten, dass ein Roboter in dieser Umgebung nur dann effektiv lernen kann, wenn er aufhört, aus den Teilen seines Plans zu lernen, die weggeworfen wurden, und sich stattdessen nur auf die Teile konzentriert, die er tatsächlich ausgeführt hat.
Der Kern ihrer Lösung ist eine Methode, um den Roboter zu lehren, die „Geisteraktionen“ zu ignorieren, die er generiert, aber nie genutzt hat. Wenn der Roboter einen Plan für die nächsten Sekunden erstellt, unterteilt er diesen Plan in drei distinkte Zonen. Die erste Zone enthält Aktionen, die bereits durch den vorherigen Berechnungszyklus festgelegt wurden; der Roboter kann diese jetzt nicht mehr ändern. Die zweite Zone enthält die neuen Aktionen, die der Roboter tatsächlich ausführt, während die nächste Berechnung stattfindet. Die dritte Zone enthält die verbleibenden zukünftigen Aktionen, die wahrscheinlich durch die nächste Berechnung ersetzt werden, bevor der Roboter sie überhaupt erreicht. Die Forscher entwickelten ein Trainingssystem, das nur die zweite Zone betrachtet – die Aktionen, die der Roboter tatsächlich ausgeführt hat. Sie bringen dem Roboter bei, sein Verhalten ausschließlich basierend auf den Konsequenzen der Bewegungen anzupassen, die er wirklich gemacht hat, wodurch das Lernsignal von den Teilen des Plans, die verworfen wurden, effektiv abgeschnitten wird. Dies stellt sicher, dass der Roboter aus der Realität lernt und nicht aus einer hypothetischen Zukunft, die nie stattgefunden hat.
Um dies zu testen, bauten die Forscher drei anspruchsvolle physische Aufgaben für einen mobilen Roboter mit zwei Armen auf. Die erste Aufgabe beinhaltete das Werfen eines Objekts in einen Behälter, eine Bewegung, die einen kontinuierlichen, ununterbrochenen Schwung erfordert. Wenn der Roboter beim Wechsel zwischen den Berechnungszyklen zögert oder ruckelt, schlägt der Wurf fehl. Die zweite Aufgabe erforderte, dass der Roboter einen Stift mit extremer Präzision abdeckt, wobei zwei kleine Objekte innerhalb einer Toleranz von nur wenigen Millimetern ausgerichtet werden müssen. Die dritte Aufgabe bestand darin, eine Pappschachtel aufzuschneiden, indem ein Messer entlang einer winzigen Naht geführt wurde – eine Aufgabe, die eine Genauigkeit im Millimeterbereich verlangt, um die Schachtel selbst nicht zu beschädigen. In allen drei Fällen startete der Roboter mit einem vortrainierten Gehirn, das gut, aber nicht perfekt war. Als die Forscher den Roboter mit ihrer neuen asynchronen Lernmethode üben ließen, waren die Ergebnisse dramatisch. Die Fähigkeit des Roboters, das Objekt erfolgreich zu werfen, sprang von neununddreißig auf vierundneunzig Prozent. Seine Geschicklichkeit beim Abdecken des Stifts stieg von lediglich acht auf drei Prozent auf dreiundachtzig Prozent, und seine Erfolgsquote beim Öffnen der Schachtel verbesserte sich von dreißig auf neunzig Prozent.
Die Verbesserung betraf nicht nur die Häufigkeit, mit der die Aufgabe erledigt wurde; es ging darum, wie sich der Roboter bewegte. Die Forscher maßen die Geschmeidigkeit der Roboterbewegung und fanden heraus, dass die neue Methode plötzliche Erschütterungen und ruckartige Beschleunigungen um fast die Hälfte reduzierte. Diese Geschmeidigkeit war entscheidend für die dynamische Wurfaufgabe, bei der ein kurzes Innehalten in der Bewegung dazu führen würde, dass das Objekt zu kurz fliegt. Das System erwies sich auch als flexibel genug, um menschliche Hilfe zu verarbeiten. Wenn ein menschlicher Bediener eingreifen musste, um einen Fehler zu korrigieren, konnte der Roboter diese menschliche Aktion direkt in seinen Lernprozess integrieren, ohne sie in einen anderen Code übersetzen zu müssen. Die Korrektur des Menschen wurde zu einem weiteren Beispiel für die richtige Art der Bewegung, was es dem Roboter ermöglichte, gleichzeitig aus seinen eigenen Versuchen und aus menschlicher Anleitung zu lernen.
Die Forscher stellten fest, dass die Lernkurve des Roboters nicht immer eine gerade Linie war. Bei der Aufgabe des Aufschneidens der Schachtel sank die Leistung des Roboters zunächst ab, bevor sie sich verbesserte, was darauf hindeutet, dass das System neue Wege der Bewegung explorierte, die anfangs schlechter erschienen, bevor es den richtigen Pfad fand. Dies deutet darauf hin, dass der Roboter wirklich lernte, sich anzupassen, anstatt nur eine feste Bewegungsabfolge auswendig zu lernen. Die Forscher stellten jedoch auch die Grenzen ihres Ansatzes fest. Die Fähigkeit des Roboters zu lernen, ist weiterhin an die Qualität seines ursprünglichen vortrainierten Gehirns gebunden. Wenn der Basisroboter bei einer Aufgabe grundlegend verwirrt ist, reichen die kleinen Anpassungen, die dieses Lernsystem vornimmt, möglicherweise nicht aus, um das Problem zu beheben. Zudem setzt das System voraus, dass die Berechnungen des Roboters innerhalb eines strengen Zeitlimits abgeschlossen werden; wenn der Computer zu langsam wird, kann die zeitliche Abstimmung der Bewegungen aus dem Takt geraten, was den gesamten Prozess destabilisiert.
Letztendlich zeigt diese Arbeit, dass für Roboter, die im realen Leben wirklich nützlich sein sollen, ihre Lernalgorithmen der chaotischen, überlappenden Realität ihres Bewegungsablaufs entsprechen müssen. Indem die Forscher den Roboter lehrten, sich nur auf die Aktionen zu konzentrieren, die er tatsächlich abgeschlossen hat, und die jenen zu ignorieren, die er verworfen hat, haben sie einen Weg geschaffen, damit Maschinen komplexe Hochgeschwindigkeitsaufgaben lernen können, ohne die dafür erforderliche Geschmeidigkeit zu opfern. Das Ergebnis ist ein Roboter, der werfen, abdecken und schneiden kann – mit einer Zuverlässigkeit und Fluidität, die zuvor unerreichbar war, was beweist, dass der Schlüssel zu besserem Roboterlernen im Verständnis des präzisen Augenblicks liegt, in dem ein Plan zur Realität wird.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.