← Neueste Arbeiten
🤖 machine learning

Runtime-Incremental Transformer for Reinforcement-Learning-Based Adaptive Control

Dieses Paper führt einen zur Laufzeit inkrementellen Transformer-Mechanismus ein, der während des Reinforcement Learning basierend auf der kontextuellen Repräsentationskapazität und der Redundanz der Köpfe (Heads) Attention-Köpfe dynamisch wachsen lässt und beschneidet, wodurch katastrophale Ausfälle bei der langfristigen adaptiven Steuerung von Roboter-Manipulatoren mit nicht beobachtbarem Reibungsgedächtnis eliminiert und die Notwendigkeit einer kostspieligen Offline-Hyperparameter-Abstimmung entfernt wird.

Ursprüngliche Autoren: Giansalvo Cirrincione, Adriano Fagiolini

Veröffentlicht 2026-09-15
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Giansalvo Cirrincione, Adriano Fagiolini

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter, die sich mit Präzision bewegen, wie etwa die Arme, die in Fabriken zum Montieren von Autos oder zum Handhaben empfindlicher Materialien eingesetzt werden, verlassen sich auf komplexe Mathematik, um zu wissen, wie viel Kraft sie ausüben müssen. Seit Jahrzehnten nutzen Ingenieure eine Methode namens Computed-Torque-Regelung, die den exakten Druck oder Zug berechnet, der nötig ist, um ein Gelenk an eine gewünschte Stelle zu bewegen. Dies funktioniert gut, wenn die Bewegung des Roboters vorhersehbar ist, aber reale Maschinen stehen vor einem verborgenen Problem: der Reibung. Während einige Arten der Reibung einfach und konstant sind, hängen andere, wie das als Stribeck-Reibung bekannte Haftgleit-Verhalten, von einem verborgenen internen Zustand ab, der sich im Laufe der Zeit ändert. Da die Sensoren eines Roboters diesen verborgenen Zustand nicht direkt sehen können, verliert das System die Fähigkeit, sein eigenes zukünftiges Verhalten allein basierend auf seiner aktuellen Position vorherzusagen. Um dies zu lösen, haben Forscher die künstliche Intelligenz genutzt, speziell eine Form des Lernens namens Reinforcement Learning, bei dem ein Computerprogramm durch Versuch und Irrtum lernt. Diese Programme verwenden jedoch oft ein spezifisches architektonisches Merkmal namens Attention-Mechanismus, der wie ein Scheinwerfer wirkt und es der KI ermöglicht, sich auf verschiedene Teile ihrer jüngsten Vergangenheit zu konzentrieren. Die Anzahl dieser Scheinwerfer, oder „Heads“, ist normalerweise vor Beginn des Trainings festgelegt und wird durch einen langen und teuren Suchprozess ermittelt. Wenn die gewählte Anzahl zu klein ist, scheitert der Roboter beim Lernen; wenn sie zu groß ist, wird das System ineffizient.

Die Forscher hinter dieser Studie wollten diese Starrheit beheben, indem sie ein System schufen, das seinen eigenen Verstand während des Lernens ändern kann. Sie entwickelten eine neue Steuerung, die sich nicht vorab für eine Anzahl von Attention-Heads entscheidet. Stattdessen beobachtet sie ihre eigene Leistung während des Trainingsprozesses und fügt neue Heads hinzu, wenn sie sich von der Komplexität der Aufgabe überfordert fühlt, oder entfernt sie, wenn sie feststellt, dass einige nichts leisten. Dies geschieht in Echtzeit, ohne den Lernprozess zu unterbrechen. Das System nutzt zwei einfache Signale, um diese Entscheidungen zu treffen. Erstens misst es, wie viele neue Informationen aus der Historie des Roboters einfließen; wenn die Informationen zu komplex für die aktuelle Anzahl der Heads sind, wächst das System einen neuen dazu. Zweitens prüft es, wie viel jeder Head zur endgültigen Entscheidung beiträgt; wenn ein Head kaum Arbeit leistet, entfernt das System ihn diskret. Entscheidend ist, dass die Forscher das System so konzipiert haben, dass das Hinzufügen oder Entfernen eines Heads keinen plötzlichen Sprung oder Fehler im Verhalten des Roboters verursacht. Wenn ein neuer Head hinzugefügt wird, beginnt er mit null Einfluss, was sicherstellt, dass die Bewegung des Roboters glatt bleibt. Wenn ein Head entfernt wird, ist die Änderung so geringfügig, dass sie den Lernprozess nicht stört.

Das Team testete diesen Ansatz an einem simulierten, zwei-gelenkigen Roboterarm, der verschiedenen Ebenen von Reibungsgedächtnis gegenüberstand, die von kurzfristigen bis zu langfristigen Verzögerungen reichten. In früheren Experimenten mit einer festen Anzahl von Heads versagte das System in den schwierigsten Szenarien mit langem Gedächtnis vollständig und führte oft dazu, dass der Roboter die Kontrolle verlor oder das Gewicht, das er trug, ignorierte. Mit dem neuen, zur Laufzeit anpassbaren System war der Roboter in jedem einzelnen Test erfolgreich, selbst in den schwierigen Fällen, in denen die alte Methode versagte. Die Forscher fanden heraus, dass das System keine spezifische, der Aufgabe inhärente „natürliche“ Anzahl an Heads entdeckte; stattdessen erreichte es in jedem Durchlauf der Hauptkampagne die maximale Anzahl an Heads, und der Prune-Trigger (Lösch-Auslöser) wurde nie aktiviert, um ungenutzte Heads zu entfernen. Interessanterweise kam der Vorteil nicht von der Endgröße des Systems, sondern von der Art und Weise, wie es wuchs. Der schrittweise Prozess des Hinzufügens von Heads wirkte wie ein Trainingslehrplan, der dem Roboter half, Schritt für Schritt zu lernen, anstatt ihn direkt einer komplexen Aufgabe auszusetzen. Dies deutet darauf hin, dass die Fähigkeit, die Architektur während des Lernens anzupassen, wichtiger ist als eine massive, vorgefertigte Struktur. Das Ergebnis ist eine robustere und effizientere Methode, um Roboter zu lehren, mit der unordentlichen, unvorhersehbaren Reibung der realen Welt umzugehen, wodurch die Notwendigkeit kostspieliger Versuch-und-Irrtum-Suchen zur Ermittlung der richtigen Einstellungen vor der ersten Bewegung des Roboters entfällt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →