Learning Options for Compositional Motor Control with Adapter Banks
Dieses Paper schlägt eine neuartige Architektur vor, die einen gemeinsamen rekurrenten Kern verwendet, der durch eine Bank von Residual-Adaptern moduliert wird, um flexible motorische Primitive als emergente Niedrigrang-Perturbationen zu erlernen, wodurch eine eingefrorene High-Level-Policy diese Adapter sequenzieren kann, was im Vergleich zu Multitask-Baselines zu einer überlegenen Generalisierung auf neue motorische Sequenzen führt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung eines Preprints, das nicht peer-reviewed wurde. Dies ist kein medizinischer Rat. Treffen Sie keine Gesundheitsentscheidungen auf Grundlage dieses Inhalts. Vollständigen Haftungsausschluss lesen
Geschickte Bewegung, von den fließenden Skalen eines Pianisten bis hin zum komplexen Sprung einer Turnerin, beruht auf einer verborgenen Fähigkeit: Das Gehirn lernt nicht jede neue Bewegung von Grund auf neu. Stattdessen baut es eine Bibliothek aus wiederverwendbaren Bausteinen oder Primitiven auf, die gemischt, kombiniert und umgestaltet werden können, um endlose neue Handlungen zu erzeugen. Diese Fähigkeit, eine endliche Menge von Fertigkeiten zu neuartigen Sequenzen zu rekombinieren, ist ein Kennzeichen menschlicher Geschicklichkeit. Jahrzehntelang haben Wissenschaftler versucht, künstlichen Agenten dieselbe Flexibilität beizubringen, in der Hoffnung, Roboter zu erschaffen, die sich an neue Aufgaben anpassen können, ohne dafür von Grund auf neu trainiert werden zu müssen. Die Herausforderung bestand darin, einen Weg zu finden, wie ein Lernsystem diese Bausteine selbstständig entdecken und dann kombinieren kann, ohne dass die alten Fertigkeiten mit den neuen interferieren. Jüngste Theorien der Neurowissenschaft deuten darauf an, dass das Gehen dies lösen könnte, indem es ein gemeinsames Netzwerk von Neuronen nutzt, das durch verschiedene Inputs leicht modifiziert wird, was es derselben Kernmechanik ermöglicht, sehr unterschiedliche Verhaltensweisen hervorzubringen.
Eine neue Studie von Forschern der Columbia University und der New York University erweckt diese biologische Theorie in einem Computermodell zum Leben und demonstriert, wie ein künstliches System lernen kann, komplexe Bewegungen von Grund auf zu komponieren. Das Team erschuf ein digitales Gehirn, das darauf ausgelegt ist, einen simulierten, zwei-gelenkigen Arm mit sechs Muskeln zu steuern, ganz ähnlich einem menschlichen Gliedmaß. Sie baten dieses System, eine Vielzahl von Bewegungen zu erlernen, darunter das Ausstrecken in einer geraden Linie, das Bewegen in Kreisen und das Nachzeichnen von Achter-Schleifen-Mustern. Anstatt lediglich diese Pfade auswendig zu lernen, wollten die Forscher, dass das System die zugrunde liegenden Bestandteile jeder Bewegung entdeckt und lernt, wie es diese zusammenfügt, um Aufgaben auszuführen, die es zuvor noch nie gesehen hat. Um dies zu erreichen, entwickelten sie eine Architektur, die von der Verbindung zwischen dem motorischen Kortex des Gehirns und dem Thalamus inspiriert ist – einer tiefen Hirnstruktur, die dabei hilft, zwischen verschiedenen motorischen Programmen auszuwählen und zu wechseln.
Die Forscher entwarfen ein System mit einem gemeinsamen „Kern“-Netzwerk, das die grundlegende Mechanik der Bewegung handhabt, ähnlich dem motorischen Kortex. An diesen Kern schlossen sie eine Bank spezialisierter Module, oder Adapter an, die wie kleine, verstellbare Regler wirken, die das Verhalten des Kerns feinjustieren können. Im Gehirn würden diese Adapter Signalen entsprechen, die den motorischen Kortex leicht verändern, um eine spezifische Bewegung zu erzeugen. Die Forscher programmierten das System nicht darauf, zu wissen, wann welcher Adapter zu verwenden ist; stattdessen ließen sie das System lernen, das richtige Modul zu identifizieren und auszuwählen, indem es einem Experten-Lehrer bei der Ausführung der Aufgaben zusah. Der Lehrer war ein separates, vorab trainiertes Netzwerk, das genau wusste, welcher Regel für jede Bewegung zu folgen war. Das Schüler-System hingegen musste herausfinden, wie es die Aktionen des Lehrers in Segmente zerlegt und entscheidet, welchen Adapter es zu welchem Zeitpunkt aktiviert, und das alles, ohne die Regeln explizit vorgegeben zu bekommen.
Während das Schüler-System an diesen zusammengesetzten Bewegungen trainierte, geschah etwas Bemerkenswertes. Obwohl die Adapter so gebaut waren, dass sie vollkommen flexibel und komplex sind, lernte das System ganz natürlich, sie als einfache, niedrigrangige Anpassungen zu nutzen. In einfachen Worten ausgedrückt: Das System entdeckte, dass es nicht das gesamte Gehirn für jede neue Aufgabe neu schreiben musste; es musste lediglich kleine, präzise Feinabstimmungen am gemeinsamen Kern vornehmen. Dies ermöglichte es dem System, die verschiedenen Bewegungen in distinkte, getrennte Räume innerhalb seines internen Zustands zu faktorisieren. Während das Lehrer-Netzwerk, das auf expliziten Regel-Inputs basierte, alle seine Aufgabenrepräsentationen in einem einzigen gemeinsamen Raum miteinander verflochten hielt, organisierte das Schüler-System sie in hochgradig getrennten Zonen. Jede Bewegungsart, wie etwa ein gerades Ausstrecken oder ein kreisförmiger Bogen, besetzte nun eine eigene, klar abgegrenzte Ecke in der internen Landschaft des Systems, was den Wechsel zwischen ihnen ohne Verwirrung erheblich erleichterte.
Der wahre Test dieses Ansatzes kam, als die Forscher das System aufforderten, eine völlig neue Aufgabe auszuführen: eine Zwei-Blütenblatt-Trajektorie, die Teile der gelernten Bewegungen auf eine Weise kombinierte, wie sie zuvor noch nie gesehen worden war. Dieser neue Pfad erforderte das Zusammenfügen einer geraden Streckung mit einer gekrümmten Retraktion (Einziehung) und anschließend einer gekrümmten Streckung mit einer geraden Retraktion, wodurch eine Diskontinuität entstand, die weder der Schüler noch der Lehrer zuvor geübt hatten. Die Forscher frierten die internen Netzwerke beider Systeme ein und versuchten, die beste Art und Weise zu finden, die verfügbaren Bausteine zu sequenzieren, um das neue Ziel zu erreichen. Das Schüler-System mit seiner getrennten und modularen Architektur war erfolgreich und verfolgte den neuen Pfad mit hoher Präzision mit einem Fehler von etwa 0,005 Metern. Das Lehrer-System, das auf seinem verflochtenen Single-Subspace-Ansatz basierte, hatte hingegen große Schwierigkeiten und stagnierte bei einem zehnmal größeren Fehler.
Die Ergebnisse legen nahe, dass der Schlüssel zu flexibler motorischer Kontrolle nicht nur in einem gemeinsamen Netzwerk liegt, sondern darin, dass dieses Netzwerk durch distinkte, niedrigrangige Anpassungen moduliert wird, die verschiedene Aufgaben in separaten internen Räumen halten. Diese geometrische Trennung ermöglicht es dem System, seine gelernten Primitiven zu mischen und zu kombinieren, um neuartige Probleme zu lösen, ohne die Interferenz, die das künstliche Lernen üblicherweise plagt. Die Studie liefert einen konkreten Beweis dafür, dass eine vom Gehirn inspirierte thalamokortikale Schleifen-Architektur lernen kann, ihre eigenen wiederverwendbaren Bausteine zu entdecken und sie zu rekombinieren, um mit Out-of-Distribution-Herausforderungen umzugehen. Indem sie zeigt, dass ein System sein Verhalten in distinkte Subspaces faktorisieren kann, bietet die Forschung einen vielversprechenden Weg zur Schaffung von Maschinen, die sich mit der gleichen Leichtigkeit und Kreativität wie ein menschlicher Athlet an neue physische Aufgaben anpassen können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.