Simultaneous Online System Identification and Control using Composite Adaptive Lyapunov-Based Deep Neural Networks
Dieser Beitrag stellt ein neuartiges Regelungsframework vor, das durch den Einsatz zusammengesetzter adaptiver, auf Lyapunov-Funktionen basierender Aktualisierungsgesetze für alle Schichten eines tiefen neuronalen Netzwerks gleichzeitig die Online-Systemidentifikation und die Trajektorienverfolgung für unsichere nichtlineare Systeme erreicht, wodurch die gleichmäßige endgültige Beschränktheit und exponentielle Konvergenz von Fehlern garantiert wird und gleichzeitig eine robuste Leistung bei intermittierendem Verlust von Zustandsrückführungen ermöglicht wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie lehren einen Roboter, auf einem Seil zu laufen. Der Roboter verfügt über ein „Gehirn" (ein tiefes neuronales Netzwerk, kurz DNN), das versucht vorherzusagen, wie Wind und Schwerkraft ihn beeinflussen werden, damit er sein Gleichgewicht anpassen kann.
Das Problem mit dem alten Weg
Traditionell würden Ingenieure dieses Roboterhirn offline unterrichten. Sie würden Tausende von Simulationen durchführen, den Roboter lernen lassen und dann sein Gehirn einfrieren. Sobald der Roboter beginnt, das echte Seil zu laufen, kann sein Gehirn nichts Neues mehr lernen. Wenn sich der Wind unerwartet ändert, könnte der Roboter fallen, weil sein eingefrorenes Gehirn nicht weiß, wie es sich anpassen soll.
Einige neuere Methoden lassen den Roboter während des Laufens lernen. Diese Methoden kümmern sich jedoch nur um eine Sache: auf dem Seil zu bleiben. Sie justieren die internen Einstellungen des Gehirns gerade so weit, dass der Roboter nicht fällt, aber sie lehren dem Gehirn nicht wirklich, was der Wind tut. Der Roboter mag zwar aufrecht bleiben, aber er versteht die Physik der Situation nicht wirklich. Wenn der Roboter für einen Moment seine Gleichgewichtssensoren verliert (wie bei einem plötzlichen Stromausfall), hat er keine Ahnung, wie er den Wind vorhersagen und weitermachen soll.
Die neue Lösung: Das „Zweikampf-Gehirn"
Diese Arbeit stellt eine neue Methode vor, bei der der Roboter zwei Dinge gleichzeitig lernt:
- Wie man auf dem Seil bleibt (Verfolgungsregelung).
- Wie der Wind tatsächlich funktioniert (Systemidentifikation).
Stellen Sie sich das wie einen Schüler vor, der eine Prüfung schreibt.
- Alte Methode: Der Schüler merkt sich nur die Antworten auf die spezifischen Fragen der Prüfung. Wenn der Lehrer eine leicht andere Frage stellt, fällt der Schüler durch.
- Methode dieser Arbeit: Der Schüler beantwortet nicht nur die Prüfungsfragen korrekt, sondern schreibt auch einen detaillierten Lernzettel auf, der erklärt, warum die Antworten so sind, wie sie sind. Wenn der Lehrer später eine neue Frage stellt, kann der Schüler seinen Lernzettel nutzen, um sie zu lösen.
Wie es funktioniert (Die Analogie)
Die Autoren haben eine spezielle „Lernregel" (ein Adaptionsgesetz) entwickelt, die wie ein Doppel-Check-System funktioniert:
- Der „Jetzt"-Check (Verfolgungsfehler): Der Roboter betrachtet, wo er ist, versus wo er sein sollte. Wenn er abdriftet, passt er sein Gehirn an, um den Pfad zu korrigieren. Dies ist die Standardmethode.
- Der „Was-wäre-wenn"-Check (Vorhersagefehler): Dies ist der magische Teil. Der Roboter verfügt über einen speziellen „Beobachter" (wie ein zweites Augenpaar), der versucht, welche Windkraft sein sollte, basierend auf der Bewegung des Roboters, zu erraten. Er vergleicht diese Schätzung mit dem, was das Gehirn des Roboters vorhergesagt hat, was der Wind sein würde.
- Wenn die Schätzung des Gehirns falsch ist, korrigiert der Roboter nicht nur den Pfad; er schreibt die internen Regeln des Gehirns um, um die Schätzung für die Zukunft genauer zu machen.
Durch die Kombination dieser beiden Checks wird das Gehirn des Roboters zu einem wahren Experten. Es lernt die tatsächliche Physik des Systems, nicht nur, wie man sich durch das Aufrechtbleiben hindurchschummelt.
Die „Taschenlampen"-Anforderung (Persistenz der Erregung)
Die Arbeit erwähnt eine Bedingung namens „Persistenz der Erregung" (PE). Stellen Sie sich vor, Sie versuchen, die Form eines dunklen Raums zu lernen. Wenn Sie nur in einer geraden Linie laufen, lernen Sie nur den Boden direkt vor sich kennen. Um den ganzen Raum zu lernen, müssen Sie sich bewegen, die Wände berühren und in verschiedene Richtungen schauen.
- PE bedeutet, dass der Roboter sich ausreichend bewegen muss (nicht nur stillstehen oder in einer langweiligen Schleife laufen), damit das Gehirn genügend „Daten" erhält, um das vollständige Bild von Wind und Schwerkraft zu lernen. Wenn der Roboter sich ausreichend bewegt, wird das Lernen unglaublich schnell und präzise.
Die Superkraft: Überleben bei Stromausfällen
Der größte Gewinn dieser Methode ist das, was passiert, wenn der Roboter seine Sensoren verliert (die „Seil"-Sensoren erlöschen).
- Alte Methoden: Wenn die Sensoren ausfallen, gerät der Roboter in Panik. Er kennt den Wind nicht, also fällt er.
- Diese Methode: Da das Gehirn des Roboters bereits den „Lernzettel" (die Systemidentifikation) gelernt hat, kann es vorhersagen, was der Wind tun wird, selbst ohne Sensoren. Es nutzt sein gelerntes Modell, um weiterzugehen, bis die Sensoren wieder online sind.
Die Ergebnisse
Die Autoren testeten dies an zwei Dingen: einem Roboterarm (wie ein Fabrikroboter) und einem Unterwasserfahrzeug.
- Genauigkeit: Die neue Methode hielt den Roboter viel besser auf seinem Pfad als die alten Methoden.
- Verständnis: Das Gehirn des Roboters lernte die Physik des Systems viel genauer.
- Widerstandsfähigkeit: Als die Sensoren abgeschaltet wurden (simulierter Stromausfall), hielt die neue Methode den Roboter stabil, während die alten Methoden Schwierigkeiten hatten oder versagten.
Zusammenfassung
Diese Arbeit gibt Robotern ein Gehirn, das nicht nur auf Fehler reagiert; es lernt die Regeln des Spiels, während es spielt. Dies ermöglicht es dem Roboter, besser zu performen, seine Umgebung tiefgreifend zu verstehen und weiterzuarbeiten, selbst wenn es seine Sinne vorübergehend verliert.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.