← Neueste Arbeiten
💻 computer science

Closing the Loop on the Poppy Humanoid: Bipedal Locomotion with Linear-Quadratic Control and Learned Cost Functions

Dieses Paper präsentiert einen Closed-Loop-Gangregler für den Poppy-Humanoiden, der einen LQR-Rahmen (Linear-Quadratic Regulator) mit einer gelernten Kostenfunktion nutzt, um eine zuverlässige, unassistierte bipede Lokomotion zu erreichen und dabei statistisch signifikante Leistungssteigerungen gegenüber der Open-Loop-Trajektorien-Wiedergabe zu demonstrieren.

Ursprüngliche Autoren: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

Veröffentlicht 2026-08-28
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xulin Chen, Borui He, Ruipeng Liu, Naveed Tahir, Zhenyu Gan, Garrett E. Katz

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das Gehen ist eine Leistung ständiger, unsichtbarer Kalkulation. Für einen Menschen ist es ein nahtloser Fluss des Gleichgewichts, bei dem das Gehirn und der Körper jede Sekunde tausende Mikroanpassungen vornehmen, um uns aufrecht zu halten. Für einen Roboter ist dieselbe Aufgabe ein prekärer Drahtseilakt. Die Herausforderung besteht nicht nur darin, die Beine zu bewegen, sondern dies zu tun, ohne umzukippen – insbesondere, wenn die Maschine aus leichten, preiswerten Teilen gebaut ist, die nicht über die perfekten Sensoren oder leistungsstarken Motoren eines hochmodernen Industrieroboters verfügen. Dies ist das spezifische Rätsel, vor dem Forscher stehen, die mit dem Poppy Humanoid arbeiten, einem kleinen, Open-Source-Roboter, der für Bildung und Forschung entwickelt wurde. Obwohl der Poppy eine zugängliche Plattform zum Lernen über künstliche Intelligenz ist, hatte er historisch gesehen Schwierigkeiten, von selbst zu gehen. Ohne ständige menschliche Hilfe, um ihn zu stabilisieren, würde der Roboter schnell das Gleichgewicht verlieren und fallen, was seinen Nutzen auf eine Demonstration im Klassenzimmer statt auf eine echte autonome Maschine beschränken würde.

Die Kernschwierigkeit liegt in der Hardware des Roboters. Er besteht aus 3D-gedruckten Kunststoffgliedmaßen und verlässt sich auf Motoren, denen man lediglich sagen kann, wohin sie zeigen sollen, nicht aber, wie viel Kraft sie ausüben sollen. Zudem fehlt dem Roboter die Hochgeschwindigkeitssensorik, die in teureren Maschinen zu finden ist, was bedeutet, dass er nicht in Echtzeit „fühlen“ kann, wie er einen Schritt vollzieht. Frühere Versuche, den Poppy zum Gehen zu bringen, beinhalteten das Abspielen einer voraufgezeichneten Bewegungssequenz, vergleichbar mit einer Tonbandaufnahme. Dieser Open-Loop-Ansatz funktionierte nur, wenn der Boden perfekt war und der Roboter in einer perfekten Position startete. In dem Moment, als ein winziger Fehler auftrat – ein leichtes Wackeln oder ein Rutschen – hatte der Roboter keine Möglichkeit zur Korrektur, und der Fehler summierte sich auf, bis der Roboter fiel. Die Frage, vor der die Forscher standen, war, ob es möglich sei, dieser fragilen, kostengünstigen Maschine beizubringen, sich aus ihren eigenen Fehlern zu erholen und zuverlässig ohne menschliches Eingreifen zu gehen.

Ein Team von Forschern der Syracuse University setzte sich zum Ziel, dies zu lösen, indem sie dem Poppy eine einfache Form der Selbstkorrektur gaben. Anstatt nur ein festes Skript abzuspielen, entwickelten sie ein System, das die Gelenke des Roboters in Echtzeit beobachtet und winzige, sofortige Anpassungen vornimmt, um ihn auf Kurs zu halten. Sie begannen damit, hunderte von Gehversuchen aufzuzeichnen, von denen einige erfolgreich waren und viele in einem Sturz endeten. Durch die Analyse der Unterschiede zwischen den Bewegungen, die funktionierten, und denen, die scheiterten, brachten sie einem Computerprogramm bei, die frühen Anzeichen eines Stolperns zu erkennen. Das Programm lernte eine Reihe von Regeln, die jeder möglichen Bewegung einen „Kostenwert“ zuordneten, wobei ein hoher Kostenwert ein hohes Sturzrisiko bedeutete. Es nutzte diese Regeln dann, um die bestmögliche kleine Korrektur in jedem Moment zu berechnen, wodurch es effektiv ein Sicherheitsnetz schuf, das der Roboter nutzen konnte, um aufrecht zu bleiben.

Die Ergebnisse dieses Ansatzes waren beeindruckend. Als die Forscher den Roboter in einer Standard-Büroumgebung testeten, erlaubte die alte Methode des Abspielens eines festen Skripts dem Roboter, durchschnittlich etwas mehr als vier Schritte zu gehen, bevor er fiel. Mit dem neuen, selbstkorrigierenden System schaffte der Roboter es, signifikant weiter zu gehen, wobei er im Durchschnitt mehr als fünf Schritte vor einem Sturz bewältigte, und er schaffte es in fast 80 Prozent der Versuche, die vollständige Sechs-Schritte-Sequenz zu vollenden. Die Verbesserung war noch deutlicher, als die Forscher den Roboter in einem anderen Raum mit einem glatten Boden testeten, einer Oberfläche, die er noch nie gesehen hatte. In dieser neuen Umgebung sank die Erfolgsquote der alten Methode auf 30 Prozent, aber das neue System erreichte dennoch in 42,5 Prozent der Fälle einen Erfolg. Dies demonstrierte, dass der Roboter nicht nur einen spezifischen Pfad auswendig lernte, sondern die allgemeine Fähigkeit erworben hatte, sich selbst gegenüber verschiedenen Bedingungen auszubalancieren.

Der Schlüssel zu diesem Erfolg war nicht ein komplexes neues Gehirn, sondern eine verfeinerte Art der Nutzung der Daten, die der Roboter bereits generiert. Die Forscher mussten weder neue Sensoren bauen noch das physische Design des Roboters ändern. Stattdessen nutzten sie einen mathematischen Rahmen, der als Linear-Quadratic-Regulator bekannt ist – eine Methode, um den effizientesten Weg zu einem Ziel zu finden und gleichzeitig Fehler zu minimieren. Indem sie das System mit Daten aus den eigenen Fehlversuchen des Roboters fütterten, konnten sie ihm beibringen, welche Abweichungen vom geplanten Pfad gefährlich waren. Das System lernte, Bewegungen zu bestrafen, die danach aussah, als würden sie zu einem Sturz führen, und steuerte den Roboter zurück zu einem stabilen Zentrum. Dies ermöglichte es dem Roboter, kleine Erschütterungen und Wackler abzufangen, die zuvor zum Kollaps geführt hätten, und verwandelte eine starre, spröde Maschine in eine, die in der Lage ist, sich an die reale Welt anzupassen.

Diese Arbeit stellt einen bedeutenden Fortschritt für die erschwingliche Robotik dar. Sie beweist, dass selbst ein Roboter, der aus billigen Standardteilen mit begrenzter Sensorik gebaut ist, eine zuverlässige, autonome Bewegung erreichen kann, wenn er mit der richtigen Art des Lernens ausgestattet ist. Die Forscher zeigten, dass durch die Kombination einer einfachen Steuerungsstrategie mit datengestütztem Lernen die Lücke zwischen einem Roboter, der eine menschliche Hand zur Unterstützung benötigt, und einem, der von selbst gehen kann, geschlossen werden kann. Obwohl sich der Roboter noch langsam bewegt und noch keine komplexen Aufgaben wie das Drehen oder das Gehen mit Geschwindigkeit meistert, ist die Fähigkeit, ohne zu fallen zu gehen, eine grundlegende Voraussetzung für jede zukünftige Anwendung. Die Studie bestätigt, dass mit der richtigen Software die Einschränkungen kostengünstiger Hardware überwunden werden können, was die Tür für zugänglichere und fähigere Roboter in Forschung und Bildung öffnet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →