WholeBodyWAM: Learning Whole-Body World Action Models with Scalable Motion Priors
Das Paper stellt WholeBodyWAM vor, ein humanoides Welt-Aktions-Modell, das einen groß angelegten, heterogenen Bewegungs-Korpus (UniMotion-4K) nutzt, um einen übertragbaren Bewegungs-Prior vorzutrainieren, was die Dateneffizienz und die nachgelagerte Manipulationsleistung signifikant verbessert, wenn es über asymmetrische Mixture-of-Transformers-Attention mit Video- und Aktions-Experten integriert wird.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Um einen Roboter zu bauen, der sich wie ein Mensch bewegt, stehen Ingenieure vor einem grundlegenden Problem: Es ist unglaublich schwierig, einer Maschine beizubringen, ihren gesamten Körper zu koordinieren. Ein Mensch denkt nicht darüber nach, jeden einzelnen Muskel zu bewegen, wenn er nach einem Becher greift oder einen Raum durchquert; der Körper bewegt sich als eine einzige, fließende Einheit. Für Roboter hingegen muss jedoch jedes Gelenk und jedes Gliedmaß separat angesteuert werden, und das Sammeln der Millionen Stunden an Übungsdaten, die nötig sind, um einem spezifischen Roboter diese Fähigkeit beizubringen, ist langsam, teuer und oft unmöglich. Während Wissenschaftler zwar leistungsfähige Modelle entwickelt haben, die Sprache verstehen und die Welt sehen können, haben diese Systeme oft Schwierigkeiten vorherzusagen, wie sich der Körper eines Roboters in der Zukunft bewegen wird, und verlassen sich statlich darauf, auf das zu reagieren, was gerade geschieht. Diese Einschränkung macht es schwierig für Roboter, komplexe Aufgaben auszuführen, die eine Vorausplanung erfordern, wie etwa das Tragen eines schweren Kartons beim Navigieren über unebenen Boden oder das Knien, um ein Objekt aufzuheben, ohne das Gleichgewicht zu verlieren.
Ein Forschungsteam hat diese Herausforderung bewältigt, indem es einem Roboter beigebracht hat, aus der riesigen, kostenlosen Bibliothek menschlicher Bewegungen im Internet zu lernen, anstatt sich ausschließlich auf teure Demonstrationen des Roboters selbst zu verlassen. Sie entwickelten ein neues System namens WHOLEBODYWAM, das als prädiktive Engine für den Körper des Roboters fungiert. Anstatt nur ein Video anzusehen und zu raten, was als Nächstes zu tun ist, lernt dieses System die zugrunde liegende Physik der Bewegungen von Körpern über die Zeit hinweg. Es wurde auf einer massiven Sammlung von Bewegungsdaten namens UniMotion-4K trainiert, die über 4.100 Stunden Bewegungsdaten umfasst, die aus menschlichen Videos, spezialisierten 3D-Motion-Capture-Datensätzen und anderen humanoiden Robotern aufgezeichnet wurden. Durch die Umwandlung all dieser verschiedenen Quellen in eine einzige, gemeinsame Sprache der Bewegung lernte das System eine allgemeine „Intuition“ dafür, wie ein Körper von einer Pose zur nächsten übergehen sollte. Diese Intuition wurde dann auf einen echten humanoiden Roboter übertragen, was es ihm ermöglichte, seine eigenen zukünftigen Bewegungen vorherzusehen und komplexe Ganzkörperaufgaben mit weitaus größerem Geschick und einer höheren Effizienz als bisherige Methoden auszuführen.
Der Kern dieser Arbeit liegt in einem zweistufigen Trainingsprozess, der das Lernen der allgemeinen Bewegungsregeln vom Lernen der Anwendung auf eine spezifische Maschine trennt. In der ersten Phase studierte das System den massiven Datensatz menschlicher und robotischer Bewegungen, ohne jemals ein einziges Beispiel der tatsächlichen Befehle des Zielroboters gesehen zu zu haben. Es lernte, vorherzusagen, was ein Körper als Nächstes tun würde, basierend auf einer einfachen Textbeschreibung einer Aufgabe, wie zum Beispiel „hebe das Spielzeug auf“ oder „kniee nieder“. Dies schuf ein leistungsstarkes Fundament, einen prädiktiven Prior, der den koordinierten Tanz von Gliedmaßen und das Gleichgewicht verstand, die für eine menschenähnliche Bewegung erforderlich sind. In der zweiten Phase wurde dieses vortrainierte Wissen mit einem Video-Verständnismodul und einem Aktionsgenerator kombiniert. Dem System wurden dann eine geringe Anzahl von Demonstrationen des spezifischen Roboters, des TianGong 3.0, gezeigt, um zu lernen, wie es sein allgemeines Verständnis von Bewegung in die spezifischen Motorbefehle übersetzt, die die Gelenke dieses Roboters ausführen müssen. Entscheidend ist, dass das System nicht nur auf die aktuelle Szene reagiert; es nutzt sein gelerntes Wissen, um sich den zukünftigen Zustand seines eigenen Körpers vorzustellen, und nutzt diese Vorhersage, um seine Handlungen in Echtzeit zu steuern.
Bei Tests in sechs schwierigen realen Aufgaben waren die Ergebnisse beeindruckend. Der Roboter wurde gebeten, Aktionen auszuführen wie das Aufheben von Spielzeug, das Beladen einer Waschmaschine mit Wäsche, das Übertragen eines Kissens auf ein Sofa und das Tragen eines Kartons zu einem Tisch. Diese Aufgaben erforderten, dass der Roboter gleichzeitig bückt, geht, kniet und Objekte manipuliert. Das neue System übertraf die besten existierenden Methoden und erreichte eine Erfolgsquote, die bei allen Aufgaben signifikant höher war. Beispielsweise erreichte es bei der Aufgabe des Kartentransfers, bei der der Roboter einen Karton heben, zu einem Seitentisch gehen und ihn dort absetzen musste, eine Erfolgsquote von 73,3 %, verglichen mit wesentlich niedrigeren Raten bei anderen Ansätzen. Die Forscher fanden heraus, dass der Roboter umso besser performte, je mehr Bewegungsdaten sie für das anfängliche Training des „Bewegungsexperten“ verwendeten, was darauf hindeutet, dass das System eine skalierbare Fähigkeit lernte und nicht bloß spezifische Beispiele auswendig lernte. Noch wichtiger war, dass das System sehr effizient mit Daten umging; als die Forscher die Menge der spezifischen Roboter-Demonstrationen, die für das Training zur Verfügung standen, um die Hälfte reduzierten, performte der Roboter, der auf dem massiven Bewegungsdatensatz vortrainiert worden war, immer noch besser als andere Roboter, die auf dem vollen Satz an Demonstrationen trainiert wurden.
Dieser Ansatz zeigte auch eine bemerkenswerte Fähigkeit, mit Veränderungen in der Umgebung umzugehen. Als die Forscher den Zielkorb leicht bewegten oder die Farbe und Form des Spielzeugs änderten, das der Roboter aufheben sollte, passte sich das System schnell an und behielt eine hohe Leistungsfähigkeit bei, während andere Modelle Schwierigkeiten hatten. Das System erreichte dies, ohne ein Video der Zukunft generieren zu müssen, was rechenintensiv und langsam gewesen wäre. Stattdessen sagte es die zukünftigen Positionen seiner eigenen Gelenke direkt voraus, was es ihm ermöglichte, Entscheidungen in etwa 363 Millisekunden zu treffen – eine Geschwindigkeit, die schnell genug für die Echtzeitsteuerung ist. Die Studie bestätigt, dass ein Roboter menschliche Bewegungen zwar nicht einfach kopieren kann, weil sein Körper anders ist, aber von den unzähligen Mustern menschlicher Bewegung lernen kann, um ein robustes, prädiktives Verständnis dafür zu entwickeln, wie er seinen eigenen Körper bewegt. Durch die Nutzung der Fülle an menschlichen Bewegungsdaten in der Welt bietet diese Methode einen neuen Weg zur Schaffung humanoider Roboter, die nicht nur in der Lage sind, komplexe Aufgaben zu bewältigen, sondern auch, diese mit weit weniger Demonstrationen zu erlernen, als bisher angenommen wurde.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.