← Neueste Arbeiten
💻 computer science

MotionWAM: Towards Foundation World Action Models for Real-Time Humanoid Loco-Manipulation

MotionWAM ist ein Echtzeit-Foundation-World-Action-Modell, das die Ganzkörper-Lokomotions-Manipulation für humanoide Roboter durch die Nutzung von intermediären Videodenoising-Features zur Vorhersage koordinierter Bewegungs-Token vereinheitlicht, wodurch es die Geschwindigkeits- und Konsistenzbeschränkungen traditioneller hierarchischer Policies überwindet und Vision-Language-Action-Baselines bei komplexen Aufgaben signifikant übertrifft.

Ursprüngliche Autoren: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

Veröffentlicht 2026-06-09
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jia Zheng, Teli Ma, Yudong Fan, Zifan Wang, Shuo Yang, Junwei Liang

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie bringen einem Roboter bei, ein menschenähnlicher Helfer zu sein. Normalerweise bringen wir Robotern zwei separate Schritte bei: Zuerst bringen wir ihrem „Gehirn“ (dem Oberkörper) bei, wie man Dinge greift, und dann bringen wir ihren „Beinen“ (dem Unterkörper) bei, wie man geht und das Gleichgewicht hält. Das Problem ist, dass diese beiden Teile nicht gut miteinander kommunizieren. Das Gehirn sagt: „Greif die Tasse“, und die Beine sagen nur: „Okay, ich gehe vorwärts, damit du nicht umkippst.“ Sie können keine Dinge tun wie einen Ball treten oder auf ein Pedal treten, weil die Beine nur für „Balance-Aufgaben“ zugelassen sind.

MotionWAM ist ein neues Robotergehirn, das dies löst, indem es den gesamten Körper als ein einziges, koordiniertes Team behandelt. So funktioniert es, unter Verwendung einiger einfacher Analogien:

1. Der „Filmregisseur“ vs. der „Drehbuchautor“

Die meisten Robotergehirne sind wie Drehbuchautoren. Sie schauen sich ein Bild und einen Satz an (wie „hebe die Box auf“) und versuchen, den nächsten Schritt basierend auf dem zu erraten, was sie zuvor gesehen haben. Sie verstehen nicht wirklich, wie Physik funktioniert oder wie sich Dinge über die Zeit bewegen.

MotionWAM ist anders. Es ist wie ein Filmregisseur, der tausende Stunden Filme gesehen hat. Bevor es dem Roboter sagt, was er tun soll, führt es eine kurze „mentale Simulation“ dessen durch, wie die nächsten Sekunden des Films aussehen werden.

  • Der Trick: Anstatt darauf zu warten, dass die gesamte Filmszene vollständig gezeichnet ist (was zu lange dauert), betrachtet MotionWAM die Skizze der Szene, während sie gezeichnet wird. Es erfasst den „Vibe“ der zukünftigen Bewegung aus dieser Skizze und sagt dem Roboter sofort, wie er sich bewegen muss. Deshalb kann es schnell genug denken, um in Echtzeit zu agieren.

2. Die „Einheitliche Fernbedienung“

In alten Systemen hatte der Roboter zwei Fernbedienungen: eine für die Arme und eine für die Beine. Die Fernbedienung für die Beine war sehr einfach und konnte nur geradeaus gehen oder abbiegen.

  • Die Innovation von MotionWAM: Es verwendet eine einzige Fernbedienung für den gesamten Körper. Wenn der Roboter einen Fußball treten muss, ist der „Kick“-Befehl nicht nur für das Bein; es ist eine einzige Anweisung, die den Armen sagt, das Gleichgewicht zu halten, dem Oberkörper, sich zu lehnen, und dem Fuß, gleichzeitig zu schwingen. Dies ermöglicht es dem Roboter, Dinge wie auf ein Pedal zu treten oder einen Ball zu treten, was die alten „Zwei-Fernbedienungen-Systeme“ nicht konnten, da sie nicht verstanden, dass die Beine Teil der Aufgabe sein können und nicht nur für das Gleichgewicht zuständig sind.

3. Das „Drei-Stufen-Trainingslager“

Einen Roboter auf diese Weise zu trainieren, ist schwer, daher nutzten die Forscher ein dreistufiges Trainingslager:

  • Stufe 1 (Der Film-Liebhaber): Sie zeigten dem Roboter tausende Stunden Videomaterial aus der Sicht eines Menschen (wie eine GoPro am Kopf). Der Roboter lernte noch nicht zu sich selbst zu bewegen; er lernte lediglich, wie die Welt aussieht, wenn man sich durch sie hindurchbewegt. Er lernte die „Physik des Sehens“.
  • Stufe 2 (Der Übersetzer): Sie brachten dem Roboter bei, wie er diese Film-Fähigkeiten in tatsächliche Roboterbewegungen übersetzt. Sie nutzten Daten von verschiedenen Arten von Roboterkörpern, um sicherzustellen, dass der Roboter die allgemeine Idee von „Bewegung“ versteht, nicht nur eine spezifische Körperform.
  • Stufe 3 (Die Spezialeinheit): Schließlich gaben sie dem Roboter spezifische Übungsaufgaben (wie das Beladen eines Wagens oder das Abwischen einer Tafel) unter Anleitung eines menschlichen Bedieners mit VR-Brille. Hier lernte der Roboter, sein Wissen aus Filmen auf echte, schwierige Aufgaben anzuwenden.

Die Ergebnisse

Als sie MotionWAM bei neun schwierigen Aufgaben testeten (wie dem Treten eines Fußballs, dem Beladen eines Wagens oder dem Wäschewaschen), war es ein großer Erfolg:

  • Geschwindigkeit: Es denkt schnell genug, um in Echtzeit zu agieren (etwa fünfmal pro Sekunde), was notwendig ist, damit ein Roboter aufrecht bleibt, ohne umzukippen.
  • Erfolgsquote: Es war in 76 % der Aufgaben erfolgreich, während die besten bisherigen Robotergehirne nur etwa 44 % der Zeit erfolgreich waren.
  • Der „Kick“-Faktor: Der größte Gewinn lag bei Aufgaben, die eine Interaktion mit den Füßen erforderten. Die alten Roboter hätten versucht, um den Ball herumzugehen; MotionWAM hat ihn tatsächlich getreten.

Das Fazit

MotionWAM beweist, dass, wenn man einem Roboter ein „Filmregisseur“-Gehirn gibt, das versteht, wie sich die Welt bewegt, und man es zulässt, seinen ganzen Körper mit einem einheitlichen Plan zu steuern, er komplexe, menschenähnliche Aufgaben viel besser bewältigen kann als Roboter, die das Gehen und das Greifen als separate Probleme behandeln.

Einschränkungen: Das Paper merkt an, dass dies an einem spezifischen Robotermodell (dem Unitree G1) getestet wurde und dass der Roboter verwirrt sein und aufhören kann zu arbeiten, wenn er das Objekt, das er hält, aus den Augen verliert (da die Kamera am Kopf sitzt). Es wurde noch nicht an anderen Roboterkörpern getestet.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →