← Neueste Arbeiten
🤖 machine learning

Weave: Learning Whole-Body Dexterous Loco-Manipulation from Human-Object Interactions

Weave ist ein einheitliches Framework, das durch die Umwandlung von menschlichen Demonstrationen mittels kontaktbewusster Retargeting-Verfahren in ausführbare Referenzen und den Einsatz einer geometrie-bewussten Policy eine ganzkörperliche, geschickte Loco-Manipulation für humanoide Roboter erlernt, um hohe Erfolgsraten sowohl in trainierten als auch in ungesehenen Interaktionsszenarien zu erzielen.

Ursprüngliche Autoren: Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu

Veröffentlicht 2026-09-16
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Liu Cao, Xingze Wu, Jingzhi Cui, Botian Xu, Mingzhi Pei, Ruoqu Chen, Mengdi Xu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Um einen Roboter zu bauen, der sich durch eine menschliche Welt bewegen kann, stehen Ingenieure vor einem Koordinationsproblem, das weit komplexer ist als die bloße Aufgabe, einer Maschine das Gehen oder das Aufheben von Dingen beizubringen. Ein Roboter muss beides gleichzeitig tun, oft während er ein Objekt hält, das sein Gewicht verlagert und beeinflusst, wie er das Gleichgewicht hält. Dies wird als Loco-Manipulation bezeichnet, ein Begriff, der die schwierige Aufgabe beschreibt, den Körper zu bewegen, während man gleichzeitig ein Objekt mit den Händen manipuliert. Damit ein Roboter erfolgreich ist, darf er das Gehen und das Greifen nicht als separate Aufgaben betrachten; wenn er nach einem Stuhl greift, ohne seine Füße anzupassen, wird er umkippen. Wenn er auf einen Tisch zugeht, ohne zu planen, wie seine Finger die Oberfläche berühren werden, wird er scheitern, ihn anzuheben. Die Herausforderung besteht darin, einer Maschine beizubringen, dass ihr gesamter Körper, von den Füßen bis zu den Fingerspitzen, als eine einzige, ausgewogene Einheit arbeiten muss, um mit der physischen Welt zu interagieren.

Forscher versuchen schon lange, Roboter durch das Zeigen menschlicher Bewegungen zu lehren, einen Prozess, der Imitationslernen genannt wird. Das direkte Kopieren eines Menschen schlägt jedoch oft fehl, da Roboter und Menschen unterschiedliche Körperformen und unterschiedliche Arten der Bewegung ihrer Gelenke haben. Ein Mensch kann sein Handgelenk auf eine Weise drehen, die ein Roboter nicht kann, oder die Finger eines Roboters könnten zu steif sein, um eine menschliche sanfte Berührung nachzuahmen. Darüber hinaus konzentrierten sich die meisten bisherigen Versuche, Roboter den Umgang mit Objekten beizubringen, entweder auf die großen Bewegungen des Körpers oder auf die feinen Bewegungen der Hände, aber selten auf beides zusammen in einem einzigen, einheitlichen System. Diese Lücke bedeutete, dass Roboter zwar lernen konnten zu gehen oder eine Tasse zu halten, sie aber Schwierigkeiten hatten, die komplexe, alltägliche Aufgabe zu bewältigen, zu einem schweren Objekt zu laufen, es sicher zu greifen und es irgendwohin zu tragen, ohne es fallen zu lassen oder umzufallen.

Ein Forscherteam hat ein neues System namens WEAVE vorgestellt, um genau dieses Problem zu lösen. Ihr Ansatz beginnt damit, echte Menschen aufzuzeichnen, die mit alltäglichen Gegenständen wie Stühlen, Boxen und Tischen interagieren. Diese Aufnahmen erfassen die gesamte Bewegung der Person, während sie sich dem Gegenstand nähert, ihn greift und bewegt. Die Forscher nehmen dann diese menschlichen Bewegungen und übersetzen sie in ein Format, das ein Roboter verstehen und ausführen kann. Diese Übersetzung ist kein einfaches Kopieren und Einfügen; es ist eine sorgfältige Rekonstruktion, die die physischen Grenzen des Roboters respektiert. Das System füllt zuerst die fehlenden Teile der Bewegung auf, wie zum Beispiel die Schritte, die der Roboter unternehmen muss, um sich dem Objekt zu nähern, welche in der ursprüngellen menschlichen Aufnahme nicht vorhanden waren. Dann passt es die Handbewegungen des Menschen an die spezifischen Finger des Roboters an, um sicherzustellen, dass der Griff des Roboters physisch möglich und stark genug ist, um das Objekt zu halten. Entscheidend ist, dass das System genau darauf achtet, wo die Finger das Objekt berühren, um die Kontaktpunkte zu bewahren, die den Griff stabil machen.

Soblich diese Referenzbewegungen erstellt wurden, trainieren die Forscher ein einzelnes Computerprogramm, oder eine Policy, um daraus zu lernen. Dieses Programm ist darauf ausgelegt, jedes Gelenk im Körper des Roboters zu steuern, einschließlich der neunundzwanzig Gelenke in seinem Torso und seinen Beinen sowie der zwölf Gelenke in seinen zwei Händen. Anstatt ein separates Programm für jede Art von Objekt zu trainieren, trainierten die Forscher dieses eine Programm auf eine Vielzahl von Gegenständen und Interaktionsstilen gleichzeitig. Der Roboter lernt in einer simulierten Umgebung, einer digitalen Welt, in der er tausende Male üben kann, ohne etwas kaputt zu machen. Er lernt, die Referenzbewegung zu beobachten und zu versuchen, sie nachzubilden, wobei er sein Gleichgewicht und den Fingerdruck in Echtzeit anpasst, um das Objekt sicher zu halten. Das Training ist rigoros und beinhaltet zufällige Änderungen an der Reibung und dem Gewicht des Roboters, um sicherzustellen, dass er unerwartete Bedingungen bewältigen kann.

Die Ergebnisse dieses Trainings sind beeindruckend. Bei Tests mit den spezifischen Objekten und Bewegungen, die er während des Trainings gesehen hatte, gelang dem Roboter die Aufgabe in 92,5 % der Fälle. Wichtiger noch ist, dass das System eine starke Fähigkeit zur Generalisierung zeigte. Als die Forscher den Roboter mit Bewegungsabfolgen testeten, die er zuvor noch nie gesehen hatte – wobei dieselben Objekte aus anderen Winkeln oder mit anderen Bewegungen anges approached wurden –, war er dennoch in 65,0 % der Fälle erfolgreich, ohne zusätzliches Training. Dies deutet darauf hin, dass der Roboter eine allgemeine Strategie für die Interaktion mit Objekten gelernt hat, anstatt nur spezifische Bewegungen auswendig zu lernen. Die Forscher haben auch einen großen Datensatz dieser erfolgreichen Bewegungen veröffentlicht, der insgesamt etwa 23 Stunden an aufgezeichneter Roboteraktivität umfasst, um anderen Wissenschaftlern dabei zu helfen, zu untersuchen, wie Roboter mit der physischen Welt interagieren können.

Die Studie hebt hervor, dass das Erlernen des Umgangs mit Objekten am effektivsten ist, wenn der Roboter lernt, seinen gesamten Körper gleichzeitig zu koordinieren. Durch das Training an vielen verschiedenen Objekten gemeinsam entdeckte der Roboter gemeinsame Muster, wie zum Beispiel, wie man das Gewicht beim Heben einer schweren Box ausbalanciert oder wie man die Füße positioniert, wenn man nach einer hohen Lampe greift. Dieser einheitliche Ansatz erwies sich als erfolgreicher als das Training separater Spezialisten für jedes Objekt. Die Forscher fanden heraus, dass ein Spezialist zwar etwas besser darin sein könnte, die exakte Pose für ein spezifisches Objekt nachzuahmen, der Generalisten-Roboter jedoch viel besser darin war, die Aufgabe in einer Vielzahl von Situationen tatsächlich abzuschließen. Dies deutet darauf hin, dass die Fähigkeit, sich an neue Formen und Situationen anzupassen, wertvoller ist als die perfekte Imitation einer einzelnen Bewegung.

Trotz dieser Erfolge sind sich die Forscher über die Grenzen ihrer Arbeit im Klaren. Die gesamte Studie wurde in einer Computersimulation durchgeführt, was bedeutet, dass der Roboter die reale Welt nie physisch berührt hat. Das System verließ sich auf perfektes Wissen darüber, wo sich der Roboter und das Objekt befanden, was in der realen Welt, in der Sensoren verrauscht sein können, nicht immer verfügbar ist. Zudem verwendet der Roboter in der Simulation Hände, die nicht voll flexibel sind, was die Komplexität der Griffe einschränkt, die er ausführen kann. Die Forscher merken auch an, dass ihr System eine vor geplante Sequenz von Handlungen benötigt, der es folgen muss; es besitzt noch nicht die Fähigkeit, selbst zu entscheiden, was es aufheben oder wohin es etwas bringen soll. Dies sind die nächsten Schritte für das Fachgebiet, bei denen zukünftige Systeme diese physische Geschicklichkeit mit der Fähigkeit kombinieren müssen, komplexe Anweisungen zu verstehen und in der unvorhersehbaren Natur der realen Welt zu navigieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →