← Neueste Arbeiten
💻 computer science

Zeva: In-Context Causal Learning for Generalizable Embodied Manipulation

Zeva ist ein neuartiges Framework, das eine generalisierbare verkörperte Manipulation ermöglicht, indem es kausale Interaktionen aus den physischen Erfahrungen eines Roboters in ein Dual-Timescale-Gedächtnis extrahiert, wodurch ein eingefrorenes Policy-Modell durch In-Context-Lernen ohne die Notwendigkeit von Gradienten-Updates selbstständig evolvieren und seine Leistung über verschiedene Aufgaben hinweg verbessern kann.

Ursprüngliche Autoren: Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao

Veröffentlicht 2026-09-01
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Fu Chen, Xin Ding, Bingjia Huang, Xiangyu Li, Mingju Wang, Jiawei He, Kun Li, Wei Sun, Yunxin Liu, Hao Wu, Ting Cao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Fabrikhallen, wo sie dieselbe Bewegung tausendfach mit perfekter Präzision wiederholen. Doch wenn man sie aus dieser kontrollierten Umgebung in eine echte Küche oder ein Labor versetzt, stolpern sie oft. Die physische Welt ist chaotisch; Objekte verschieben sich, Oberflächen sind uneben, und die Art und Weise, wie ein Greifer ein Glas Wasser fühlt, unterscheidet sich von der Art und Weise, wie er einen Metallbecher fühlt. Jahrelang bestand der führende Ansatz, Roboter zu lehren darin, ihnen vor dem ersten Einsatz außerhalb des Labors riesige Mengen an Videos und Daten zuzuführen, in der Hoffnung, dass sie genug allgemeine Regeln lernen, um mit allem umgehen zu können. Doch wenn diese Roboter auf eine Situation stoßen, die sie noch nie zuvor gesehen haben, scheitern sie häufig, weil ihr inneres „Gehirn“ nicht in der Lage ist, sich an die neue Physik des Augenblicks anzupassen. Sie sind auf das Wissen festgeschrieben, das ihnen gegeben wurde, und unfähig, aus ihren eigenen Fehlern während des Geschehens zu lernen.

Ein Forscherteam der Tsinghua University und Z-Trans AI hat einen anderen Weg vorgeschlagen, bei dem ein Roboter lernt, in Echtzeit über Ursache und Wirkung nachzudenken. Sie führten ein System namens Zeva ein, das es einem Roboter ermöglicht, seine eigene Leistung zu verbessern, ohne jemals seinen zugrunde liegenden Softwarecode zu ändern. Anstatt zu versuchen, das Gehirn des Roboters neu zu trainieren, was langsam und riskant ist, fungiert Zeva wie ein hoch organisiertes Notizbuch. Während der Roboter versucht, eine Aufgabe auszuführen, zeichnet er genau auf, was geschah, als er sich bewegte: Er sah ein bestimmtes Objekt, bewegte seinen Arm auf eine bestimmte Weise, und das Objekt blieb entweder an seinem Platz oder kippte um. Das System extrahiert die Lektion aus dieser einzelnen Interaktion – den kausalen Zusammenhang zwischen der Aktion und dem Ergebnis – und speichert sie. Wenn der Roboter dieselbe Aufgabe erneut versucht, schaut er in dieses Notizbuch, findet die relevante Lektion und nutzt sie, um seinen nächsten Schritt anzupassen. Dies geschieht augenblicklich, wodurch der Roboter mit jedem einzelnen Versuch besser wird, selbst wenn seine Kernprogrammierung eingefroren und unverändert bleibt.

Die Forscher testeten diese Idee in zwei sehr unterschiedlichen Welten. Zuerst nutzten sie eine hochentwickelte Computersimulation einer Küche, einem Ort voller komplexer Objekte wie Wasserkochern, Toastern und Mixern. In dieser virtuellen Umgebung stellte sich Zeva fünf verschiedenen Aufgaben gegenüber, wie etwa das Einschalten eines Mikrowellengeräts oder das Öffnen eines Mixeraufsatzes. Die Ergebnisse waren beeindruckend. Während andere fortschrittliche Robotersysteme etwa 60 bis 72 Prozent der Zeit erfolgreich waren, erreichte Zeva eine Erfolgsquote von 76,8 Prozent. Viel wichtiger war, dass das System ein klares Muster der Selbstverbesserung zeigte. Beim allerersten Versuch einer Aufgabe war der Roboter nur zu etwa einem Viertel erfolgreich. Aber als es ihm erlaubt wurde, das gleiche Szenario immer wieder durchzuführen und die Lektionen aus seinen Fehlern zu nutzen, um seine nächsten Bewegungen zu steuern, stieg seine Erfolgsquote stetig an. Beim vierten Versuch war er bereits in 73 Prozent der Fälle erfolgreich. Dies bewies, dass der Roboter nicht einfach nur Glück hatte, sondern tatsächlich aus dem physischen Feedback seiner eigenen Handlungen lernte.

Um sicherzustellen, dass dies nicht nur ein Ergebnis der Computersimulation war, übertrug das Team das System in ein echtes chemisches Labor. Sie statteten einen physischen Roboterarm mit der Fähigkeit aus, empfindliche Glaswaren wie Reagenzgläser und Bechergläser zu handhaben und Aufgaben wie das Gießen von Wasser oder das Wiegen von Chemikalien auszuführen. Diese Umgebung war weitaus unvorhersehbarbarer als die Simulation, mit echter Schwerkraft, Reibung und dem Risiko, Glas zu zerbrechen. Hier übertraf Zeva erneut die besten bestehenden Systeme. Bei den einfachsten Aufgaben, wie dem Aufheben eines Reagenzglases, war es zu 100 Prozent erfolgreich. In komplexeren Abläufen, wie der Vorbereitung einer Salzlösung, erreichte es eine Erfolgsquote von 70 Prozent, was signifikant höher war als die seiner Konkurrenten. Die Forscher maßen auch, wie viel des Prozesses der Roboter abschloss, nicht nur, ob er die gesamte Aufgabe beendete. Selbst wenn eine Aufgabe schwierig war, schaffte Zeva mehr der erforderlichen Schritte als jedes andere System, was zeigt, dass seine Fähigkeit, aus Interaktionen zu lernen, ihm half, die chaotische Realität der physischen Welt zu bewältigen.

Ein entscheidender Teil von Zevas Erfolg ist die Art und Weise, wie es sein Gedächtnis organisiert. Das System speichert nicht einfach eine lange Liste von allem, was es je getan hat; das wäre zu viel, um es schnell zu verarbeiten. Stattdessen nutzt es zwei Arten von Gedächtnis, die zusammenarbeiten. Das eine ist eine Kurzzeitspur, die die letzten Sekunden der Aktion speichert und dem Roboter hilft zu verstehen, was gerade passiert. Das andere ist ein persistentes Gedächtnis, das die nützlichsten Lektionen früherer Versuche bewahrt, selbst wenn diese Versuche fehlgeschlagen sind. Wenn der Roboter einen neuen Versuch startet, sucht er in diesem persistenten Gedächtnis nach einer Situation, die der aktuellen Situation ähnlich sieht. Er nutzt dann diese vergangene Erfahrung als Leitfaden. Wenn der Roboter beispielsweise zuvor versucht hat, Wasser zu gießen und das Glas umkippte, weil er zu schnell gekippt ist, erinnert er sich an diesen spezifischen Ursache-Wirkungs-Zusammenhang. Beim nächsten Versuch konsultiert er dieses Gedächtnis und neigt sich langsamer, um denselben Fehler zu vermeiden. Dieser Prozess geschieht ohne jegliche Änderungen an der Hauptsoftware des Roboters, was bedeutet, dass der Roboter sofort lernen und sich anpassen kann, ohne den langsamen und gefährlichen Prozess des kompletten Neu-Trainierens seines Gehirns.

Die Forscher entdeckten auch, dass dieses System von Menschen lernen kann, nicht nur von seinen eigenen Fehlern. In einem Experiment führte ein Mensch den Roboterarm durch einen einzigen erfolgreichen Versuch einer komplexen Aufgabe. Das System zeichnete diese menschliche Demonstration auf, extrahierte die kausalen Lektionen und speicherte sie in seinem Gedächtnis. Als der Roboter die Aufgabe dann eigenständig versuchte, nutzte er dieses eine menschliche Beispiel, um sein Lernen anzustoßen. Dieses „Warm-up“ ermöglichte es dem Roboter, von Beginn an wesentlich besser zu performen, wobei er seine Erfolgsquote im Vergleich zu dem, wenn er völlig von Null an hätte lernen müssen, um bis zu 15 Prozent steigerte. Dies deutet darauf hin, dass ein Roboter eine neue Fertigkeit aus einer einzigen menschlichen Demonstration lernen und diese Fertigkeit dann durch eigenes wiederholtes Üben verfeinern kann, indem er das Beste aus menschlicher Anleitung mit der Kraft der Selbstentwicklung kombiniert.

Die Studie untersuchte auch, ob die Lektionen, die ein Roboter in einer Aufgabe lernte, ihm auch bei einer völlig anderen Aufgabe helfen konnten. Sie fanden heraus, dass das System erkennen konnte, wenn eine physische Wirkung in einer neuen Aufgabe einer zuvor gesehenen Ähnlichkeit entsprach. Zum Beispiel wurde die Bewegung des Kippens eines Behälters zum Gießen von Wasser als ähnlich erkannt wie die Bewegung des Kippens eines Behälters zum Mischen von Chemikalien, obwohl die Objekte und die Ziele unterschiedlich waren. Diese Fähigkeit, Wissen über Aufgaben hinweg zu übertragen, bedeutet, dass ein Roboter nicht jedes Mal bei Null anfangen muss, wenn er vor einer neuen Herausforderung steht. Er kann auf eine Bibliothek physischer Ursache-Wirkungs-Beziehungen zurückgreifen, die er im Laufe der Zeit aufgebaut hat, was ihn vielseitiger und fähiger in einer breiten Palette von Situationen macht.

Trotz dieser Erfolge sind sich die Forscher über die Grenzen ihrer Arbeit bewusst. Das System lernt derzeit nur aus den Versuchen, die es unternimmt, während es versucht, eine bestimmte Aufgabe zu vollenden. Es besitzt noch nicht die Fähigkeit, die Welt einfach nur zu erkunden, um neue Dinge zu lernen – ein Verhalten, das als „aktive Exploration“ bezeichnet wird. Die Autoren deuten an, dass sich zukünftige Arbeiten darauf konzentrieren werden, den Roboter dazu zu bringen, seine eigenen Experimente zu wählen, also gezielt verschiedene Aktionen auszuprobieren, um die Unsicherheit darüber zu verringern, wie die physische Welt funktioniert. Bis dahin stellt Zeva einen bedeutenden Fortschritt dar, indem es zeigt, dass ein Roboter nicht neu trainiert werden muss, um klüger zu werden. Indem er einfach auf die Konsequenzen seiner eigenen Handlungen achtet und sich merkt, was funktionierte und was nicht, kann ein Roboter seine eigenen Fähigkeiten entwickeln und jeden Fehlschlag in eine Lektion für den nächsten Versuch verwandeln.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →