← Neueste Arbeiten
💻 computer science

Zetta ζ\zeta: An Efficient Closed-Loop Embodied Harness for Self-Evolving Physical Intelligence

Das Papier präsentiert Zetta, ein geschlossener, verkörperter Harness, der durch die dynamische Online-Aktualisierung von codebasierten Kritiken und Wiederherstellungsfertigkeiten über drei zeitskalenseparierte Schleifen eine selbstentwickelnde physische Intelligenz ermöglicht, wobei es State-of-the-Art-Leistung sowie signifikante Beschleunigungen bei der Inferenz auf Benchmark-Aufgaben erzielt und gleichzeitig Zero-Shot-Transfer sowie emergente „Aha-Momente“ demonstriert.

Ursprüngliche Autoren: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Veröffentlicht 2026-08-18
📖 7 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Xin Ding, Liang Mi, Mingzhe Huang, Zixuan Wang, Chao Zhang, Zixu Hao, Fu Chen, Xiangyu Li, Yikai Zheng, Yaoyu Guo, Weijun Wang, Kun Li, Hao Wu, Yunxin Liu, Ting Cao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind schon lange in der Lage, einfache, repetitive Aufgaben in Fabriken auszuführen, aber ihnen die Flexibilität zu geben, mit der unordentlichen, unvorhersehbaren Natur eines echten Zuhauses oder einer Werkstatt umzugehen, blieb eine der schwierigsten Herausforderungen der künstlichen Intelligenz. Jahrelang haben Forscher versucht, Roboter zu lehren, indem sie sie mit massiven Mengen an Videodaten fütterten, in der Hoffnung, dass die Maschine eine einzige, perfekte Reihe von Anweisungen für jede mögliche Situation lernen würde. Dieser Ansatz, obwohl leistungsstark, scheitert oft, wenn die reale Welt auch nur geringfügig von den Trainingsvideos abweicht; ein leichtes Verrutschen eines Greifers oder eine Änderung der Beleuchtung kann dazu führen, dass der Roboter einfriert oder abstürzt. Ein alternativer Weg ist entstanden, der Roboter nicht als statische Programme betrachtet, sondern als Agenten, die denken, planen und Werkzeuge benutzen können. Doch selbst diese intelligenteren Agenten hatten Schwierigkeiten, aus ihren eigenen Fehlern in Echtzeit zu lernen. Die meisten Systeme arbeiten in einer Schleife, in der sie eine Aufgabe versuchen, scheitern und erst reflektieren, was schiefgelaufen ist, wenn der gesamte Versuch abgeschlossen ist. Bis sie den Fehler analysieren, ist der Moment zur Korrektur bereits vorbei und die physische Interaktion ist bereits unterbrochen.

Ein Team von Forschern der Tsinghua University und Z-Trans AI hat ein neues System namens Zetta vorgestellt, das die Art und Weise, wie Roboter lernen, verändert, indem es die Lücke zwischen Denken und Handeln schließt. Anstatt darauf zu warten, dass eine Aufgabe beendet ist, um zu lernen, ermöglicht Zetta einem Roboter, seinen eigenen physischen Zustand kontinuierlich zu überwachen, während er sich bewegt, Fehler sofort zu erkennen, wenn sie auftreten, und sie unverzüglich zu korrigieren. Das System versucht nicht, das Kerngehirn des Roboters neu zu trainieren, welches stabil und unveränderlich bleibt. Stattdessen baut es eine Ebene von „Runtime-Kritikern“ auf – kleine, spezialisierte Monitore, die die Hände des Roboters und die Objekte, die er berührt, beobachten. Wenn ein Kritiker bemerkt, dass ein Griff verrutscht oder ein Objekt kurz davor ist, herunterzufallen, löst er eine vorprogrammierte Wiederherstellungsfertigkeit aus, um die Situation zu retten, bevor der Roboter die Kontrolle verliert. Dies schafft eine selbstentwickelnde Schleife, in der der Roboter bei der Ausführung einer spezifischen Aufgabe besser wird, je öfter er sie versucht – nicht, indem er sein grundlegendes Verständnis der Welt ändert, sondern indem er eine Bibliothek bewährter Wege zum Umgang mit physischen Fehlern ansammelt.

Die Forscher testeten diesen Ansatz an zwei wichtigen Benchmarks für die robotergestützte Manipulation: einem Satz von Aufgaben, die das Bewegen von Objekten zwischen verschiedenen Orten beinhalten, und einem komplexeren Satz von Haushaltsaufgaben wie dem Öffnen von Schubladen oder dem Einschalten von Geräten. In diesen Simulationen startete das System mit einer Basis-Roboter-Policy, die bei den schwierigeren Aufgaben eine Erfolgsquote von etwa 35 Prozent aufwies. Während das System tausende Versuche durchlief, begann es, die spezifischen Momente zu identifizieren, in denen Dinge schiefgingen. Es gruppierte diese Fehler, ermittelte die Ursache und schrieb neuen Code, um sie zu beheben. Innerhalb nur weniger Durchläufe dieser Selbstkorrektur sprang die Erfolgsquote bei den schwierigen Aufgaben auf über 90 Prozent. Das System hatte nicht einfach Glück; es demonstrierte ein klares Muster der Verbesserung, bei dem es eine Zeit lang kämpfte und dann plötzlich ein zentrales physikalisches Prinzip entdeckte – wie etwa die Notwendigkeit, einen Griff zu stabilisieren, bevor man hebt – und seine Leistung sprunghaft anstieg. Die Forscher nennen diese plötzlichen Durchbrüche „Aha-Momente“, in denen der Roboter schließlich das physikalische Prinzip versteht, das ihm zuvor fehlte.

Was diese Entdeckung besonders signifikant macht, ist, dass die vom Roboter gelernten Fertigkeiten nicht an ein einzelnes spezifisches Objekt oder einen einzelnen spezifischen Raum gebunden waren. Als die Forscher die vom Roboter gelernten Fähigkeiten, eine Weinflasche in einer Aufgabe zu handhaben, auf eine völlig andere Aufgabe übertrug, die einen Behälter mit Frischkäse beinhaltete, war der Roboter erfolgreich, ohne dass ein neues Training erforderlich war. Das System hatte allgemeine Prinzipien des Haltens, Bewegens und Platzierens von Objekten gelernt, die über verschiedene Szenarien hinweg funktionierten. Dies deutet darauf darauf hin, dass der Roboter nicht nur einen Pfad zum Ziel auswendig lernte, sondern ein tieferes Verständnis dafür erwarb, wie man mit der physischen Welt interagiert. Das System erwies sich zudem als unglaublich schnell, indem es Simulationen auf einem Computercluster ausführte, um die für das Lernen nötige Erfahrung zu generieren. Durch die Entkopplung der Logik des Roboters von der Hardware, die die Simulation ausführt, konnten die Forscher den Lernprozess mehr als zwanzigmal schneller als bisherige Methoden durchführen, was es dem Roboter ermöglichte, seine Fähigkeiten in Stunden statt in Tagen zu entwickeln.

Die Forscher argumentieren, dass dieser Ansatz ein grundlegendes Problem in der Robotik löst: die Unfähigkeit aktueller Modelle, auf die schnellen Veränderungen der physischen Welt zu reagieren. Große Modelle der künstlichen Intelligenz sind zu langsam, um Entscheidungen mit der Geschwindigkeit zu treffen, die erforderlich ist, um ein fallendes Objekt aufzufangen oder einen rutschenden Griff anzupassen. Indem Zetta das Hauptgehirn eingefroren hält und eine schnelle, reaktive Ebene aus Kritikern und Wiederherstellungsfertigkeiten hinzufügt, schließt es die Lücke zwischen hochgradiger Planung und niedriggradiger physischer Kontrolle. Das System zeigte, dass es komplexe, lange Aktionssequenzen bewältigen kann, wie etwa das Navigieren durch eine Küche, das Öffnen eines Schranks und das Platzieren eines Gegenstands darin, indem es die Aufgabe in handhabbare Schritte unterteilt und ein Sicherheitsnetz für jeden potenziellen Fehler bereitstellt. In einer Fallstudie scheiterte ein Roboter beim Versuch, eine Flasche in eine Schüssel zu bewegen, anfangs wiederholt, weil er die Flasche während des Transports fallen ließ. Nach einigen Runden der Selbstkorrektur fügte das System eine spezifische Prüfung hinzu, um sicherzustellen, dass der Griff sicher war, bevor die Bewegung erfolgte, und die Erfolgsquote für diese Aufgabe stieg von 15 Prozent auf 95 Prozent.

Die Arbeit hebt auch die Bedeutung der Infrastruktur hervor, die diese Art des Lernens erst möglich macht. Um die Fähigkeiten eines Roboters zu entwickeln, muss das System tausende Versuche durchführen, um die seltenen Momente zu finden, in denen es scheitert, und dann diese Fehler zu analysieren. Die Forscher bauten ein spezialisiertes System, um diese Arbeitslast zu bewältigen, was es ihnen ermöglichte, viele Simulationen gleichzeitig laufen zu lassen, ohne die Geschwindigkeit zu drosseln. Diese Infrastruktur war entscheidend für die Geschwindigkeit des Projekts und ermöglichte es dem Team, die notwendigen Daten zu sammeln, um die Kritiker und Wiederherstellungsfertigkeiten effizient zu trainieren. Ohne diese Fähigkeit, den Lernprozess zu skalieren, wäre die selbstentwickelnde Schleife zu langsam für die Praxis gewesen. Die Ergebnisse deuten auf einen neuen Weg für physische Intelligenz hin, auf dem Roboter nicht von Anfang an perfekt sein müssen, sondern durch Erfahrung lernen können, zuverlässig zu werden und ihre Fähigkeit, mit dem Unerwarteten umzugehen, ständig zu verfeinern.

Die Implikationen dieser Forschung reichen weit über die bloße Verbesserung der Bewegungsabläufe von Robotern hinaus. Sie bietet einen Entwurf dafür, wie künstliche Intelligenz mit der physischen Welt interagieren kann, um robust und anpassungsfähig zu sein. Durch die Konzentration auf die Fähigkeit, Fehler in Echtzeit zu erkennen und zu beheben, vermeidet das System die Sprödigkeit, die bisherige Ansätze geplagt hat. Die Forscher merken an, dass ihre aktuelle Arbeit zwar in einer Simulation durchgeführt wurde, die entwickelten Prinzipien jedoch darauf ausgelegt sind, auf echte Roboter übertragen zu werden. Der nächste Schritt für das Team besteht darin, dieses selbstentwickelnde Gerüst auf physische Maschinen zu übertragen und so die Lücke zwischen digitaler Simulation und der realen Welt zu schließen. Sollte dies erfolgreich sein, könnte dies zu Robotern führen, die nicht nur darauf programmiert sind, eine Aufgabe auszuführen, sondern in der Lage sind, ihre Leistung jedes Mal zu verbessern, wenn sie versuchen, sie zu vollziehen, was sie zu nützlicheren und zuverlässigeren Partnern in menschlichen Umgebungen macht.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →