← Neueste Arbeiten
💻 computer science

GE-Act 2.0: Pretraining and Scaling a World-Action Model for Robotic Manipulation

GE-Act 2.0 ist ein neuartiges Welt-Aktions-Modell, das von Grund auf mit Manipulationsdaten trainiert wurde und einen steuerungsorientierten Autoencoder, einen einstufigen visuellen Planer sowie ein inverses Dynamikmodell mit wissensbasiert selektiver Optimierung integriert, wodurch durch umfangreiches Scaling und körperübergreifenden Transfer ein signifikanter Zero-Shot-Erfolg über diverse Aufgaben und Embodiments hinweg erreicht wird.

Ursprüngliche Autoren: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xion
Veröffentlicht 2026-09-09
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: AgiBot Research Team, Renhang Liu, Wenzhi Zhao, Zhuo Yang, Liliang Chen, Pengfei Zhou, Shengcong Chen, Guanghui Ren, Youlun Peng, Rongjun Jin, Nan Wang, Sukai Wang, Xindong He, Jinyuan Feng, Ziyu Xiong, Linqing Zhong, Yifei Wei, Feng Han, Long Zhang, Da Huang, Nanshu Zhao, Chenghao Yin, Mo Wu, Zhaodong Yan, Kongtao Hu, Yuxiang Yan, Aogelijiang Niyazi, Yu Fang, Jia Zeng, Lizhu Meng, Daizhen Lv, Haoyu Cao, Zhiwen Hou, Lianjin Ye, Yuehan Niu, Zhikai Cai, Xuan Hu, Hui Min, Xiongfeng Cai, Yue Liao, Jing Wu, Soujanya Poria, Ye Li, Sanping Zhou, Maoqing Yao

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Roboter sind seit langem Meister der Fabrikhalle, in denen sie dieselbe präzise Bewegung tausendfach ohne Fehler wiederholen. Doch bringt man sie in eine Küche, ein Wohnzimmer oder eine unordentliche Werkstatt, erstarren sie oft. Die Herausforderung besteht nicht nur darin, eine Hand zu bewegen; es geht darum zu verstehen, wie sich die Welt verändert, wenn diese Hand etwas berührt. Um dies zu bewältigen, lernt eine neue Generation künstlicher Intelligenz, sich die Zukunft vorzustellen. Anstatt einfach nur auf das zu reagieren, was es gerade sieht, versuchen diese Systeme vorherzusagen, was als Nächstin passieren wird, wenn sie eine bestimmte Aktion ausführen. Dieser Ansatz, bekannt als Welt-Aktions-Modell (World-Action Model), ermöglicht es einem Roboter, eine Sequenz von Ereignissen in seinem Geist zu simulieren, bevor er auch nur einen Muskel rührt, um zu prüfen, ob das Ergebnis mit seinem Ziel übereinstimmt. Jahrelang haben Forscher versucht, diese Systeme zu bauen, indem sie bestehende Videogeneratoren – Programme, die darauf trainiert sind, gefälschte Filme zu erstellen – dazu brachten, Roboterbewegungen zu verstehen. Diese Methode hinterlässt dem Roboter jedoch oft ein vages Verständnis der Physik, da der Videogenerator nie wirklich dafür konzipiert wurde, einen physischen Körper zu steuern.

Ein Team von AgiBot hat nun einen anderen Ansatz vorgestellt, der die Vorstellungskraft des Roboters von Grund auf mithilfe von echten Interaktionsdaten aus der realen Welt aufbaut. Sie entwickelten ein System namens GE-Act 2.0, das lernt, die Zukunft vorherzusagen und gleichzeitig Entscheidungen über Aktionen zu treffen, jedoch mit einer entscheidenden Wendung: Jeder Teil des Systems wurde von Grund auf mit Daten trainiert, die durch Roboter und Menschen bei der Manipulation von Objekten gesammelt wurden. Die Forscher verließen sich nicht auf vorgefertigte Videomodelle. Stattdessen lehrten sie das System eine komprimierte Sprache der Bewegung – eine Art, die Welt zu sehen, die unnötige Details weglässt, um sich auf das Wesentliche für die Steuerung zu konzentrieren. Dies ermöglichte es dem Roboter, aus einer riesigen und vielfältigen Bibliothek von Daten zu lernen, einschließlich stundenlanger erfolgreicher Demonstrationen, gescheiterter Versuche und sogar Videos von Menschen, die ohne aufgezeichnete Anweisungen arbeiten. Durch die Kombination dieser verschiedenen Arten des Lernens lernte das System zu generalisieren, was bedeutet, dass es das Gelernte in einer völlig neuen Situation anwenden konnte, die es zuvor noch nie gesehen hatte.

Der Kern dieser Errungenschaft liegt darin, wie die Forscher mit der chaotischen Realität der physischen Welt umgingen. Wenn ein Roboter versucht zu lernen, steht er oft vor einem verwirrenden Problem: Dieselbe Anweisung kann auf viele verschiedene Arten ausgeführt werden. Einem Roboter könnte gesagt werden: „Hebe den roten Becher auf“, und er könnte sich von links, von rechts nähern oder ihn am Henkel oder am Rand greifen. Wenn die Trainingsdaten nur einen Weg zeigen, der Roboter in seiner Vorstellung aber einen anderen vorhersagt, können die beiden Teile des Systems aus dem Takt geraten. Die Forscher identifizierten diese Diskrepanz als eine „Validitätslücke“ (Validity Gap), bei der die Vorhersage des Roboters über die Zukunft nicht mit der Aktion übereinstimmt, die er ausführen soll. Um dies zu beheben, entwickelten sie einen Auswahlprozess, der wie ein Filter wirkt. Bevor der Roboter aus einer vorhergesagten Zukunft lernt, prüft er, ob diese Zukunft mit der Aktion kompatibel ist, die er ausführen muss. Er generiert mehrere mögliche Zukünfte, testet sie gegen die erforderliche Aktion und lernt nur von denjenigen, die sinnvoll zusammenpassen. Dies stellt sicher, dass der Roboter sein Verständnis darüber, wie verschiedene Aktionen zu unterschiedlichen Ergebnissen führen, nicht verwischt.

Die Ergebnisse dieses Trainings sind beeindruckend, insbesondere wenn das System bei Aufgaben getestet wird, die es nie geübt hat. Die Forscher evaluierten das System bei einhundert unterschiedlichen Manipulationsaufgaben, die vom Stapeln von Blöcken und Gießen von Flüssigkeiten bis hin zum Falten von Handtüchern und Einstecken von Steckern reichten. Diese Tests wurden an echten Robotern in Umgebungen mit unterschiedlicher Beleuchtung, Hintergründen und Objektanordnungen durchgeführt, als die während des Trainings verwendeten. Als das System mit einem kleinen Datensatz von 300 Stunden trainiert wurde, war es bei nur 17,1 % der Aufgaben auf einem Robotermodell erfolgreich. Die Erfolgsquote stieg jedoch stetig an, als die Forscher die Trainingsdaten auf 30.000 Stunden skalierten, auf 44,1 %. Diese Verbesserung geschah ohne spezifische Feinabstimmung für die einzelnen Aufgaben; der Roboter wandte einfach die gelernten allgemeinen Fähigkeiten auf die neuen Herausforderungen an. Überraschenderweise zeigte das System auch starke Fähigkeiten bei einem zweiten, anderen Robotermodell, das weniger als 2 % der Trainingsdaten ausmachte, was darauf hindeutet, dass die aus dem größeren Datensatz gelernten Fähigkeiten effektiv auf eine neue physische Form übertragen wurden.

Auch die Fähigkeit des Systems, Anweisungen zu folgen, wurde unter schwierigen Bedingungen getestet. In vielen Versuchen wurde der Roboter aufgefordert, eine Aktion auszuführen, die im Widerspruch zu dem stehen könnte, was er basierend auf der Szene oder einer vorherigen Gewohnheit erwartet hätte. Wenn ein Robbot beispielsweise mitten in einer Bewegung war, konnte er dennoch anhalten und einer neuen, expliziten Anweisung folgen, um seinen Pfad zu ändern. In über 90 % dieser Versuche identifizierte der Roboter korrekt das spezifische Objekt, die Farbe, die Form oder die Position, die in der Anweisung erwähnt wurde, selbst wenn diese Details subtil oder der Kontext verwirrend war. Die Forscher fanden eine starke Verbindung zwischen der Vielfalt der Fähigkeiten, die der Roboter während des Trainings lernte, und seiner Fähigkeit, bei neuen Aufgaben erfolgreich zu sein. Je vielfältiger die Trainingsdaten waren, desto wahrscheinlicher war es, dass der Roboter eine neuartige Situation bewältigte. Dies deutet darauf hin, dass der Weg zu fähigeren Robotern nicht nur in besseren Algorithmen liegt, sondern im schieren Volumen und der Vielfalt der Daten, die sie konsumieren.

Diese Arbeit markiert einen bedeutenden Schritt hin zu Robotern, die von denselben reichen, unstrukturierten Daten lernen können, die Menschen nutzen, um die Welt zu verstehen. Indem sie ein System schufen, das die Zukunft vorhersagt und Aktionen auf eine einheitliche Weise plant, und indem sie es lehrten, die richtigen Vorhersagen aus vielen Möglichkeiten auszuwählen, haben die Forscher ein Modell geschaffen, das robust und anpassungsfähig ist. Die Ergebnisse legen nahe, dass ein Roboter mit genügend vielfältiger Erfahrung ein tiefes, intuitives Verständnis dafür entwickeln kann, wie Objekte sich verhalten und wie man mit ihnen interagiert, wodurch er sich von einer starren Programmierung hin zu einer flexibleren Form der Intelligenz bewegt. Der Erfolg dieses Ansatzes auf echter Hardware, ohne dass für jede neue Aufgabe ein erneutes Training erforderlich ist, deutet auf eine Zukunft hin, in der Roboter in dynamischen, unvorhersehbaren Umgebungen eingesetzt werden können und dort lernen können zu gedeihen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →