← Neueste Arbeiten
💻 computer science

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0 ist ein vereinheitlichtes kausales autoregressives World Action Model, das Multi-View-Beobachtungen, Roboterzustände und Aktionen in einem einzigen Framework integriert und eine progressive Pretraining-Strategie auf über 200.000 Stunden vielfältiger Embodied Data nutzt, um eine State-of-the-Art-Leistung sowohl in Simulations- als auch in realen Langzeit-Manipulationsaufgaben zu erzielen.

Ursprüngliche Autoren: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

Veröffentlicht 2026-08-28
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Künstliche Intelligenz ist seit langem ein Meister des digitalen Reiches, der Texte liest, Bilder erkennt und Rätsel innerhalb der Grenzen eines Computerbildschirms löst. Doch damit Maschinen wirklich zu uns in die physische Welt stoßen können, müssen sie mehr tun, als nur zu verstehen, was sie sehen; sie müssen lernen, innerhalb dieser Welt zu handeln. Dies ist die Herausforderung der verkörperten Intelligenz (Embodied Intelligence): Robotern beizubringen, ihre Umgebung wahrzunehmen, über Ursache und Wirkung nachzudenken und physische Bewegungen mit derselben Geschmeidigkeit auszuführen, die ein Mensch beim Aufheben einer Tasse oder beim Falten eines Hemdes verwendet. Damit eine Maschine erfolgreich sein kann, benötigt sie ein Modell der Welt, das nicht nur versteht, wie Objekte aussehen, sondern auch, wie sie sich bewegen und verändern, wenn man sie berührt. Sie muss lernen, dass das Drücken eines Blocks dazu führt, dass er gleitet, und dass das Anheben eines Deckels offenbart, was sich darin befindet. Bis jetzt war die Schaffung eines einzelnen Systems, das sowohl diese physischen Handlungen planen als auch die visuellen Konsequenzen dieser Handlungen vorhersagen kann, eine schwierige Hürde, die oft separate Systeme für das Denken und für das Bewegen erforderte.

Ein Team von Forschern hat ein neues System namens Riemann-1.0 vorgestellt, das darauf ausgelegt ist, diese Lücke zu schließen, indem es die Handlungen eines Roboters und die daraus resultierenden Veränderungen in der Welt als eine einzige, kontinuierliche Geschichte behandelt. Anstatt separate Werkzeuge zu bauen, um zu entscheiden, was zu tun ist, und Werkzeuge, um zu imaginieren, was als Nächstes passieren wird, lernt dieses Modell, beides gleichzeitig zu tun. Es arbeitet nach einem einfachen, aber kraftvollen Prinzip: In der realen Welt geschieht eine Handlung immer, bevor das Ergebnis gesehen wird. Wenn ein Roboter nach einem Löffel greift, findet die Bewegung zuerst statt, und die visuelle Veränderung – der bewegte Löffel – folgt darauf. Riemann-1.0 ist darauf ausgelegt, diese Reihenfolge zu respektieren, indem es aus einer massiven Sammlung von Video- und Bewegungsdaten lernt, um exakt vorherzusagen, was ein Roboter als Nächstes tun sollte und wie die Welt aussehen wird, nachdem er es getan hat.

Um dieses System zu lehren, sammelten die Forscher eine riesige Bibliothek an Erfahrungen, die insgesamt mehr als 200.000 Stunden Interaktion umfasst. Diese Sammlung war nicht nur ein Haufen Robotervideos; sie war eine sorgfältig kuratierte Mischung aus drei verschiedenen Arten von Lernmaterial. Erstens schlossen sie tausende Stunden an Videos ein, die aus der Sicht eines Menschen aufgenommen wurden und zeigen, wie Menschen alltägliche Aufgaben wie Kochen oder Putzen ausführen. Diese Videos lieferten ein breites Verständnis dafür, wie Objekte interagieren und wie sich Aufgaben im Laufe der Zeit entfalten, obwohl ihnen die spezifischen mechanischen Daten eines Roboters fehlten. Zweitens fügten sie Demonstrationen von handgehaltenen Robotergreifern und tragbaren Geräten hinzu, die als Brücke dienen und zeigen, wie menschliche Handbewegungen in maschinenähnliche Steuerungen übersetzt werden. Schließlich schlossen sie präzise Aufzeichnungen tatsächlicher Roboterbewegungen ein, die die exakten, ausführbaren Anweisungen lieferten, die nötig sind, um der Maschine beizubringen, wie sie ihre eigenen Gliedmaßen bewegt. Durch die Kombination dieser Quellen schufen die Forscher einen einheitlichen Datensatz, der es dem Modell ermöglichte, aus der breiten Weisheit menschlicher Erfahrung zu lernen und dieses Wissen gleichzeitig in der präzisen Mechanik der Robotersteuerung zu verankern.

Der Trainingsprozess für Riemann-1.0 war wie ein Lehrplan strukturiert, der von allgemeiner Beobachtung zur spezifischen Ausführung überging. In der ersten Phase studierte das Modell die riesige Bibliothek menschlicher Videos. Da diese Videos keine Roboterbewegungsdaten enthielten, nutzte das System ein Hilfswerkzeug, um die unsichtbaren „Aktionen“ zu schätzen, die die auf dem Bildschirm sichtbaren visuellen Veränderungen verursacht haben müssen. Dies ermöglichte es dem Modell, die grundlegende Dynamik dessen, wie sich die Welt bewegt, zu lernen, ohne perfekte Roboterdaten zu benötigen. In der zweiten Phase wurde das Modell mit den gemischten Daten von menschlichen Händen und Robotergreifern vertraut gemacht, wobei es lernte, sein Verständnis von Bewegung mit realen, physischen Steuerungen in Einklang zu bringen. Schließlich konzentrierte sich das Modell in der dritten Phase ausschließlich auf hochwertige Aufzeichnungen von Robotern, die Aufgaben ausführen. Diese letzte Phase schärfte seine Fähigkeit, präzise, ausführbare Befehle zu generieren, und stellte sicher, dass die geplanten Handlungen nicht nur visuell plausibel, sondern für eine echte Maschine auch physisch möglich waren.

Die Ergebnisse dieses Ansatzes waren beeindruckend. Bei Tests zu einer Vielzahl von Aufgaben, sowohl in Computersimulationen als auch an echten Robotern, übertraf Riemann-1.0 bisherige Methoden um eine signifikante Marge. In einer Simulation, die darauf ausgelegt war, lange, komplexe Aufgaben mit vielen Schritten zu testen, war das Modell in 62,6 % der Fälle erfolgreich, was eine bemerkenswerte Verbesserung gegenüber den besten bestehenden Systemen darstellt. In einer anderen Simulation, die sich auf zweiarmige Roboter konzentrierte, erreichte es eine Erfolgsquote von 94,3 %. Vielleicht am beeindruckendsten war, dass das System bei der Anwendung auf echten Robotern zur Ausführung von Aufgaben wie dem Stapeln farbiger Blöcke, dem Falten von Kleidung, dem Organisieren eines unordentlichen Schreibtisches oder dem Anordnen von Küchenutensilen in 85 % der Fälle erfolgreich war. Es zeigte auch eine bemerkenswerte Fähigkeit, sich an neue Situationen anzupassen, die es zuvor nicht gesehen hatte, wie etwa das Platzieren eines Rubik's Cubes in eine Box oder das Legen eines Handtuchs in ein Becken, wobei es in 85 % dieser neuartigen Versuche erfolgreich war.

Über die bloße Funktion als Robotersteuerung hinaus kann Riemann-1.0 auch als Simulator fungieren. Da es die kausale Verbindung zwischen einer Handlung und dem visuellen Ergebnis versteht, können Forscher es fragen, was passieren würde, wenn ein Roboter eine bestimmte Bewegung ausführt. Das Modell kann ein Video der Zukunft generieren, das genau zeigt, wie sich Objekte bewegen und wo sie landen würden, basierend auf der bereitgestellten Handlung. Diese duale Fähigkeit bedeutet, dass das System sowohl als das Gehirn fungieren kann, das entscheidet, was zu tun ist, als auch als die Vorstellungskraft, die prüft, ob der Plan funktionieren wird, bevor der Roboter sich überhaupt bewegt. Diese Fähigkeit, die Zukunft der physischen Welt vorherzusagen, begründet in der Realität dessen, wie Handlungen Veränderungen bewirken, stellt einen bedeutenden Schritt nach vorn dar, um künstliche Intelligenz zu einem zuverlässigen Partner in der physischen Welt zu machen. Die Arbeit legt nahe, dass Maschinen durch die Vereinigung des Lernens darüber, wie man handelt, mit dem Lernen darüber, wie die Welt reagiert, ein robusteres und verallgemeinerbares Verständnis der Aufgaben entwickeln können, die wir jeden Tag ausführen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →