← Nieuwste papers
💻 computer science

Riemann-1.0: An Embodied World Action Model for Physical AI

Riemann-1.0 is een verenigd causaal autoregressief World Action Model dat multi-view observaties, robottoestanden en acties integreert in één enkel framework, waarbij gebruik wordt gemaakt van een progressieve pretraining-strategie op meer dan 200.000 uur aan diverse belichaamde data om state-of-the-art prestaties te behalen in zowel simulatie als real-world long-horizon manipulatietaken.

Oorspronkelijke auteurs: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

Gepubliceerd 2026-08-28
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Haofeng Sun, Jiangbo Pei, Fei Kang, Zexiang Liu, Yaokun Li, Boyi Jiang, Hua Xue, Cindy Zhou, Wei Li, Yichen Wei, Mengyin An, Fanliang Zhao, Biao Jiang, Zile Wang, Yang Liu, Yangguang Li

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Kunstmatige intelligentie is al lang een meester in de digitale wereld, het lezen van tekst, het herkennen van afbeeldingen en het oplossen van puzzels binnen de grenzen van een computerscherm. Maar om machines echt met ons deel te kunnen uitmaken in de fysieke wereld, moeten ze meer doen dan alleen begrijpen wat ze zien; ze moeten leren handelen binnen die wereld. Dit is de uitdaging van belichaamde intelligentie (embodied intelligence): robots leren hun omgeving waar te nemen, na te denken over oorzaak en gevolg, en fysieke bewegingen uit te voeren met dezelfde vloeiendheid waarmee een mens een kopje oppakt of een shirt opvouwt. Voor een machine om te slagen, heeft het een model van de wereld nodig dat niet alleen begrijpt hoe objecten eruitzien, maar ook hoe ze bewegen en veranderen wanneer ze worden aangeraakt. Het moet leren dat het duwen van een blokje ervoor zorgt dat het glijdt, en dat het optillen van een deksel onthult wat erin zit. Tot nu toe was het creëren van een enkel systeem dat zowel deze fysieke acties kan plannen als de visuele gevolgen van die acties kan voorspellen een moeilijke hindernis, wat vaak aparte systemen vereiste voor het denken en voor het bewegen.

Een team van onderzoekers heeft een nieuw systeem geïntroduceerd genaamd Riemann-1.0, ontworpen om deze kloof te overbruggen door de acties van een robot en de resulterende veranderingen in de wereld te behandelen als één doorlopend verhaal. In plaats van aparte hulpmiddelen te bouwen om te beslissen wat te doen en hulpmiddelen om te bedenken wat er vervolgens zal gebeuren, leert dit model beide tegelijkertijd te doen. Het werkt volgens een simpel maar krachtig principe: in de echte wereld vindt een actie altijd plaats voordat het resultaat wordt gezien. Als een robot naar een lepel reikt, vindt de beweging eerst plaats, en de visuele verandering — de lepel die beweegt — volgt daarna. Riemann-1.0 is gebouwd om dit respect te hebben, waarbij het leert van een enorme collectie video- en bewegingsdata om precies te voorspellen wat een robot hierna moet doen en hoe de wereld eruit zal zien nadat hij dat heeft gedaan.

Om dit systeem te onderwijzen, verzamelden de onderzoekers een uitgebreide bibliotheek van ervaringen, die in totaal meer dan 200.000 uur aan interactie beslaat. Deze collectie was niet slechts een stapel robotvideo's; het was een zorgvuldig samengestelde mix van drie verschillende soorten leermateriaal. Ten eerste bevatten ze duizenden uren aan video's opgenomen vanuit het perspectief van een mens, die mensen laten zien bij het uitvoeren van alledaagse taken zoals koken of schoonmaken. Deze video's boden een breed begrip van hoe objecten interageren en hoe taken zich in de loop van de tijd ontvouwen, ook al ontbrak de specifieke mechanische data van een robot. Ten tweede voegden ze demonstraties toe van handgehouden robot-grippers en draagbare apparaten, die dienen als een brug door te laten zien hoe menselijke handbewegingen vertalen naar machine-achtige controles. Ten slotte voegden ze nauwkeurige opnames van werkelijke robotbewegingen toe, die de exacte, uitvoerbare instructies boden die nodig zijn om de machine te leren hoe hij zijn eigen ledematen moet bewegen. Door deze bronnen te combineren, creëerden de onderzoekers een verenigde dataset die het model in staat stelde om te leren van de brede wijsheid van de menselijke ervaring, terwijl die kennis werd verankerd in de precieze mechanica van robotbesturing.

Het trainingsproces voor Riemann-1.0 was gestructureerd als een schoolcurriculum, bewegend van algemene observatie naar specifieke uitvoering. In de eerste fase bestudeerde het model de enorme bibliotheek van menselijke video's. Omdat deze video's geen robotbewegingsdata bevatten, gebruikte het systeem een hulpmiddel om de onzichtbare "acties" te schatten die de visuele veranderingen op het scherm moesten hebben veroorzaakt. Hierdoor kon het model de basisdynamiek leren van hoe de wereld beweegt zonder dat daar perfecte robotdata voor nodig was. In de tweede fase werd het model geïntroduceerd aan de gemengde data van menselijke handen en robot-grippers, waarbij het leerde zijn begrip van beweging af te stemmen op echte, fysieke controles. Ten slotte richtte het model zich in de derde fase uitsluitend op hoogwaardige opnames van robots die taken uitvoeren. Deze laatste fase verscherpte het vermogen om precieze, uitvoerbare commando's te genereren, waardoor werd gewaarborgd dat de geplande acties niet alleen visueel aannemelijk waren, maar ook fysiek mogelijk voor een echte machine om uit te voeren.

De resultaten van deze aanpak waren opmerkelijk. Wanneer het werd getest op een grote verscheidenheid aan taken, zowel in computersimulaties als op echte robots, presteerde Riemann-1.0 met een aanzienlijke marge beter dan eerdere methoden. In een simulatie die ontworpen was om lange, complexe taken met veel stappen te testen, slaagde het model in 62,6% van de gevallen, een opvallende verbetering ten opzien van de beste bestaande systemen. In een andere simulatie gericht op tweearmige robots behaalde het een succespercentage van 94,3%. Misschien wel het meest indrukwekkend was dat, wanneer het op echte robots werd ingezet om taken uit te voeren zoals het stapelen van gekleurde blokjes, het vouwen van kleding, het organiseren van een rommelig bureau of het ordenen van keukenartikelen, het systeem de taken in 85% van de gevallen succesvol voltooide. Het toonde ook een opmerkelijk vermogen om zich aan te passen aan nieuwe situaties die het nog niet eerder had gezien, zoals het plaatsen van een Rubiks kubus in een doos of het leggen van een handdoek in een bak, waarbij het in 85% van deze nieuwe proeven slaagde.

Naast het simpelweg fungeren als een robotcontroller, kan Riemann-1.0 ook functioneren als een simulator. Omdat het de causale link begrijpt tussen een actie en het visuele resultaat, kunnen onderzoekers het vragen om te visualiseren wat er zou gebeuren als een robot een specifieke beweging zou uitvoeren. Het model kan een video van de toekomst genereren, die precies laat zien hoe objecten zouden bewegen en waar ze terecht zouden komen, gebaseerd op de verstrekte actie. Deze dubbele capaciteit betekent dat het systeem zowel kan dienen als de hersenen die beslissen wat te doen, als de verbeelding die controleert of het plan zal werken voordat de robot überhaupt beweegt. Dit vermogen om de toekomst van de fysieke wereld te voorspellen, geworteld in de realiteit van hoe acties veranderingen veroorzaken, vertegenwoordigt een belangrijke stap voorwaarts in het maken van kunstmatige intelligentie tot een betrouwbare partner in de fysieke wereld. Het werk suggereert dat door het leren van hoe te handelen te verenigen met het leren van hoe de wereld reageert, machines een robuuster en meer generaliseerbaar begrip kunnen ontwikkelen van de taken die wij dagelijks uitvoeren.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →