AnyWorld: Factorized Egocentric World Models for Cross-Embodiment Generalization
Het artikel introduceert AnyWorld, een gefactoriseerd wereldmodelleringsframework dat diverse, cross-embodiment robotervaringen synthetiseert uit enkele menselijke egocentrische video's door actie-, camera- en embodimentfactoren te ontkoppelen, waardoor controleerbare datageneratie mogelijk wordt die manipulatiebeleid op zowel gesimuleerde als echte humanoïde robots aanzienlijk verbetert.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots leren meer te doen dan alleen maar in rechte lijnen bewegen; ze leren om de wereld om hen heen te manipuleren, door voorwerpen op te pakken, deuren te openen en onderdelen te assembleren. Om deze vaardigheden te leren, heeft een robot ervaring nodig. Het moet duizenden voorbeelden zien van hoe een hand naar een kopje reikt, hoe een grijper een spons knijpt en hoe een gereedschap over een tafel glijdt. Lange tijd was de enige manier om deze ervaring op te doen, het robot zelf de taak te laten uitvoeren, keer op keer. Dit is traag, duur en beperkt door hoeveel robots een laboratorium zich kan veroorloven te bouwen en hoeveel uren ze kunnen draaien zonder kapot te gaan.
Een veelbelovend alternatief is opgekomen uit een onverwachte bron: menselijke video's. Elke dag nemen mensen zichzelf op terwijl ze koken, schoonmaken en dingen bouwen. Deze video's zitten vol rijke, fysieke interacties waar robots van kunnen leren. Er is echter een groot probleem. Een video van een mens die kookt, toont een menselijke hand, een menselijk lichaam en een menselijk gezichtspunt. Een robot heeft geen menselijk lichaam en ziet de wereld niet vanuit een menselijk hoofd. Als een robot een menselijke video direct probeert te kopiëren, kan hij falen omdat de menselijke arm langer is, de camera van de robot op een andere plek zit of de grijper van de robot anders werkt. De uitdaging voor wetenschappers is om uit te vogelen hoe ze de nuttige "verhaallijn" van wat er in een menselijke video gebeurt, kunnen vertellen op een manier die zinvol is voor een robot.
Een team van onderzoekers heeft een nieuw systeem ontwikkeld genaamd AnyWorld om dit probleem op te lossen. In plaats van te proberen een menselijke video exact te kopiëren, breekt het systeem de video af in drie afzonderlijke ingrediënten: de actie die wordt uitgevoerd, de manier waarop de camera beweegt, en het lichaam en de scène die het werk verrichten. Denk aan de actie als het script van wat er gebeurt, de camerabeweging als de regie van de opname, en het lichaam en de scène als de acteurs en het decor. Door deze elementen te scheiden, kunnen de onderzoekers een enkele video van een mens die een taak uitvoert nemen en die ingrediënten combineren om een gloednieuwe video te creëren. In deze nieuwe video is de "acteur" een robot, de "set" de omgeving van een robot, en de "camera" het oog van een robot, maar het "script" van de actie blijft hetzelfde.
De onderzoekers trainden hun systeem met een enorme collectie menselijke video's waarin mensen met voorwerpen interageren. Ze leerden het model het verschil te begrijpen tussen de beweging van de taak en het specifieke lichaam dat de taak uitvoert. Zodra het model dit begreep, testten ze het door een menselijke video in te voeren en het systeem te vragen een versie te genereren van diezelfde taak uitgevoerd door een robot. Ze hadden geen video's nodig die lieten zien hoe een mens en een robot dezelfde taak zij aan zij uitvoerden. Het systeem nam simpelweg de bewegingen van de mens en het pad van de camera, en verving deze vervolgens door een robotlichaam en een robotscène. Het resultaat was een video die eruitzag alsof een robot de taak uitvoerde, compleet met de juiste perspectief en de fysieke beperkingen van die specifieiele machine.
Het team testte dit vermogen om het lichaam, de camerahoek en de scène te veranderen. Ze lieten zien dat het systeem een menselijke video kon nemen en een versie kon genereren waarin een robot genaamd RoboCasa GR1 de taak uitvoerde, en een andere versie waarin een andere robot genaamd IRON het deed. Ze lieten ook zien dat ze de robot en de taak hetzelfde konden houden maar de camerahoek konden veranderen, waardoor een view ontstond vanuit een ander perspectief. Cruciaal was dat het systeem de logica van de interactie behield. Als een mens in de oorspronkelijke video een kopje oppakte en het naar een plank verplaatste, toonde de gegenereerde robotvideo de robot die exact dezelfde reeks bewegingen uitvoerde, maar dan aangepast aan zijn eigen lichaamsvorm en camerapositie.
Om te bewijzen dat deze gegenereerde video's daadwerkelijk nuttig waren, gebruikten de onderzoekers ze om echte robots te trainen. Ze namen een standaard robot-leersysteem en gaven het extra training met behulp van de door AnyWorld gecreëerde video's. Ze testten dit op een simulatie van een robotarm en op een echte, fysieke humanoïde robot. In de simulatie verbeterde het succespercentage van de robot bij het oppakken en plaatsen van voorwerpen aanzienlijk na training met de gegenereerde data. Op de echte robot was de verbetering zelfs nog dramatischer. Een robot die alleen in staat was om een banaan in 20 procent van de pogingen succesvol vast te pakken, sprong naar een succespercentage van 55 procent na training met de mens-naar-robot video's. Dit toonde aan dat het systeem niet alleen mooie plaatjes maakte; het creëerde geldige trainingsdata die de robot hielpen beter te leren.
De onderzoekers onderzochten ook precies waarom dit werkte. Ze wilden weten of het simpelweg vertellen van de robot welke actie hij moest uitvoeren genoeg was, of dat het zien van de visuele scène ook noodzakelijk was. Ze voerden een test uit waarbij ze de robot de juiste actiecommando's gaven, maar de visuele trainingsdata van de originele, ongewijzigde robotvideo's behielden. Deze aanpak slaagde er niet in om de robot te leren hoe hij specifieke instructies moest volgen, zoals het kiezen van de linker banaan in plaats van de rechter. Echter, wanneer ze het volledige systeem gebruikten om zowel de nieuwe visuele scène als de juiste actie te genereren, leerde de robot de instructies betrouwbaar op te volgen. Dit bewees dat de visuele hercompositie essentieel was. De robot moest de wereld vanuit zijn eigen perspectief zien om de actie toe te kunnen passen.
De studie suggereert dat deze methode om interacties af te breken in afzonderlijke factoren ervoor zorgt dat een enkele menselijke ervaring vele malen kan worden hergebruikt. Een menselijke video die ooit beperkt was tot een menselijk lichaam en een menselijke camera, kan een bron van trainingsdata worden voor vele verschillende soorten robots, in vele verschillende omgevingen. De onderzoekers merkten op dat hoewel het systeem krachtig is, het ook beperkingen heeft. Het kan nog niet het gevoel van aanraking of de exacte kracht die nodig is om een zacht object samen te knijpen, vastleggen, aangezien dit fysieke sensoren vereist die de videogeneratie niet biedt. Daarnaast is het systeem afhankelijk van het duidelijk kunnen volgen van de menselijke bewegingen; als de video te schokkerig is of de persoon achter een object verborgen is, heeft het systeem moeite.
Ondanks deze beperkingen biedt het werk een nieuwe weg voorwaarts voor robot-leren. Het suggereert dat de enorme bibliotheek aan menselijke video's op internet, die moeilijk te gebruiken was voor robots vanwege de verschillen in lichamen en standpunten, nu kan worden aangewend. Door een model te gebruiken dat begrijpt hoe de actie van de acteur te scheiden, kunnen wetenschappers menselijke ervaringen in robotervaringen veranderen zonder elke taak met elke robot opnieuw te hoeven opnemen. Dit zou robots in staat stellen om complexe vaardigheden veel sneller te leren, door de overvloedige data van het menselijke dagelijks leven als fundament voor hun eigen capaciteiten te gebruiken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.