CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators
CLAP is een nieuw framework dat zero-shot fysieke simulatie mogelijk maakt over diverse robot- en menselijke belichamingen door te trainen op heterogene internet-schaal video's, waarbij uiteenlopende actieruimtes worden verzoend via een curriculum-gebaseerd leerrecept om state-of-the-art prestaties te bereiken in few-shot adaptatie en generaliseerbaar begrip van fysica.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Robots worstelen al lang met het begrijpen van de fysieke wereld op de manier waarop mensen dat doen. Terwijl een kind leert dat een beker eraf valt als je er tegenaan duwt of dat een handdoek gevouwen kan worden door aan de hoeken te trekken, hebben robots vaak duizenden specifieke voorbeelden nodig om zelfs de eenvoudigste van deze regels te leren. Deze moeilijkheid komt voort uit het feit dat de meeste leerprocessen voor robots getraind worden op gegevens van één specifiek type machine. Een robot met een lange, dunne arm leert fysica anders dan een robot met een grijper of een menselijke hand, wat een barrière creëert waarbij kennis die door de één is opgedaan, niet gemakkelijk gedeeld kan worden met een ander. Om dit te overwinnen, zijn wetenschappers gaan kijken naar videogeneratiemodellen, wat computerprogramma's zijn die in staat zijn om te verbeelden wat er volgt in een scène. Als een robot een video zou kunnen bekijken en de toekomstige beweging van objecten zou kunnen voorspellen, zou hij zijn acties kunnen plannen zonder ze eerst fysiek te hoeven proberen. Deze voorspellende modellen waren echter historisch gezien beperkt tot één enkel type robot, waardoor ze niet konden leren van de enorme, diverse bibliotheek aan menselijke en robotvideo's die op internet beschikbaar zijn.
Een team onderzoekers aan de Princeton University heeft een nieuw framework ontwikkeld genaamd CLAP om deze kloof te overbruggen. Hun werk demonstreert dat één enkel videomodel de universele wetten van de fysica kan leren door te trainen op een enorme mix van video's met zowel mensen als vele verschillende soorten robots. De kern van het idee is dat hoewel een menselijke hand, een robotarm en een grijper er allemaal verschillend uitzien, ze allemaal dezelfde fysieke regels volgen wanneer ze objecten bewegen. Door een computer te leren de toekomst van een scène te voorspellen, ongeacht wie of wat de actie uitvoert, creëerden de onderzoekers een systeem dat de onderliggende mechanica van de wereld begrijpt in plaats van alleen de specifieke bewegingen van één machine. Deze aanpak stelt het model in staat om te leren van ongelabelde internetvideo's, waar geen instructies worden meegeleverd, evenals van gedetailleerde robotgegevens, wat zorgt voor een veel rijkere begrip van hoe dingen bewegen en interageren.
De onderzoekers stuitten op een aanzienlijke hindernis omdat de gegevens die ze wilden gebruiken rommelig en inconsistent waren. Video's van mensen bevatten geen instructies over hoe hun handen bewogen, en verschillende robots gebruiken verschillende manieren om hun bewegingen te beschrijven. Om dit op te lossen, creëerde het team een methode om al deze verschillende talen van beweging te vertalen naar een gemeenschappelijk formaat. Ze gebruikten drie hoofdinstrumenten: de precieze positie van een robothand, eenvoudige tekstuele beschrijvingen van de beweging, en een verborgen, geleerde representatie van actie die de computer zelf ontdekt. De meest effectieve strategie omvatte een stapsgewijs leerproces. Eerst leerde het model de basisregels van de fysica door ongelabelde video's te bekijken met behulp van de verborgen actierepresentaties. Zodra het de fundamentele dynamica begreep, verfijnden de onderzoekers de kennis met behulp van precieze gegevens van robots met gelabelde bewegingen. Deze tweestapsbenadering stelde het systeem in staat om op te schalen met behulp van de enorme hoeveelheid internetvideo's, terwijl het nog steeds nauwkeurig genoeg bleef om echte robots aan te sturen.
De resultaten van dit werk laten zien dat het nieuwe systeem even goed presteert als, en vaak beter is dan, de beste bestaande modellen die alleen getraind zijn op één type robot. In uitdagende testomgevingen kon het model de toekomstige frames van een video met hoge nauwkeurigheid voorspellen, waarbij het correct simuleerde hoe objecten zouden vallen, glijden of gemanipuleerd zouden worden. Cruciaal is dat het systeem in staat was deze kennis te generaliseren naar taken in de echte wereld zonder dat het voor elke nieuwe robot opnieuw getraind hoefde te worden. Wanneer het werd getest op een eenarmige robot, hielp het systeem de robot succesvol bij het plannen van acties om diverse objecten op te pakken, zoals tape, vis of kreeft, waarbij het standaard robotbeleid overtrof. Nog indrukwekkender was dat het systeem kon worden toegepast op een twee-armige robot en een humanoïde robot met een andere lichaamsstructuur, ondanks het feit dat het nooit getraind was op gegevens van die specifieke machines. Door simpelweg de laatste laag van het model aan te passen om overeen te komen met de bewegingen van de nieuwe robot, behield het systeem zijn diepe begrip van de fysica en bleef het nauwkeurige voorspellingen doen.
Dit onderzoek suggereert dat de weg naar meer capabele robots niet vereist dat er een uniek brein wordt gebouwd voor elke nieuwe machine. In plaats daarvan kan een enkel model, door te trainen op een diverse mix van gegevens, een algemene set fysieke principes leren die van toepassing zijn op bijna elke actor. De onderzoekers ontdekten dat relatieve bewegingen, die verandering beschrijven in plaats van positie, goed werkten voor tekstgebaseerde instructies, maar dat absolute posities noodzakelijk waren voor precieze controle met robotarmen. Ze ontdekten ook dat menselijke video's uitstekend waren om het model de basis van de fysica te leren, maar dat gegevens van daadwerkelijke robots essentieel waren om die kennis te vertalen naar succesvolle acties in de echte wereld. Het werk vestigt een nieuwe manier om robots te trainen, waarbij men beweegt van geïsoleerde, enkeldoelgerichte systemen naar een meer verenigde aanpak waarbij leren van de ene belichaming direct ten goede kan komen aan een andere. Hoewel het systeem niet perfect is en soms fouten kan maken in zijn voorspellingen, vertegenwoordigt het een belangrijke stap voorwaarts in het leren van machines om de fysieke wereld te begrijpen door observatie en verbeelding.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.