JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling
JEPA-WAM introduceert een latent wereldactiemodel gebouwd op een voorgetrainde V-JEPA-ruimte dat ruimtelijk gestructureerde toekomstvoorspelling en continue actiegeneratie verenigt via een gedeelde voorspeller, waarmee het de beste prestaties bereikt op benchmarks voor robotmanipulatie zonder dat grootschalige beleidsvoorpretraining vereist is.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je een robot leert koken. Je zou de robot gewoon een video kunnen laten zien van een chef die uien snijdt en zeggen: "Doe dat." Maar als de robot alleen het exacte uiterlijk van die specifieke video onthoudt, kan hij in paniek raken als de chef een andere hoed draagt of als het licht in de keuken verandert. Dit is de uitdaging van Vision-Language-Action (VLA) modellen: ze zijn erg goed in het opvolgen van instructies in vertrouwde omgevingen, maar ze struikelen vaak wanneer de wereld er net even anders uitziet dan waarvoor ze getraind zijn.
Om dit op te lossen, hebben wetenschappers geprobeerd robots te leren om "voorspellers" te zijn. In plaats van alleen te reageren, probeert de robot te bedenken wat er hierna zal gebeuren. Als de robot kan voorspellen dat "als ik deze beker duw, deze van de tafel zal glijden", kan hij beter plannen. Maar het maken van een robot die volledige, high-definition video's van de toekomst genereert, is alsof je een student vraagt een hele roman te schrijven, enkel om te beslissen wat hij nu moet doen — het kost te veel tijd en rekenkracht. Daarom zochten onderzoekers naar een kortere weg: een "latent" model dat de idee van de toekomst voorspelt zonder het hele plaatje te tekenen. Maar hier zit de crux: veel van deze kortere wegen verliezen ofwel te veel detail, of behandelen de voorspelling en de actie als twee aparte, losgekoppelde taken.
Dit brengt ons bij JEPA-WAM, een nieuwe aanpak die probeert robots te leren de "stroom" van de tijd te "voelen" zonder erdoor te worden afgeremd om elke individuele frame te tekenen. Het stelt een simpele vraag: Kunnen we een robot leren hoe de wereld verandert, en die kennis gebruiken om beter te bewegen, allemaal in één vloeiende beweging?
De "Tijdgevoel"-afkorting van de Robot
Maak kennis met JEPA-WAM. Denk aan een robot die niet alleen naar een foto van het heden kijkt en de volgende foto raadt; in plaats daarvan leert het de relatie tussen de twee.
Stel je voor dat je naar een goocheltruc kijkt. Een goochelaar legt een rode bal in een doos, en haalt er vervolgens een blauwe bal uit. Een standaard robot zou simpelweg "Rode Bal → Blauwe Bal" onthouden. Maar JEPA-WAM is als een detective die de transitie opmerkt: "De rode bal verdween, de doos schudde, en een blauwe bal verscheen." Het leert het verhaal van de verandering, niet alleen het voor en na.
De onderzoekers bouwden dit systeem bovenop een vooraf getraind "visueel brein" genaamd V-JEPA. Je kunt V-JEPA zien als een robot die al miljoenen video's heeft bekeken en heeft geleerd hoe objecten bewegen en interageren. JEPA-WAM neemt dit brein en voegt daar een speciale "tijdreis"-module aan toe.
Hier is de goocheltruc: In plaats van de robot te vragen een wazige video van de toekomst te genereren (wat traag en duur is), vraagt JEPA-WAM de robot om een gezamenlijke kaart (joint map) te voorspellen. Stel je voor dat je nu een foto maakt van de keuken en vijf seconden later nog een foto van de keuken, en die op elkaar stapelt. JEPA-WAM probeert niet de toekomstige foto vanaf nul te tekenen. In plaats daarvan kijkt het naar het verschil tussen de twee gestapelde foto's en leert het precies te voorspellen hoe de pixels zijn verschoven. Het leert dat "de beker twee inch naar links is bewogen" en "de lade is geopend", waardoor de fijne details van waar dingen gebeurden behouden blijven.
Het Gedeelde Brein: Eén Voorspeller, Twee Taken
Het slimste deel van JEPA-WAM is hoe het zijn brein gebruikt. In veel oude systemen waren het deel dat de toekomst voorspelde en het deel dat de armen van de robot bewoog als twee verschillende mensen die door een muur heen met elkaar praatten. De een raadde de toekomst, en de ander probeerde te luisteren.
JEPA-WAM gebruikt een Shared Predictor (Gedeelde Voorspeller). Stel je een enkele, superintelligente student voor die een toets maakt.
- Taak A: De student kijkt naar de huidige scène en voorspelt hoe de wereld zal veranderen (het "Tijdgevoel").
- Taak B: De student gebruikt diezelfde kennis om te beslissen hoe de armen van de robot moeten bewegen (de "Actie").
Omdat de student beide taken tegelijkertijd uitvoert, vormt het leren over de toekomst direct de manier waarop de student beweegt. De paper suggereert dat deze nauwe koppeling de robot veel slimmer maakt. Het is als een danser die niet alleen stappen uit het hoofd leert, maar het ritme van de muziek begrijpt; de beweging vloeit natuurlijk omdat de voorspelling en de actie voortkomen uit hetzelfde begrip.
Werkt het daadwerkelijk?
De onderzoekers testten dit idee in drie verschillende werelden: een standaard videogame-simulatie, een chaotischere simulatie met willekeurige objecten, en een echte robotarm in een laboratorium.
In de Simulaties:
Op een benchmark genaamd LIBERO-Plus, die test hoe goed robots omgaan met veranderingen in de omgeving (zoals verschillende verlichting of objectposities), scoorde JEPA-WAM 79,2%. Dit was het beste resultaat onder robots die niet vooraf getraind waren op enorme hoeveelheden robotdata. Nog indrukwekkender: toen ze deze "tijdgevoel"-truc toepasten op een al krachtig robotbrein genaamd π0.5, steeg de score van 84,5% naar 86,3%. Dit suggereert dat zelfs slimme robots slimmer kunnen worden als ze leren de stroom van de tijd te voorspellen.
In de Wereld van Echt:
Het team nam hun robot mee naar een echt lab met een dual-arm setup (twee robotarmen die samenwerken). Ze vroegen de robot taken uit te voeren zoals het stapelen van blokken, het leggen van fruit op een bord, of het openen van een lade.
- Wanneer de opstelling exact was zoals verwacht (In-Distribution), scoorde JEPA-WAM ongeveer 59,8%.
- Wanneer ze de achtergrond veranderden of de objecten rondverschoof (Out-of-Distribution), behaalde JEPA-WAM nog steeds 54,2%.
- Ter vergelijking: een standaard robot (π0) zakte van 51,8% naar een wankele 22,5% wanneer de omgeving veranderde.
Dit laat zien dat JEPA-WAM veel robuuster is. Het memoriseert niet alleen een specifieke scène; het leert de logica van hoe objecten bewegen, zodat het verrassingen kan opvangen.
Wat het niet is (en wat het uitsluit)
De paper is voorzichtig in het benoemen van wat JEPA-WAM niet is.
- Het is geen videogenerator. Het probeert geen nieuwe, high-definition video van de toekomst te creëren. De auteurs stellen dat het proberen te genereren van elke pixel te kostbaar en vaak onnodig is voor het besturen van een robot.
- Het gaat niet alleen over het voorspellen van de eindtoestand. De onderzoekers testten een versie die alleen naar het "toekomstige" beeld keek zonder het "huidige" beeld, en die presteerde slechter (77,3% vs 79,2%). Dit bewijst dat het begrijpen van de relatie tussen "nu" en "later" belangrijker is dan alleen het raden van het eindresultaat.
- Het is geen wondermiddel voor alles. De auteurs merken op dat als dezelfde visuele scène tot twee zeer verschillende uitkomsten leidt op basis van een specifieke instructie (bijv. "duw de beker" vs "trek de beker"), het model moeite kan hebben omdat het zich richt op visuele veranderingen in plaats van taal-specifieke doelen.
De Kern van het Verhaal
JEPA-WAM suggereert dat het geheim om robots aanpasbaarder te maken niet alleen ligt in het geven van meer data of grotere hersenen, maar in het leren begrijpen van de stroom van de tijd op een manier die direct hun acties stuurt. Door een gedeeld brein te gebruiken om te voorspellen hoe de wereld verandert en te beslissen hoe ze moeten bewegen, wordt de robot meer als een bekwame mens die zich kan aanpassen aan een rommelige keuken zonder in paniek te raken.
De resultaten, gemeten in simulaties en praktijktesten, suggereren dat deze "gezamenlijke voorspelling"-aanpak een krachtige manier is om robots te bouwen die de onvoorspelbare aard van de echte wereld aankunnen. Hoewel het geen opgelost probleem is voor elke mogelijke taak, biedt het een veelbelovend nieuw pad om robots te maken die niet alleen gehoorzaam zijn, maar ook echt aanpasbaar.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.