← Nieuwste papers
🤖 machine learning

JEDI: Joint Embedding Diffusion World Model for Online Model-Based Reinforcement Learning

JEDI introduceert het eerste online end-to-end latente diffusiewereldmodel dat JEPA-stijl voorspellend representatieleren verenigt met diffusiedoelstellingen om superieure efficiëntie en concurrerende prestaties te bereiken in modelgebaseerde versterkingsleer, zowel in vergelijking met op pixels gebaseerde als met afzonderlijk getrainde latente benaderingen.

Oorspronkelijke auteurs: Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

Gepubliceerd 2026-05-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een robot probeert te leren videospellen spelen. Om dit efficiënt te doen, heeft de robot een "wereldmodel" nodig—een mentale simulatie van hoe het spel werkt, zodat het in zijn hoofd kan oefenen voordat het daadwerkelijk speelt.

Lange tijd was de beste manier om deze mentale simulatie te bouwen, om de robot de gamescherm pixel voor pixel te laten reconstrueren, zoals een schilder die probeert een foto exact na te bootsen. Dit is accuraat, maar zeer traag en vereist een enorme hoeveelheid computergeheugen (alsof je probeert een bibliotheek in je rugzak te dragen).

Onlangs werd een nieuwe techniek genaamd Diffusie populair. Denk aan diffusie als een beeldhouwer die begint met een blok modderige, met ruis doordrenkte klei en langzaam het geluid wegbeitelt om een helder standbeeld te onthullen. Dit is geweldig voor het begrijpen van complexe scènes, maar het doen pixel voor pixel is nog steeds te zwaar voor een robot om in real-time uit te voeren.

Een andere benadering probeerde het spel eerst te comprimeren tot een kleine, abstracte "samenvatting" (een latente ruimte), maar deze samenvattingen werden vaak afzonderlijk getraind en leerden de spelregels op zichzelf niet goed genoeg.

Maar dan komt JEDI (Joint Embedding Diffusion).

De auteurs van dit artikel creëerden een nieuwe methode die het beste van beide werelden combineert. Hier is hoe JEDI werkt, met behulp van eenvoudige analogieën:

1. De "Mentale Snapshot" versus het "Schilderij"

  • Oude manier (Pixel Diffusie): Stel je voor dat de robot probeert elk enkel korreltje zand op een strand te memoriseren om de oceaan te begrijpen. Het is accuraat, maar het duurt eeuwen en kost al zijn hersencapaciteit.
  • JEDI's manier: In plaats van het zand te memoriseren, leert JEDI de robot een mentale snapshot te nemen van de essentie van de oceaan (de golven, de kleur, de beweging). Het geeft niets om individuele zandkorrels. Het comprimeert het gamescherm tot een kleine, efficiënte "samenvatting" die alleen vastlegt wat er toe doet om te winnen.

2. De "Gokspel"-training

Hoe leert de robot deze snapshots te nemen?

  • De oude manier: De robot werd vaak getraind door een afbeelding te laten zien en gevraagd te worden om deze exact opnieuw te schilderen. Als het een detail miste, kreeg het een straf. Dit is alsof een student wordt beoordeeld op zijn handschrift in plaats van op het begrijpen van het verhaal.
  • De JEDI-methode: JEDI gebruikt een voorspellend gokspel.
    1. De robot ziet de huidige spelstatus.
    2. Het wordt gevraagd te raden hoe de volgende "mentale snapshot" eruit zal zien.
    3. Om het moeilijker (en slimmer) te maken, neemt de computer de werkelijke volgende snapshot, voegt wat "ruis" toe (alsof het wordt wazig gemaakt), en vraagt de robot om het te ontruisen tot helderheid.
    4. Cruciaal leert de robot dit terwijl het speelt. Het heeft geen aparte leraar nodig om te laten zien hoe het moet schilderen; het leert de regels van het spel door te proberen de toekomst te voorspellen.

3. Waarom dit een groot iets is (De resultaten)

Het artikel beweert dat JEDI een grote upgrade is om drie hoofdredenen:

  • Het is slanker: Omdat JEDI werkt met kleine "mentale snapshots" in plaats van volledige videoframes, gebruikt het 43% minder computergeheugen. Het is alsof je overstapt van het dragen van een zware rugzak vol boeken naar het dragen van één slim notitieboekje.
  • Het is sneller: De robot kan 3 keer sneller denken (samplen) en 2,5 keer sneller trainen dan de vorige beste op pixels gebaseerde methoden.
  • Het speelt anders: Dit is het meest verrassende deel. Het artikel vond dat JEDI niet alleen sneller speelt; het speelt anders.
    • Bij spellen die al makkelijk waren voor andere robots, was JEDI goed, maar niet altijd absoluut de beste.
    • Echter, bij de moeilijkste, meest chaotische spellen (zoals schietspellen met veel bewegende doelen), schitterde JEDI. Het leek het chaos beter te hanteren omdat zijn "mentale snapshot" zich richtte op de strategie in plaats van afgeleid te worden door visuele ruis.

De conclusie

Het artikel betoogt dat je geen perfecte schilder hoeft te zijn (elke pixel reconstrueren) om een grote strateeg te zijn. Door de robot te leren de "kern" van de toekomst te voorspellen met behulp van een ruisverwijderingsspel (diffusie), krijg je een systeem dat sneller is, goedkoper te draaien is en verrassend beter is in het hanteren van moeilijke, chaotische situaties.

De auteurs noemen dit JEDI, en zij beweren dat dit de eerste keer is dat deze specifieke "voorspellende gok"-methode succesvol is gecombineerd met "ruisverwijdering" (diffusie) om een robot videospellen online te leren spelen, zonder dat er vooraf getrainde leraren nodig zijn.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →