← Nieuwste papers
🤖 AI

ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models

ForgeWM introduceert een progressief trainingsframework dat bidirectionele videogeneratoren transformeert in efficiënte, laag-latente few-step world models die in staat zijn om discrete en continue game-besturingen nauwkeurig af te stemmen op videogeneratie, waarbij state-of-the-art prestaties in kwaliteit en controle-nauwkeurigheid worden bereikt door technieken zoals causal consistency distillation en een dual-path deployment protocol met replay-time refinement.

Oorspronkelijke auteurs: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

Gepubliceerd 2026-08-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Xinye Li, Lingshuai Lin, Lei Wang, Liuzhou Zhang, Jialin Cui, Qingshan Li, Guanchu Wang, Qingbin Liu, Xi Chen, Jiang Bian, Wai Lam

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een wereld voor waarin je computer niet alleen een film bekijkt, maar ook het spel ín de film daadwerkelijk speelt, waarbij hij precies voorspelt wat er volgt op basis van de knoppen die je indrukt. Dit is het domein van video world models, een tak van kunstmatige intelligentie die probeert de werkelijkheid te simuleren. Denk eraan als een superintelligente verhalenverteller die elk boek in de bibliotheek heeft gelezen en direct het volgende hoofdstuk kan verzinnen. Meestal zijn deze verhalenvertellers geweldig in het schrijven van lange, gedetailleerde verhalen, maar ze zijn traag. Als je een videogame in realtime wilt spelen, heb je een verhalenverteller nodig die de volgende zin direct kan fluisteren, anders bevriest de game of loopt hij vast. De uitdaging is dat het maken van deze modellen vaak snel onhandig maakt; ze kunnen vergeten wat je ze zojuist hebt verteld of de richting van je personage verkeerd begrijpen. Dit artikel pakt het lastige probleem aan van het leren aan een AI om zowel razendsnel als perfect gehoorzaam aan jouw besturing te zijn, terwijl de video er tegelijkertijd scherp en echt uitziet.

Maak kennis met ForgeWM, een nieuw framework dat werkt als een meesterkok die een team van sous-chefs traint om hetzelfde heerlijke gerecht te bereiden in verschillende hoeveelheden tijd. De onderzoekers begonnen met een krachtig, traag bewegend AI-model dat video kon genereren in elke richting (vooruit of achteruit in de tijd kijken). Hun doel was om dit om te vormen tot een "few-step" model—één dat de volgende paar seconden video kan generëren in slechts één, twee of vier snelle stappen in plaats van een lang, traag proces. Ze ontdekten dat het simpelweg versnellen van het model niet werkte, omdat de AI in de war raakte door zijn eigen fouten terwijl hij probeerde de toekomst te voorspellen.

Om dit op te lossen, ontwikkelde het team een recept met vier fasen van training. Eerst leerden ze het model de basis van de gamewereld. Daarna dwongen ze het om te leren hoe het vooruit in de tijd beweegt met behulp van alleen schone, perfecte voorbeelden (zoals een student die het perfecte handschrift van een leraar kopieert). Vervolgens lieten ze het model oefenen op zichzelf, maar met een vangnet dat zijn fouten direct corrigeerde. Ten slotte lieten ze het model losgaan in een gesimuleerd spel, waarbij ze het leerden om overeen te komen met de echte distributie van hoe het spel daadwerkelijk verloopt. Het resultaat is een set gespecialiseerde "studenten": een 1-step model voor instant, lage-latentie reacties, een 2-step model voor een balans tussen snelheid en kwaliteit, en een 4-step model voor hogere getrouwheid.

Het artikel laat zien dat deze modellen ongelooflijk goed werken. In tests met Minecraft kon het 1-step model video genereren met 72,10 FPS (frames per seconde), wat snel genoeg is voor vloeiende gameplay in realtime, terwijl het nog steeds je toetsenbord- en muiscommando's met hoge nauwkeurigheid begrijpt. Het 4-step model produceerde zelfs betere visuele kwaliteit en versloeg andere top-systemen in hoe goed het de beoogde beweging en besturing mat. Interessant genoeg ontdekten de onderzoekers dat je de het model niet altijd opnieuw hoeft te trainen om een betere kwaliteit te krijgen. Ze introduceerden een "Replay-Time Refinement" truc: als je een snelle, 1-step gameplay sessie opneemt, kun je die opgeslagen video later nemen en "re-noisen", waarbij je hetzelfde model vraat om het op te schonen en details toe te voegen zonder het pad dat je nam te veranderen. Deze verfijnde video zag er bijna net zo goed uit als wanneer het model vier stappen had genomen om het vanaf nul te genereren, maar behield exact hetzelfde gezichtspunt en de scène-indeling die je ervoer.

Het team liet ook zien dat deze trainingsmethode niet alleen voor Minecraft is. Ze pasten hetzelfde recept toe op First-Person Shooter (FPS) games die worden bestuurd met een gamepad, waardoor ze een model creëerden genaamd ForgeWM-CrossFPS dat er succesvol video genereerde voor games zoals Halo Infinite en Modern Warfare. Hoewel het artikel opmerkt dat deze modellen nog steeds enige degradatie vertonen over zeer lange perioden (zoals het verliezen van blokstructuur na 22 seconden), suggereren de resultaten dat ForgeWM een krachtige, flexibele manier biedt om video world models te bouwen die zowel controleerbaar als snel zijn. De auteurs suggereren dat door de behoefte aan instant reactie te scheiden van de behoefte aan hoogwaardige visuals, we het beste van beide werelden kunnen hebben in interactieve AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →