← Nieuwste papers
💻 computer science

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

Het artikel introduceert minWM, een full-stack open-source framework dat bestaande bidirectionele video-fundatiemodellen omzet in real-time, camera-controleerbare, autoregressieve wereldmodellen met weinig stappen via een uitgebreide pijplijn van fine-tuning, causale forceringstraining en distillatie.

Oorspronkelijke auteurs: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante, high-end filmregisseur (een Video Foundation Model) hebt die prachtige, hoogwaardige films kan maken op basis van een script. Deze regisseur werkt echter zeer traag: hij plant de hele film scène voor scène voordat hij je ook maar één frame laat zien. Als je halverwege het camerahoek wilt veranderen, moet hij stoppen, de hele film opnieuw plannen en opnieuw beginnen. Dit is geweldig voor het maken van een gepolijste film, maar verschrikkelijk voor een videospel of een live-chat waar je directe reacties nodig hebt.

minWM is een nieuw "trainingskamp" en "gereedschapskist" ontworpen om deze trage, perfectionistische regisseur om te toveren tot een realtime interactieve regisseur die direct kan reageren op je commando's, zonder zijn artistieke kwaliteit te verliezen.

Hieronder wordt uitgelegd hoe minWM werkt, opgesplitst in eenvoudige stappen:

1. Het Probleem: De "Trage Regisseur"

Huidige video-AI-modellen zijn als de trage regisseur. Ze zijn geweldig in het maken van prachtige video's, maar ze zijn bidirectioneel. Dit betekent dat ze naar het begin, midden en einde van een video tegelijk kijken om ervoor te zorgen dat alles perfect past.

  • Het Probleem: Als je de camera wilt bewegen of het tafereel in realtime wilt veranderen, kan dit model dit niet snel doen. Het duurt te lang om "na te denken" over de hele video voordat je het eerste frame ziet.

2. De Oplossing: De minWM "Trainingskamp"

minWM is een full-stack framework (een complete set tools) dat een bestaande trage regisseur opleidt om een snelle, interactieve performer te worden. Dit gebeurt in twee hoofdfasen:

Fase 1: Leren de Camera te Bewegen (De "Cameracontrole"-les)

Eerst leert het framework de trage regisseur hoe hij specifieke camerainstructies moet volgen.

  • De Analogie: Stel je voor dat je de regisseur leert een camera op een gimbal te houden. In plaats van te raden waar de camera moet zijn, leren ze een precies pad te volgen dat je voor hen tekent.
  • Hoe: Het team gebruikt een speciale techniek genaamd PRoPE. Denk hierbij aan het geven van een bril aan de regisseur die precies begrijpt waar de camera zich in de 3D-ruimte bevindt. Ze oefenen met video's waarbij de camerabeweging perfect bekend is (zoals een 3D-animatie), zodat de regisseur de exacte relatie leert tussen "beweeg naar links" en "het beeld verschuift naar links".

Fase 2: Het Proces Versnellen (De "Distillatie"-les)

Nu de regisseur camerabewegingen kan volgen, is hij nog steeds te traag. Hij plant nog steeds de hele film voordat hij een frame toont. minWM gebruikt een techniek genaamd Causal Forcing om hem te versnellen.

  • De Analogie: Stel je voor dat een student (het nieuwe snelle model) naast een meesterleraar (het trage, hoogwaardige model) zit.
    1. Teacher Forcing: De student leert het verhaal één zin per keer te schrijven (frame voor frame) in plaats van het hele boek in één keer te plannen. Dit maakt hen sneller.
    2. De "Spiekbrief" (Distillatie): Om de student nog sneller te maken, worden ze getraind om stappen over te slaan. In plaats van 50 kleine stappen te nemen om een plaatje te tekenen, leren ze het in slechts 4 grote, zelfverzekerde streken te doen.
    3. Het Veiligheidsnet (Asymmetric DMD): Er is een risico dat de student door het versnellen begint te tekenen met rommelige plaatjes. Om dit op te lossen, controleert de student af en toe zijn werk tegen de oorspronkelijke meesterleraar. Als de snelle tekening van de student een beetje afwijkt, corrigeert de leraar hen zachtjes, zodat het eindresultaat nog steeds van hoge kwaliteit is.

3. De Resultaten: Van "Cinema" naar "Videospel"

Het paper toont aan dat dit proces ongelooflijk goed werkt:

  • Snelheid: De nieuwe modellen zijn 200+ keer sneller in het tonen van het eerste frame dan de originele trage modellen.
    • Voorheen: Je wacht meer dan 10 seconden op het eerste frame.
    • Na:* Je ziet het eerste frame in ongeveer 1 seconde.
  • Controle: De snelle modellen kunnen je camerabestellingen nog steeds perfect volgen. Je kunt de video vertellen om "naar links te pansen" of "in te zoomen", en het gebeurt direct.
  • Flexibiliteit: Het team heeft dit getest op twee verschillende soorten "regisseurs" (de Wan2.1 en HY1.5 modellen) en het werkte voor beide, wat bewijst dat de methode een universele gereedschapskist is, niet slechts een eenmalige oplossing.

4. Belangrijke Lessen Geleerd (De "Ablatie Studies")

Het paper deelt ook enkele praktische tips die ze ontdekten tijdens het bouwen hiervan, die fungeren als "duimenregels" voor iedereen die dit probeert:

  • Goede Data is Cruciaal: Je kunt de regisseur niet zomaar leren met wazige, geraadpleegde camerabewegingen. Je hebt "ground truth"-data nodig—video's waarbij het camerapad wiskundig perfect is (zoals 3D-reconstructies). Als je rommelige data gebruikt, raakt de regisseur in de war.
  • Oefening Baart Kunst: De regisseur moet een tijdje trainen (ongeveer 8.000 stappen) voordat hij echt begrijpt hoe hij de camera moet bewegen. Als je te vroeg stopt, zullen ze niet luisteren naar je commando's.
  • Schaal niet in op de Klasgrootte: Je hebt een fatsoenlijk aantal voorbeelden nodig (een "batch size") voor de regisseur om te leren. Als de klas te klein is (minder dan 4 voorbeelden), slagen ze er niet in de camerabewegingen te leren.

Samenvatting

minWM is een open-source recept dat een hoogwaardige, trage video-AI omvormt tot een realtime, interactieve video-engine. Het leert de AI om camerabestellingen te volgen en versnelt deze vervolgens zodat het video kan genereren terwijl je kijkt, waardoor het mogelijk wordt om interactieve videowerelden (zoals videospellen of live-simulaties) te bouwen die voorheen onmogelijk waren met standaard video-AI.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →