← Nieuwste papers
🤖 machine learning

MilliVid: Hierarchical Latents for Long-Range Consistency in Video Generation

MilliVid pakt de uitdaging van langetermijnconsistentie in videogeneratie aan door een hiërarchische autoencoder te gebruiken om frames te comprimeren naar multi-schaal tokens en een van grof naar fijn gestructureerde rollout-strategie toe te passen binnen een videodiffusiemodel, waardoor de globale geometrie en objectpermanentie worden behouden terwijl de computationele kosten worden verlaagd.

Oorspronkelijke auteurs: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

Gepubliceerd 2026-06-09
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ishaan Preetam Chandratreya, David Charatan, Basile Van Hoorick, Sergey Zakharov, Vitor Guizilini, Phillip Isola, Vincent Sitzmann

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel lang verhaal probeert te vertellen aan een vriend, maar je hebt slechts een klein notitieblokje. Als je probeert elke enkele detail van elke scène op te schrijven—elk blaadje aan een boom, elke barst in de stoep, elke textuur op een muur—raakt je de ruimte na slechts een paar zinnen kwijt. Tegen de tijd dat je bij het einde van het verhaal bent, ben je het begin volledig vergeten.

Dit is exact het probleem waar video AI-modellen vandaag de dag tegenaan lopen. Ze willen lange, coherente video's genereren, maar hun "notitieblokjes" (computergeheugen) zijn te klein om alle details van een lange sequentie vast te houden. Als gevolg hiervan beginnen ze te hallucineren, waarbij ze vergeten waar objecten gebleven zijn of de indeling van de kamer veranderen naarmate de video vordert.

Het paper MILLIVID stelt een slimme oplossing voor: Probeer niet alles tegelijk te onthouden. Onthoud in plaats daarvan eerst het grote plaatje, en vul later de kleine details in.

Zo hebben zij het gedaan, met behulp van enkele alledaagse analogieën:

1. Het "Russische Nestpop"-geheugensysteem

De meeste video AI-modellen proberen elke frame op volledige resolutie op te slaan. MILLIVID verandert de regels door een hiërarchische tokenizer te gebruiken. Denk hierbij aan een set Russische nestpoppen of een kaart met verschillende zoomniveaus:

  • Het Grove Niveau (Het Grote Plaatje): Dit is de kleinste pop of de kaart op het laagste zoomniveau. Het toont niet de textuur van het gras of de kleur van de bakstenen. Het onthoudt alleen de vorm van de kamer, waar de muren staan en waar de belangrijkste objecten zich bevinden. Omdat het zo simpel is, kan de AI honderden van deze "grote plaatjes" tegelijkertijd onthouden.
  • Het Fijne Niveau (De Details): Dit is de grootste pop of de kaart op maximaal zoomniveau. Het voegt de grastextuur, de baksteenpatronen en de verlichting toe. Maar omdat het zo gedetailleerd is, kan de AI slechts een paar van deze frames onthouden voordat het geheugen vol is.

De Analogie: Stel je voor dat je een stad beschrijft aan een vriend.

  • Oude Manier: Je probeert elk enkel raam van elk gebouw te beschrijven tijdens de hele reis. Je wordt moe en vergeet de lay-out van de stad na 10 minuten.
  • MILLIVID Manier: Eerst beschrijf je de lay-out van de stad (waar het park is, waar de rivier stroomt) voor het hele uur. Daarna, wanneer je dichter bij een specifiek gebouw komt, voeg je de details toe (de kleur van de deur, de bloemen in het raam). Je houdt het "grote plaatje" de hele tijd in je hoofd, zodat je nooit verdwaalt.

2. De "Coarse-to-Fine" Rollout

Het paper introduceert een nieuwe manier om de video te genereren, genaamd coarse-to-fine rollout.

In plaats van de video frame voor frame te genereren met volledige details (wat ervoor zorgt dat de AI het verleden vergeet), werkt het model in fasen:

  1. Fase 1: Het genereert een lange sequentie van "wazige" of lage-detail frames. Omdat ze simpel zijn, kan de AI meer dan 100 frames tegelijk bijhouden. Dit zorgt ervoor dat het verhaal consistent blijft (de auto blijft op de weg, het gebouw verdwijnt niet).
  2. Fase 2: Het gaat terug en "scherpt" de recente frames aan door de hoogdefinities details toe te voegen.
  3. De Magische Truk: Cruciaal is dat wanneer het de details toevoegt aan de recente frames, het kijkt naar de lage-detail versies van de verre frames om er zeker van te zijn dat het verhaal nog steeds logisch is.

De Analogie: Denk aan het maken van een schets van een schilderij.

  • Eerst teken je een ruwe omlijning met stokfiguurtjes van de hele scène om de houdingen en posities goed te krijgen. Je kunt de hele scène op deze manier tekenen zonder fouten te maken.
  • Daarna ga je terug om de spieren, de kleding en de gezichtsuitdrukkingen van de mensen op de voorgrond toe te voegen.
  • Je probeert niet de spieren van de persoon op de achtergrond te schilderen voordat je weet waar diegene staat, want dan schilder je ze misschien op de verkeerde plek.

3. De "Minecraft" Test

Om te bewijzen dat dit werkt, gebruikten de onderzoekers niet alleen mooie films. Ze gebruikten Minecraft.

  • Waarom? Minecraft is een 3D-wereld waarin je rondloopt. Als de AI de lay-out vergeet, kun je door een muur lopen of kan een boom verschijnen en weer verdwijnen op een andere plek.
  • Het Resultaat: Ze testten hun methode tegen de huidige beste modellen (zoals FramePack). De oude modellen genereerden een video waarin de speler een tijdje liep, waarna de wereld begon te "glitchen"—gebouwen verschoven of het pad liep onjuist weer terug op zichzelf.
  • Prestaties van MILLIVID: Omdat het de "grove" kaart van de wereld de hele tijd in zijn geheugen hield, kon het lange video's genereren waarin de speler honderden stappen liep, omdraaide en exact dezelfde gebouwen zag die hij eerder was gepasseerd, perfect consistent.

De Kernboodschap

Het paper beweert dat door te accepteren dat we niet elk klein detail van het verre verleden kunnen onthouden, we de structuur van het verleden veel beter kunnen onthouden.

  • Oude Benadering: "Ik zal elk detail van de laatste 5 seconden perfect onthouden, maar ik zal alles vergeten wat 10 seconden geleden gebeurde."
  • MILLIVID Benadering: "Ik zal de algemene vorm en locatie van alles onthouden wat 10 seconden geleden gebeurde, en ik zal alleen de kleine details van de laatste 5 seconden onthouden."

Deze afweging stelt de AI in staat om video's te genereren die veel langer coherent blijven, waardoor de "lijn" van de video consistent blijft zonder dat er supercomputers van miljoenen dollars nodig zijn. De auteurs testten dit specifelijk op Minecraft-gameplay en vonden dat het aanzienlijk meer consistente resultaten produceerde dan bestaande methoden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →