← Nieuwste papers
💻 computer science

Pusa V1.0: Unlocking Temporal Control in Pretrained Video Diffusion Models via Vectorized Timestep Adaptation

Pusa V1.0 introduceert een niet-destructieve, vectoriërische tijdstap-adaptatiemethode (VTA) die fijnmazige, zero-shot temporele controle mogelijk maakt – inclusief conversie van afbeelding naar video, conditionering op start- en eindframes, en video-extensie – in vooraf getrainde video-diffusiemodellen, terwijl de oorspronkelijke generatieve capaciteiten van het basismodel volledig behouden blijven.

Oorspronkelijke auteurs: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Gepubliceerd 2026-05-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yaofang Liu, Yumeng Ren, Aitor Artola, Yuxuan Hu, Xiaodong Cun, Xiaotong Zhao, Alan Zhao, Raymond H. Chan, Suiyun Zhang, Rui Liu, Dandan Tu, Jean-Michel Morel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een meesterkok voor die ongelooflijk goed is in het koken van een specifiek type gerecht van scratch: Tekst-naar-Video. Je geeft hen een recept (een tekstprompt) en ze bereiden een heerlijk gerecht. Deze kok is het "basismodel" (specifiek, een model genaamd Wan-T2V).

Er is echter een probleem. Als je de kok een specifiek startingrediënt wilt geven (zoals een foto van een kat) en zegt: "Maak een video die begint met deze kat", raakt de kok in de war. Op de oude manier moest de kok een volledig nieuwe manier van koken van scratch leren, waarbij ze vaak vergeet hoe ze de originele gerechten goed moesten bereiden. Dit is als de kok dwingen om hun gehele culinaire opleiding te vergeten, alleen maar om één nieuwe truc te leren.

Dan komt Pusa V1.0 in beeld.

Het Probleem: De "Stijve Klok"

Huidige video-AI-modellen werken als een stijve, gesynchroniseerde klok. Stel je een video voor als een rij dominostenen die vallen. In deze oude modellen moet elke enkele dominosteen (frame) precies op hetzelfde moment en met dezelfde snelheid vallen.

  • Als je wilt dat de eerste dominosteen overeind blijft staan (je startafbeelding) terwijl de rest valt, breekt de klok.
  • Om dit op te lossen, proberen andere modellen de kok te "hertrainen", wat duur, traag is en vaak hun vermogen om de originele gerechten te bereiden, verpest.

De Oplossing: De "Individuele Afstandsbedieningen"

Pusa introduceert een concept genaamd Vectorized Timestep Adaptation (VTA).

In plaats van één hoofdklok voor de hele video, geeft Pusa elk enkel frame zijn eigen afstandsbediening.

  • Frame 1 (je startafbeelding) krijgt een afstandsbediening ingesteld op "Pauze".
  • Frame 2 krijgt een afstandsbediening ingesteld op "Langzaam bewegen".
  • Frame 3 krijgt een afstandsbediening ingesteld op "Snel bewegen".

Dit stelt de AI in staat om elk frame onafhankelijk te laten evolueren. Het eerste frame blijft precies waar je het hebt geplaatst, terwijl de rest van de video er natuurlijk omheen stroomt.

De Magische Truc: "Niet-destructieve" Chirurgie

Het meest indrukwekkende deel van Pusa is hoe het dit leert.

  • Oude Weg: Om de truc "begin met een afbeelding" te leren, moesten de oude modellen (zoals Wan-I2V) een enorme, destructieve ingreep ondergaan. Ze moesten worden hertraind op miljoenen voorbeelden, waarbij ze in feite het brein van de kok herbouwden. Dit kostte een fortuin aan rekenkracht en maakte ze vaak vergeten hoe ze de originele tekst-naar-video-taak moesten uitvoeren.
  • Pusa's Weg: Pusa voert "chirurgische" aanpassingen uit. Het herbouwt het brein van de kok niet; het voegt gewoon een klein, gespecialiseerd gereedschap (de vectorized timestep) toe aan het bestaande brein.
    • Analogie: Stel je voor dat de kok al perfect weet hoe te koken. In plaats van ze te ontslaan en een nieuwe in te huren, geef je ze gewoon een specifieke timer die hen precies vertelt wanneer ze moeten stoppen met roeren in de eerste pan. De kernvaardigheden van de kok blijven 100% intact.

De Resultaten: Goedkoop, Snel en Veelzijdig

Omdat Pusa niet hoeft te herleren van scratch, zijn de resultaten verbazingwekkend:

  1. Ultra-efficiënt: Terwijl andere modellen miljoenen voorbeelden en enorme rekenbudgetten nodig hadden (met kosten van meer dan $100.000 aan rekenkracht), bereikte Pusa topresultaten met slechts 4.000 voorbeelden en een fractie van de kosten (ongeveer $500).
  2. Zero-Shot Superkrachten: Omdat het brein van de kok niet werd overschreven, leerde Pusa niet alleen om met een afbeelding te beginnen. Het kreeg direct het vermogen om andere complexe trucs uit te voeren zonder extra training, zoals:
    • Start- en Eindframes: De AI een afbeelding geven voor het begin en het einde, en het de middelste delen laten invullen.
    • Video-extensie: Een korte video nemen en deze naadloos langer maken.
    • Tekst-naar-Video: Het behield zijn originele vermogen om video's van tekstprompts perfect te maken.

Samenvatting

Pusa V1.0 is als het upgraden van een motoren zonder de auto uit elkaar te halen. Door elk frame zijn eigen "tijdschijf" te geven in plaats van ze te dwingen in lockstep te marcheren, kan het model complexe videotaken (zoals starten vanuit een specifieke afbeelding) aan met ongelooflijke efficiëntie. Het behoudt de intelligentie van het oorspronkelijke model terwijl het nieuwe, flexibele vaardigheden ontsluit, waardoor het genereren van video's van hoge kwaliteit veel goedkoper en toegankelijker wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →