← Nieuwste papers
💻 computer science

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

Dit artikel introduceert Heterogene Staptoewijzing (HSA), een trainingsvrij inferentie-algoritme dat Diffusion Transformers voor videogeneratie versnelt door dynamisch minder denoising-stappen toe te wijzen aan tokens met lage snelheid, terwijl de globale context en kwaliteit worden behouden via een nieuw KV-cache-synchronisatiemechanisme en opgeslagen Euler-bijwerkingen.

Oorspronkelijke auteurs: Ernie Chu, Vishal M. Patel

Gepubliceerd 2026-05-12
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ernie Chu, Vishal M. Patel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je de regisseur bent van een enorme, high-budget filmproductie. In deze film is elk personage, elke achtergrondboom en elke stofdeeltje op de vloer een acteur. In een standaard Diffusion Transformer (het AI-model dat de video maakt) behandelt de regisseur elke één van deze "actoren" exact op dezelfde manier.

Als het script 40 rondes repetitie (denoising-stappen) vereist om de scène perfect te krijgen, dwingt de regisseur de achtergrondmuur om 40 keer te repeteren, de statische boom om 40 keer te repeteren, en de held die over het scherm rent om 40 keer te repeteren.

Het probleem? De muur en de boom bewegen nauwelijks. Ze hebben geen 40 repetities nodig; ze zouden het met 5 kunnen doen. Maar de AI verspilt enorme hoeveelheden tijd en energie door ze toch te laten repeteren, terwijl de held (die snel beweegt van vorm verandert) ook precies dezelfde 40 rondes krijgt. Het is alsof je een superster-acteur en een kartonnen standbeeld exact hetzelfde uurtarief betaalt voor exact dezelfde hoeveelheid werk.

De Oplossing: Heterogene Stappenallocatie (HSA)

De auteurs van dit artikel, Ernie Chu en Vishal Patel, stellen een slimmere manier voor om de filmset te runnen, genaamd Heterogene Stappenallocatie (HSA).

Denk aan HSA als een slimme regisseur die de acteurs observeert en zegt:

  • "Jij, de achtergrondmuur? Je bent saai en statisch. Je hebt maar 5 repetities nodig."
  • "Jij, de rennende held? Je bent dynamisch en complex. Je hebt al die 40 repetities nodig."
  • "Jij, de wiegende boom? Je hebt 20 repetities nodig."

Dit bespaart enorm veel tijd omdat de AI stopt met energie te verspillen aan de saaie onderdelen.

De Twee Moeilijke Problemen die Ze Oplosten

Je zou kunnen denken: "Oké, maar als de muur stopt met repeteren na 5 rondes, hoe weet hij dan wat de held doet in ronde 40? Ze moeten elkaar zien om in dezelfde scène te blijven."

Het artikel introduceert twee slimme trucs om dit op te lossen:

1. De "Spookgeheugen" Truc (KV-Cache Synchronisatie)
In AI moeten acteurs elkaar "zien" om synchroon te blijven (dit heet attention). Normaal gesproken, als een acteur stopt met repeteren, verdwijnt hij uit de kamer en kunnen de anderen hem niet meer zien.

  • De Oplossing: De AI houdt een "spookgeheugen" (een cache) bij van de muur en de boom. Hoewel ze niet actief repeteren, blijven hun "spookbeelden" in de kamer. De actieve acteurs (de held) kunnen nog steeds kijken naar de spookbeelden van de inactieve acteurs om te weten waar ze zijn.
  • Het Resultaat: De held kan intensief repeteren terwijl hij precies weet waar de muur is, zonder dat de muur zelf echt werk hoeft te verrichten.

2. De "Tijdsreizen" Truc (Gecachte Euler Update)
Wat gebeurt er met de positie van de muur terwijl hij een pauze neemt? Vriest hij gewoon in?

  • De Oplossing: De AI onthoudt de laatste keer dat de muur bewoog en hoe snel hij ging. Het gebruikt een eenvoudige wiskundige formule om de positie van de muur door de overgeslagen tijd te "spoelen". Het is alsof je zegt: "De muur bewoog de laatste keer 1 inch per seconde; ik bereken gewoon waar hij nu is zonder hem daadwerkelijk te laten bewegen."
  • Het Resultaat: De muur wordt direct op de achtergrond bijgewerkt, zonder dat de AI een complexe simulatie voor hem hoeft uit te voeren.

De Resultaten: Sneller, Goedkoper, Even Goed

De onderzoekers testten dit op krachtige video-makende AI-modellen (zoals Wan-2 en LTX-2). Hier is wat ze ontdekten:

  • Snelheid: Ze konden de tijd die nodig is om een video te maken met 50% of zelfs 75% verkorten (zodat het slechts 25% van de oorspronkelijke tijd kost).
  • Kwaliteit: Zelfs met al die tijd weggeknipt, zagen de video's er bijna exact hetzelfde uit als de trage, volledige snelheidsversies. De "held" zag er nog steeds scherp uit, en de "muur" zag er nog steeds stevig uit.
  • Vergelijking: Eerdere methoden probeerden dingen te versnellen door gewoon hele rondes repetitie voor iedereen tegelijk over te slaan. Die methoden zorgden ervoor dat de video uit elkaar viel (zoals een instortend gebouw) wanneer ze te snel probeerden te gaan. HSA hield de video stabiel omdat het alleen de onderdelen oversloeg die geen werk nodig hadden.

In het Kort

Dit artikel gaat over niet elke pixel hetzelfde behandelen. Door te beseffen dat sommige delen van een video saai en statisch zijn terwijl andere opwindend en bewegend zijn, kan de AI stoppen met tijd verspillen aan de saaie onderdelen. Het gebruikt "spookgeheugens" en "wiskundige shortcuts" om alles synchroon te houden, waardoor we hoogwaardige video's kunnen genereren in een fractie van de tijd.

Het is het verschil tussen een fabriek die elke schroef op een auto met dezelfde precisie bewerkt, en een fabriek die 90% van zijn tijd besteedt aan de motor en slechts 10% aan de schroeven die de stoelhoezen op hun plaats houden. De auto werkt nog steeds perfect, maar hij wordt veel sneller gebouwd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →