← Nieuwste papers
💻 computer science

VDE: Training-Free Accelerating Rectified Flow Model via Velocity Decomposition and Estimation

Dit artikel introduceert VDE, een trainingsvrije versnellingsmethode voor gecorrigeerde flow-modellen die de inferentiesnelheid verbetert door snelheidscomponenten te decomponeren en te schatten in plaats van statische, in het cache-geheugen opgeslagen kenmerken te hergebruiken, waardoor aanzienlijke versnelling wordt bereikt met minimale verlies aan visuele kwaliteit.

Oorspronkelijke auteurs: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

Gepubliceerd 2026-05-25
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Junwen Tan, Jinglin Liang, Hongyuan Chen, Shuangping Huang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een complex schilderij probeert te maken, zoals een drukke stadsstraat, maar dat je dit één klein penseelstreekje per keer moet doen. Om een perfect resultaat te krijgen, moet je misschien wel 50 stappen zetten, waarbij je na elke enkele streek je werk controleert en de verf aanpast. Dit kost veel tijd.

Dit is precies hoe moderne AI-afbeeldings- en videogeneratoren (zogenaamde Rectified Flow-modellen) werken. Ze zijn ongelooflijk getalenteerde kunstenaars, maar ze zijn traag omdat ze zo veel kleine stappen zetten om een afbeelding te creëren.

Het artikel introduceert een nieuwe truc genaamd VDE (Velocity Decomposition and Estimation) die deze AI-kunstenaars veel sneller laat werken zonder de kwaliteit van hun schilderijen te bederven. Hier is hoe het werkt, met behulp van eenvoudige analogieën:

De Oude Weg: "Het Bevaste Blauwdruk"

Vroegere methoden probeerden de snelheid te verhogen door delen van de tekening van de vorige stap te cachen (op te slaan) en ze gewoon opnieuw te gebruiken.

  • De Analogie: Stel je voor dat je een pad afloopt. De oude methode zegt: "Ik kopieer gewoon de kaart van waar ik 10 seconden geleden was en ga ervan uit dat het pad niet is veranderd."
  • Het Probleem: De wereld is dynamisch. Als je een hoek omdraait of het landschap verandert, is die oude kaart nu fout. De AI probeert oude kenmerken opnieuw te gebruiken die niet meer passen bij het huidige beeld, wat leidt tot wazige texturen of vreemde vervormingen. Het is alsof je probeert een jas te dragen die gisteren voor jou was op maat gemaakt; hij past misschien vandaag niet meer.

De Nieuwe Weg (VDE): "De Slimme Navigator"

De auteurs realiseerden zich dat de AI, in plaats van oude kaarten te kopiëren, eigenlijk kan voorspellen waar het naartoe gaat door zijn beweging op te splitsen in twee eenvoudige onderdelen.

Stel je de beweging van de AI (zijn "snelheid") voor als een auto die een weg aflegt. VDE splitst deze beweging op in twee componenten:

  1. De "Voorwaartse" Duw (Parallelle Component): Dit is hoeveel de auto recht vooruit beweegt.

    • De Ontdekking: Het artikel vond dat deze "voorwaartse duw" zeer soepel en voorspelbaar verandert. Het is als een auto die accelereert; als je de snelheid van de laatste twee seconden kent, kun je met eenvoudige wiskunde (zoals het tekenen van een rechte lijn) de snelheid voor de volgende seconde makkelijk raden.
    • De Truc: In plaats van de hele motor opnieuw te berekenen, doet VDE gewoon een snelle wiskundige schatting op basis van de laatste paar stappen.
  2. De "Zijwaartse" Afdrijving (Orthogonale Component): Dit zijn de subtiele zijwaartse aanpassingen die de auto maakt om in de rijbaan te blijven.

    • De Ontdekking: Het artikel vond dat voor korte periodes deze "zijwaartse afdrijving" nauwelijks verandert. Het is alsof het stuur van de auto een paar seconden op exact dezelfde positie blijft staan.
    • De Truc: VDE gebruikt deze "zijwaartse" richting gewoon een paar stappen opnieuw zonder deze opnieuw te berekenen.

Hoe VDE in de Praktijk Werkt

VDE gebruikt een "Check-in en Schatten"-strategie:

  1. Het Anker (Check-in): Om de paar stappen doet de AI een volledige, trage berekening om de perfecte, echte gegevens te krijgen. Dit is alsof de bestuurder stopt om de GPS te controleren en de weg vooruit te bevestigen.
  2. De Schatting (De Afkorting): Voor de stappen ertussen doet de AI niet het zware werk. In plaats daarvan gebruikt hij de "voorwaartse" wiskundige schatting en het "zijwaartse" hergebruik om direct de volgende stap te bepalen.
  3. Het Resultaat: De AI slaat het zware werk over en is 2 tot 3 keer sneller dan voorheen.

Waarom Het Beter Is

Het artikel testte dit op drie verschillende AI-modellen (Flux, Qwen-Image en Wan2.1) voor het maken van afbeeldingen en video's.

  • Snelheid: Het maakte de AI 2 tot 3 keer sneller. Bijvoorbeeld, een afbeelding die 12 seconden nodig had om te maken, was klaar in ongeveer 4 seconden.
  • Kwaliteit: Omdat VDE de beweging berekent op basis van de huidige invoer (de feitelijke weg waarop de auto nu rijdt) in plaats van een oude, statische kaart, zien de afbeeldingen er bijna identiek uit aan de trage, hoogwaardige versie.
  • De Vergelijking: Andere methoden die gewoon oude delen "hergebruiken", leiden vaak tot wazige of gebroken afbeeldingen (zoals een uitgerekt gezicht of een gesmolten textuur). VDE houdt de details scherp.

In het Kort

Het artikel beweert dat we door de beweging van de AI op te splitsen in een "voorspelbaar voorwaarts deel" en een "stabiel zijwaarts deel", de AI kunnen stoppen met het doen van onnodige zware berekeningen. In plaats van blindelings oud werk te kopiëren, gebruikt de AI slimme, lichtgewicht wiskunde om de volgende stap te raden, waardoor het hoogwaardige afbeeldingen en video's kan maken in een fractie van de tijd.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →