← Nieuwste papers
💻 computer science

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda is een gedistilleerd framework voor sparse attention dat schaalbare video-diffusie versnelt door tegelselectie af te stemmen op de geometrie van volledige attention via statistiekbewuste scoring en hoofd-bewust tegelen, waarmee aanzienlijke snelheidswinst wordt behaald zonder de generatiekwaliteit te compromitteren.

Oorspronkelijke auteurs: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

Gepubliceerd 2026-05-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, ultra-hoge-definitie muurschildering te schilderen die 10 seconden duurt. Om dit te doen, heb je een team van 12 miljard kleine kunstenaars (de "tokens") die met elkaar moeten praten om ervoor te zorgen dat de kleuren perfect mengen en de beweging er vloeiend uitziet.

In de huidige staat van de kunst moet elke enkele kunstenaar stoppen en een geheim fluisteren naar elke andere kunstenaar om uit te vinden wat ze als volgende moeten schilderen. Dit heet "Full Attention" (Volledige Aandacht). Hoewel dit prachtige resultaten oplevert, is het ongelooflijk traag en duur. Als je de grootte van de muurschildering verdubbelt, verdubbelt de tijd die nodig is voor coördinatie niet alleen; het verviervoudigt. Het is alsof je een feest probeert te organiseren waarbij iedereen met elkaar moet schudden voordat de muziek begint.

Het probleem met "afkorten"
Onderzoekers hebben geprobeerd dit te versnellen door de kunstenaars te vertellen dat ze alleen met een paar buren moeten praten (Sparse Attention). Echter, eerdere methoden waren als een onhandige manager die de kunstenaars simpelweg vertelde: "Praat alleen met de mensen in je directe rij." Dit zorgde ervoor dat de muurschildering vreemd eruitzag: het water in het schilderij zou vreemd rimpelen, gezichten zouden vervormen en de video zou flikkeren. De kunstenaars misten de belangrijke gesprekken die ze nodig hadden om het beeld coherent te houden.

De oplossing: Veda (De slimme voorman)
Het paper introduceert Veda, een nieuw systeem dat fungeert als een briljante, hyper-observante voorman. In plaats van te raden wie met wie moet praten, gebruikt Veda een "distillatie"-truc.

Zo werkt het, met een eenvoudige analogie:

  1. De "Orakel"-kaart: Stel je voor dat de trage, perfecte "Full Attention"-methode een meester-architect is die een complete kaart tekent van elk gesprek dat zou moeten plaatsvinden. Deze kaart is perfect, maar het duurt eeuwen om te tekenen.
  2. De slimme student: Veda traint een lichtgewicht "student" (een kleine, snelle AI) om naar de kaart van de meester-architect te kijken en het patroon te leren van wie met wie praat.
  3. De "Tripool"-truc: Eerdere studenten probeerden de kaart samen te vatten door een "gemiddelde" van de gesprekken te nemen. Maar in een video is het belangrijkste vaak een enkele, luide schreeuw (een pieksignaal), niet het gemiddelde gepraat. De student van Veda is slimmer: het kijkt naar het maximum, minimum en gemiddelde van de gesprekken. Dit zorgt ervoor dat het de kritieke "luide" momenten niet mist die de video stabiel houden.
  4. Hoofd-bewust tegelwerk: De video heeft vele verschillende "hoofden" (gespecialiseerde teams). Sommige teams geven om hoe dingen zich in de tijd bewegen (temporaal), terwijl anderen geven om hoe dingen er in de ruimte uitzien (spatiaal). Veda beseft dat een "één-maat-past-voor-iedereen"-regel niet werkt. Het geeft elk team een op maat gemaakte puzzelstuk (tegeling) dat past bij hun specifieke taak, zodat ze geen belangrijke details missen.

Het resultaat: Snelheid zonder wazigheid
Zodra Veda de kaart heeft geleerd, vertelt het de kunstenaars: "Jullie hoeven alleen met deze specifieke 5% van de mensen te praten. Negeer de rest."

Omdat Veda precies weet wie ze moeten negeren zonder de belangrijke verbindingen te verliezen, wordt de video-generatie ongelooflijk snel:

  • Snelheid: Het maakt het genereren van een high-definition video van 10 seconden 5,1 keer sneller.
  • Kwaliteit: In tegenstelling tot eerdere methoden die de video glitchy of vervormd maakten, zien de video's van Veda er net zo goed uit als de trage, perfecte versie.
  • Schaalbaarheid: Hoe langer en gedetailleerder de video wordt, hoe meer Veda schittert. Het verwerkt het extra werk bijna lineair, terwijl de oude methoden vast zouden komen te zitten in file.

Samenvattend
Veda is als het inhuren van een super-intelligente voorman die het perfecte plan bestudeert, precies leert welke gesprekken kritiek zijn, en vervolgens het team dirigeert om het saaie kleine praatje over te slaan. Dit stelt hen in staat om in een fractie van de tijd een enorme, hoogwaardige muurschildering te schilderen, zonder dat het beeld uit elkaar valt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →