← Neueste Arbeiten
💻 computer science

Veda: Scalable Video Diffusion via Distilled Sparse Attention

Veda ist ein destilliertes spärliches Aufmerksamkeitsframework, das die skalierbare Video-Diffusion beschleunigt, indem es die Kachelauswahl durch statistenbewusstes Scoring und kopfaware Kachelung mit der Geometrie der vollen Aufmerksamkeit abstimmt und dabei erhebliche Geschwindigkeitssteigerungen erzielt, ohne die Generierungsqualität zu beeinträchtigen.

Ursprüngliche Autoren: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

Veröffentlicht 2026-05-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Shihao Han, Hao Yang, Xinting Hu, Xiaofeng Mei, Yi Jiang, Xiaojuan Qi

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein riesiges, ultra-hochauflösendes Wandgemälde zu malen, das 10 Sekunden lang dauert. Um dies zu tun, haben Sie ein Team von 12 Milliarden winzigen Künstlern (den „Tokens"), die miteinander sprechen müssen, um sicherzustellen, dass die Farben perfekt übergehen und die Bewegung flüssig aussieht.

Im aktuellen Stand der Technik muss jeder einzelne Künstler anhalten und jedem anderen Künstler ein Geheimnis zuflüstern, um herauszufinden, was als Nächstes gemalt werden soll. Dies wird als „Full Attention" (Vollständige Aufmerksamkeit) bezeichnet. Obwohl dies schöne Ergebnisse liefert, ist es unglaublich langsam und teuer. Wenn Sie die Größe des Wandgemäldes verdoppeln, vervierfacht sich nicht nur die Zeit für die Koordination; sie vervierfacht sich. Es ist, als würde man versuchen, eine Party zu organisieren, bei der jeder vor dem Start der Musik mit jedem anderen die Hand schütteln muss.

Das Problem mit dem „Ecken Schneiden"
Forscher haben versucht, dies zu beschleunigen, indem sie den Künstlern sagten, sie sollen nur mit ein paar Nachbarn sprechen (Sparse Attention). Frühere Methoden waren jedoch wie ein ungeschickter Manager, der den Künstlern einfach sagte: „Sprechen Sie nur mit den Leuten in Ihrer unmittelbaren Reihe." Dies führte dazu, dass das Wandgemälde seltsam aussah: Das Wasser im Bild würde sich seltsam wellen, Gesichter würden verzerren und das Video würde flackern. Den Künstlern fehlten die wichtigen Gespräche, die sie führen mussten, um das Bild kohärent zu halten.

Die Lösung: Veda (Der kluge Vorarbeiter)
Die Arbeit stellt Veda vor, ein neues System, das wie ein brillanter, hyperaufmerksamer Vorarbeiter agiert. Anstatt zu raten, wer mit wem sprechen muss, verwendet Veda einen „Destillations"-Trick.

So funktioniert es, mit einer einfachen Analogie:

  1. Die „Orakel"-Karte: Stellen Sie sich die langsame, perfekte „Full Attention"-Methode als einen Meisterarchitekten vor, der eine vollständige Karte von jedem einzelnen Gespräch zeichnet, das stattfinden sollte. Diese Karte ist perfekt, dauert aber ewig, um gezeichnet zu werden.
  2. Der clevere Schüler: Veda trainiert einen leichten „Schüler" (eine kleine, schnelle KI), um die Karte des Meisterarchitekten zu betrachten und das Muster zu lernen, wer mit wem spricht.
  3. Der „Tripool"-Trick: Frühere Schüler versuchten, die Karte zusammenzufassen, indem sie einen „Durchschnitt" der Gespräche nahmen. Aber in einem Video ist das Wichtigste oft ein einzelner, lauter Schrei (ein Spitzenwert), nicht das durchschnittliche Geplauder. Der Schüler von Veda ist schlauer: Er betrachtet das Maximum, das Minimum und den Durchschnitt der Gespräche. Dies stellt sicher, dass er die kritischen „lauten" Momente nicht verpasst, die das Video stabil halten.
  4. Head-Aware Tiling (Kopf-bewusstes Kacheln): Das Video hat viele verschiedene „Köpfe" (spezialisierte Teams). Einige Teams kümmern sich darum, wie sich Dinge im Laufe der Zeit bewegen (temporal), während andere sich darum kümmern, wie Dinge im Raum aussehen (spatial). Veda erkennt, dass eine „Einheitsgröße"-Regel nicht funktioniert. Es gibt jedem Team ein maßgeschneidertes Puzzleteil (Kachelung), das zu seiner spezifischen Aufgabe passt, und stellt sicher, dass sie keine wichtigen Details verpassen.

Das Ergebnis: Geschwindigkeit ohne Unschärfe
Sobald Veda die Karte gelernt hat, sagt er den Künstlern: „Sie müssen nur mit diesen spezifischen 5 % der Leute sprechen. Ignorieren Sie den Rest."

Da Veda genau weiß, wen er ignorieren muss, ohne die wichtigen Verbindungen zu verlieren, wird die Videogenerierung unglaublich schnell:

  • Geschwindigkeit: Es macht die Generierung eines hochauflösenden, 10-Sekunden-Videos 5,1-mal schneller.
  • Qualität: Im Gegensatz zu früheren Methoden, die das Video glitchig oder verzerrt aussehen ließen, sehen die Videos von Veda genauso gut aus wie die langsame, perfekte Version.
  • Skalierbarkeit: Je länger und detaillierter das Video wird, desto mehr glänzt Veda. Es bewältigt die zusätzliche Arbeit fast linear, während die alten Methoden im Stau stecken bleiben würden.

Zusammenfassung
Veda ist wie die Einstellung eines superintelligenten Vorarbeiters, der den perfekten Plan studiert, genau lernt, welche Gespräche kritisch sind, und dann das Team anweist, das langweilige Smalltalk zu überspringen. Dies ermöglicht ihnen, ein riesiges, hochwertiges Wandgemälde in einem Bruchteil der Zeit zu malen, ohne dass das Bild auseinanderfällt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →