← Neueste Arbeiten
🤖 AI

VideoMLA: Low-Rank Latent KV Cache for Minute-Scale Autoregressive Video Diffusion

Dieses Papier stellt VideoMLA vor, eine neuartige Architektur, die Multi-Head Latent Attention auf autoregressive Videodiffusion im Minutenbereich anwendet und dabei eine Reduktion des KV-Cache-Speichers um 92,7 % sowie eine Steigerung des Durchsatzes um den Faktor 1,23 erreicht, während die Basisqualität beibehalten oder übertroffen wird, obwohl die Methode erfolgreich ist, obwohl die vortrainierte Aufmerksamkeit nicht inhärent niedrigrangig ist.

Ursprüngliche Autoren: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

Veröffentlicht 2026-05-29
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Hidir Yesiltepe, Jiazhen Hu, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Hoda Eldardiry, Pinar Yanardag

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, eine Geschichte zu erzählen, die eine Stunde dauert, aber Sie haben nur ein kleines Notizbuch, um sie aufzuschreiben. Jedes Mal, wenn Sie einen neuen Satz hinzufügen, müssen Sie sich an alles erinnern, was Sie zuvor geschrieben haben, um sicherzustellen, dass die Geschichte Sinn ergibt.

In der Welt der KI-Videoerstellung wird dieses „Notizbuch" als KV-Cache bezeichnet. Es ist ein Speicherbank, in der die KI Informationen über die bereits erstellten Videoframes speichert, damit sie die nächsten generieren kann.

Das Problem: Das Notizbuch ist zu schwer

Aktuelle KI-Video-Modelle sind wie Schüler, die versuchen, eine einstündige Geschichte zu schreiben, deren Notizbücher jedoch so schwer sind, dass sie sie kaum heben können.

  • Der alte Weg: Für jeden einzelnen Videoframe, an den sich die KI erinnert, schreibt sie eine massive, detaillierte Beschreibung für jede einzelne „Gehirnzelle" (Kopf) in ihrem Netzwerk auf.
  • Das Ergebnis: Je länger das Video wird (Minuten lang), desto riesiger wird dieses Notizbuch, bis der Speicher erschöpft ist. Um dies zu beheben, werfen die meisten Systeme einfach alte Seiten weg (ein gleitendes Fenster), aber die Seiten, die sie behalten, sind immer noch unglaublich sperrig und langsam zu lesen.

Die Lösung: VideoMLA (Das „Zusammenfassungs"-Notizbuch)

Die Arbeit stellt VideoMLA vor, eine neue Art, diese Geschichte zu schreiben, die das Notizbuch um 92,7 % verkleinert.

So funktioniert es anhand einer einfachen Analogie:

1. Die „Gemeinsame Zusammenfassung" (Low-Rank Latent)
Stellen Sie sich vor, Sie beschreiben eine Szene einer Gruppe von 12 Freunden (den 12 „Köpfen" in der KI).

  • Früher: Sie schrieben einen einzigartigen, 128-seitigen detaillierten Bericht für jeden Freund. Das sind 12×128=1.53612 \times 128 = 1.536 Seiten Informationen pro Frame!
  • VideoMLA: Sie merken, dass alle Ihre Freunde dieselbe Geschichte hören. Anstatt 12 separate Berichte zu schreiben, verfassen Sie einen einzigen, kondensierten Zusammenfassung (das „Latent"), der das Kernwesen der Szene einfängt. Alle 12 Freunde teilen sich diese eine Zusammenfassung.
  • Die Magie: Diese Zusammenfassung ist viel kleiner (nur 192 Seiten statt 1.536). Sie erfasst das „Was" (den Inhalt) ohne Redundanz.

2. Die „Separate Karte" (Decoupled 3D-RoPE)
Die Zusammenfassung sagt Ihnen, was passiert, aber nicht wo oder wann.

  • Früher: Die Orts- und Zeitinformationen waren in diesen riesigen, sperrigen Berichten vermischt.
  • VideoMLA: Sie nehmen die Orts- und Zeitinformationen (wie „es regnet um 14 Uhr auf der linken Seite") und kleben sie auf einen winzigen, separaten Haftnotiz. Dieser Zettel wird ebenfalls von allen geteilt.
  • Das Ergebnis: Sie haben nun eine winzige Zusammenfassung plus einen winzigen Haftnotiz, anstatt 12 riesige Berichte.

Die große Überraschung: Es funktioniert, auch wenn es „nicht sollte"

Normalerweise verwenden Wissenschaftler diesen „Zusammenfassungs"-Trick (Multi-Head Latent Attention genannt), weil sie glauben, dass die ursprünglichen Informationen natürlich einfach und leicht zusammenzufassen sind (wie ein mathematisches Problem mit niedrigem Rang).

Die Entdeckung der Arbeit:
Die Autoren überprüften das ursprüngliche KI-Modell und stellten etwas Überraschendes fest: Die ursprünglichen Informationen sind NICHT einfach. Sie sind tatsächlich unglaublich komplex und chaotisch (hoher „Rang").

  • Das Rätsel: Wenn Sie versuchen, ein komplexes, chaotisches Gemälde mit einer einfachen Skizze zusammenzufassen, verlieren Sie normalerweise viele Details.
  • Die Realität: VideoMLA funktioniert trotzdem! Obwohl die ursprünglichen Daten chaotisch sind, lernt die KI, die gesamte Geschichte in den kleinen Zusammenfassungsraum zu passen. Es stellt sich heraus, dass die Grenze nicht darin besteht, wie chaotisch die Geschichte ist, sondern wie groß das Notizbuch ist. Die KI passt sich einfach an, um die gesamte Geschichte perfekt in den kleinen Raum zu integrieren.

Warum das wichtig ist

Durch die Verkleinerung des Notizbuchs:

  1. Längere Videos: Die KI kann nun minutenlange Videos generieren, ohne den Speicher zu erschöpfen.
  2. Schnellere Geschwindigkeit: Das Lesen einer winzigen Zusammenfassung ist viel schneller als das Lesen von 12 riesigen Berichten. Die Arbeit zeigt, dass dies die KI um das 1,23-fache schneller macht.
  3. Bessere Qualität: Trotz der massiven Komprimierung bleibt die Videoqualität hoch. Die KI wird nicht „rauschend" oder unscharf; die Bewegung bleibt flüssig und die Charaktere bleiben konsistent.

In Kürze

VideoMLA ist wie die Erkenntnis, dass Sie keine Bibliothek voller Bücher tragen müssen, um eine Geschichte zu erzählen. Sie brauchen nur eine gut geschriebene Zusammenfassung und eine kleine Karte. Dies ermöglicht es der KI, längere, flüssigere Geschichten viel schneller zu erzählen, ohne einen Supercomputer zur Speicherung des Speichers zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →