← Neueste Arbeiten
💬 NLP

StreamingVLM: Real-Time Understanding for Infinite Video Streams

StreamingVLM ist ein vereinheitlichtes Vision-Language-Modell-Framework, das durch die Abstimmung des Trainings auf das Streaming-Inferenz mittels einer neuartigen KV-Cache-Wiederverwendungsstrategie und Supervised Fine-Tuning auf überlappenden Chunks ein Echtzeit-Verständnis unendlicher Videostreams ermöglicht und dabei eine State-of-the-Art-Leistung bei Langzeit-Benchmarks unter Beibehaltung geringer Latenz erzielt.

Ursprüngliche Autoren: Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

Veröffentlicht 2026-06-02
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Ruyi Xu, Guangxuan Xiao, Yukang Chen, Liuning He, Yao Lu, Song Han

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem Freund ein Live-Sportspiel am Telefon zu beschreiben. Sie wollen genau erzählen, was gerade jetzt passiert – ein Tor, ein Foul, ein Jubel – ohne den Anschluss zu verlieren, und Sie wollen das über Stunden hinweg tun können, ohne dass Ihr Gehirn müde wird oder Sie vergessen, wer das erste Tor geschossen hat.

Das ist das Problem, das StreamingVLM für Computer löst.

Das Problem: Computer werden überfordert

Aktuelle KI-Modelle, die Videos ansehen (genannt Vision-Language-Modelle), sind wie Schüler, die versuchen, ein Buch zu lesen.

  • Der „Vollkonzentrierte“ Schüler: Dieser Schüler versucht, das gesamte Buch von Seite 1 bis Seite 1.000 jedes Mal zu lesen, wenn er nur einen einzigen Satz sagen möchte. Wenn das Buch länger wird, dauert das ewig und schließlich geht dem Schüler der Platz auf dem Schreibtisch (Speicher) aus und er stürzt ab.
  • Der „Gleitendes-Fenster“-Schüler: Dieser Schüler schaut nur auf die letzten paar Seiten. Wenn er sich an etwas von Seite 10 erinnern muss, muss er diese Seiten immer wieder aufs Neue aufschlagen und lesen. Das ist langsam und führt dazu, dass er den Fluss der Geschichte vergisst.

Beide Methoden versagen, wenn das Video „unendlich“ ist (wie eine Live-Übertragung, die niemals endet).

Die Lösung: StreamingVLM

Die Autoren haben eine neue KI namens StreamingVLM entwickelt. Stellen Sie sich dies als einen super-effizienten Sportkommentator vor, der eine besondere Art hat, seine Notizen zu organisieren.

So funktioniert es, unter Verwendung einfacher Analogien:

1. Der „Notizbuch“-Trick (Der KV-Cache)

Anstatt zu versuchen, das ganze Spiel zu behalten oder nur die letzten 5 Sekunden, nutzt StreamingVLM ein intelligentes Notizbuch-System:

  • Der „Anker“ (Attention Sinks): Es behält ein paar wichtige Notizen vom allerersten Anfang (wie die Teamnamen und den Spielstand beim Anpfiff), damit es nie den Kontext verliert, wer gerade spielt.
  • Die „Aktuelle Historie“ (Text Window): Es behält eine lange Liste der letzten paar Sätze, die es gesprochen hat, damit es den Fluss des Gesprächs im Gedächtnis behält.
  • Das „Live-Geschehen“ (Vision Window): Es behält nur die visuellen Details der letzten paar Sekunden des Spiels (die Spieler, die rennen, der Ball, der sich bewegt), weil das entscheidend ist, was gerade jetzt passiert.

Ältere visuelle Details (wie ein Spielzug von vor 10 Minuten) werden vorsichtig aussortiert, um Platz für neue zu schaffen, aber der „Anker“ und die „Aktuelle Historie“ bleiben sicher verwahrt. Dies hält den Speicherverbrauch der Komputer niedrig und stabil, egal wie lang das Video ist.

2. Der „Training“-Trick

Man kann eine KI nicht lehren, ein 10-stündiges Spiel zu beobachten, wenn man ihr während des Trainings nur 1-minütige Clips zeigt. Die Autoren haben dies mit einem cleveren Trick gelöst:

  • Sie zeigten der KI kurze, überlappende Clips von Sportspielen (wie 24-Sekunden-Stücke, die sich um 12 Sekunden überlappen).
  • Sie brachten der KI bei, auf alles innerhalb dieses kurzen Stücks zu achten.
  • Da sich die Stücke überlappen, lernt die KI, das Ende eines Stücks mit dem Anfang des nächsten zu verbinden, wodurch sie effektiv lernt, wie sie einen kontinuierlichen Stream verarbeitet, ohne jemals während des Trainings ein 10-stündiges Video gesehen zu haben.

3. Der „Nummerierungs“-Trick (Contiguous RoPE)

Normalerweise werden die Seitenzahlen in einem Notizbuch unordentlich, wenn man alte Seiten löscht (Seite 1, 2, 3... und plötzlich plötzlich Seite 100). Das verwirrt die KI. StreamingVLM verwendet ein spezielles „Um-Nummerierungs“-System. Wenn es alte visuelle Daten löscht, beschriftet es die verbleibenden Seiten sofort neu, sodass sie immer noch 1, 2, 3, 4... nummeriert sind. Dies verhindert, dass die KI verwirrt wird, wann Dinge passiert sind, selbst nach Stunden des Videos.

Die Ergebnisse: Ein Marathonläufer

Das Team testete diese neue KI an einem neuen Benchmark namens Inf-Streams-Eval, der aus Sportspielen besteht, die im Durchschnitt über 2 Stunden lang sind.

  • Geschwindigkeit: Sie kann das Spiel in Echtzeit ansehen und darüber sprechen (etwa 8 Frames pro Sekunde) auf einem einzigen leistungsstarken Computerchip. Sie hinkt nicht hinterher.
  • Speicher: Sie kann über 3 Stunden lang kommentieren, ohne den Anfang des Spiels zu vergessen oder abzustürzen.
  • Qualität: Im Vergleich zu Top-Modellen (wie GPT-4o mini) gewann StreamingVLM in direkten Vergleichen für Sportkommentare 66 % der Fälle. Es klingt natürlicher und erinnert sich besser an das Spiel.
  • Bonus: Obwohl sie nur auf Sportkommentaren trainiert wurde, verbesserte sie sich auch bei allgemeinen Videofragen, was beweist, dass die Methode ein allgemeines Upgrade für das Verständnis von Videos ist.

Zusammenfassend

StreamingVLM ist wie ein unermüdlicher Sportkommentator mit einem magischen Gedächtnis. Er erinnert sich an den Anfang des Spiels, konzentriert sich intensiv auf das Geschehen, das gerade jetzt stattfindet, und vergisst die langweiligen Teile von vor 10 Minuten, um Platz zu sparen. Dies ermöglicht es ihm, einen unendlichen Videostream in Echtzeit zu beobachten und zu beschreiben – etwas, das frühere Computer nicht leisten konnten, ohne überfordert zu werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →