← Neueste Arbeiten
🤖 machine learning

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV ist ein Framework zum Verständnis von Streaming-Videos, das die Herausforderung verzögerter Abfragen durch die Beibehaltung eines konstanten Speicher-Footprints mittels eines hybriden Ansatzes aus exaktem Near-Window-KV-Caching und einem Kapazitäts-fixierten Summary-State-Speicher für historische Inhalte adressiert, wodurch die Genauigkeit gegenüber Token-Retention-Baselines mit zunehmender Verzögerung der Abfragen signifikant verbessert wird.

Ursprüngliche Autoren: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Veröffentlicht 2026-06-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie beobachten einen sehr langen, kontinuierlichen Videostream, wie etwa einen 24-Stunden-Überwachungskamera-Feed. Ihre Aufgabe ist es, Fragen zu beantworten, die sich auf das beziehen, was in diesem Video passiert ist. Das Problem? Sie haben ein winziges Gehirn (begrenzten Computerspeicher) und können das Video nicht anhalten, um zurückzuspulen und alles erneut anzusehen. Sie müssen weiter zusehen, während Sie darauf warten, dass jemand eine Frage stellt, die vielleicht Minuten oder sogar Stunden nach einem bestimmten Ereignis erfolgt.

Dies ist die Herausforderung des Streaming Video Understanding (Verständnis von Videostreams).

Das Problem: Das „vergessliche“ Gehirn

Die meisten aktuellen Systeme versuchen, dies zu lösen, indem sie ein „gleitendes Fenster“ (sliding window) der letzten paar Minuten des Videos in ihrem Speicher behalten.

  • Die Analogie: Stellen Sie sich vor, Sie halten einen Eimer Wasser (Ihr Gedächtnis). Während neues Wasser (Videobilder) hineinfließt, müssen Sie altes Wasser herauslassen, um den Eimer nicht überlaufen zu lassen.
  • Der Fehler: Wenn ein entscheidendes Ereignis stattfindet (wie ein Dieb, der eine Brieftasche stiehlt) und danach 20 Minuten lang langweilige Aufnahmen folgen, bevor jemand fragt: „Hast du den Dieb gesehen?“, ist das alte Wasser (der Dieb) bereits aus dem Eimer geschüttet worden. Das System vergisst die Antwort.

Andere Systeme versuchen, eine Liste von „wichtigen Momenten“ (Tokens) zu speichern, die sie gesichert haben. Aber wenn das Video lang ist, müssen sie ständig entscheiden, welche gespeicherten Momente sie wegwerfen müssen, um Platz für neue zu schaffen. Wenn sie den falschen Moment wegwerfen, ist die Antwort für immer verloren.

Die Lösung: ProtoKV (Das „Zusammenfassungs-Notizbuch“)

Die Autoren schlagen ein neues System namens ProtoKV vor. Anstatt zu versuchen, jedes einzelne Frame oder nur einige spezifische Momente zu speichern, nutzt ProtoKV ein zweiteiliges Gedächtnissystem, das wie ein intelligentes Notizbuch funktioniert.

1. Die „nahe Vergangenheit“ (Das exakte Fenster)

Für den aktuellsten Teil des Videos (sagen wir, die letzten paar Minuten) behält ProtoKV eine perfekte, hochauflösende Kopie von allem.

  • Die Analogie: Dies ist wie das Besitzen eines klaren, hochauflösenden Fotos von dem, was in den letzten 5 Minuten passiert ist. Wenn Sie eine Frage zu „jetzt gerade“ stellen, ist die Antwort direkt dort, kristallklar.

2. Die „ferne Vergangenheit“ (Die Prototypen-Bank)

Für alles, was vor diesem aktuellen Fenster passiert ist, hört ProtoKV auf, einzelne Frames zu speichern. Stattdessen erstellt es Zusammenfassungen.

  • Die Analogie: Stellen Sie sich vor, Sie beobachten einen Umzug. Sie erinnern sich nicht an jedes einzelne Gesicht von vor 2 Stunden. Stattdessen erinnern Sie sich: „Da war eine Marschkapelle“, „da war ein Wagen mit einer riesigen Katze“ und „da war eine Gruppe von Menschen in roten Hemden“.
  • Wie es funktioniert: ProtoKV gruppiert ähnliche Dinge zu „Prototypen“.
    • Wenn eine Person geht, erstellt ProtoKV eine Zusammenfassung „Gehende Person“.
    • Wenn diese Person 10 Minuten lang geht, speichert das System nicht 10 Minuten Video. Es aktualisiert einfach die Zusammenfassung „Gehende Person“ zu: „Diese Person ist schon seit langer Zeit am Gehen“.
    • Es behält auch eine „Residuen“-Notiz (Restwert): „Die meiste Zeit ging die Person normal, aber gelegentlich winkte sie.“ Dies erfasst die Varianz, ohne jeden einzelnen Schritt speichern zu müssen.

Der magische Trick: Das „Geister-Token“

Wenn schließlich eine Frage eintrifft (z. B. „Was hat die Person im roten Hemd vor 30 Minuten gemacht?“), muss das System diese Information an das KI-Modell übergeben. Aber das Modell erwartet, tatsächliche Videoframes zu sehen, nicht nur eine Zusammenfassung.

ProtoKV verwendet einen cleveren Trick namens Pseudo-Tokens.

  • Die Analogy: Stellen Sie sich vor, Sie haben eine Zusammenfassung, die besagt: „Riesenkatzen-Wagen“. Um dies dem KI-Modell zu zeigen, erstellt ProtoKV ein paar „Geister“-Videoframes, die basierend auf den Zusammenfassungsnotizen so aussehen wie der „Riesenkatzen-Wagen“.
  • Diese Geister sind keine echten Frames; sie sind mathematische Rekonstruktionen der Zusammenfassung. Das KI-Modell sieht diese Geister und behandelt sie genau wie echte Videoframes.
  • Entscheidend ist: Das System zählt, wie viele reale Momente in diese Zusammenfassung eingeflossen sind. Wenn die „Riesenkatzen-Wagen“-Zusammenfassung aus 500 echten Sekunden Video erstellt wurde, sagt das System der KI: „Dieser Geist repräsentiert 500 Sekunden an Beweisen“, damit die KI diesem Fragment mehr Aufmerksamkeit schenkt.

Warum das besser ist

Die Autoren behaupten, dass ProtoKV bei der Beantwortung von Fragen über Dinge, die lange zurückliegen (hoher „Delay“/Verzug), viel besser abschneidet als andere Methoden.

  • Alte Methode (Gleitendes Fenster): Wenn das Ereignis vor 30 Minuten stattfand, hat das System es bereits gelöscht. Die Genauigkeit sinkt auf Null.
  • Alte Methode (Token-Retention): Das System versuchte, spezifische Momente zu speichern, musste aber einige löschen, um Platz zu schaffen. Es könnte genau den Moment gelöscht haben, in dem der Dieb auftauchte.
  • ProtoKV: Es löscht niemals das Konzept des Ereignisses. Es komprimiert es lediglich in eine Zusammenfassung. Selbst nach 30 Minuten neuem Video ist die „Dieb“-Zusammenfassung noch da, aktualisiert mit neuen Details, bereit, wieder in ein „Geister“-Frame verwandelt zu werden, damit die KI die Frage beantworten kann.

Die Ergebnisse

Die Autoren haben dies auf mehreren Video-Benchmarks getestet. Sie fanden heraus, dass:

  1. Genauigkeit: ProtoKV deutlich höhere Werte (bis zu 12,5 Punkte besser) bei Fragen zu Ereignissen erzielte, die lange zurücklagen.
  2. Stabilität: Während die Zeitspanne zwischen dem Ereignis und der Frage größer wurde, blieb die Leistung von ProtoKV stabil, während andere Methoden einbrachen.
  3. Geschwindigkeit: Es beantwortet Fragen genauso schnell wie andere Methoden, da die „Zusammenfassung“ klein ist und problemlos in den Computerspeicher passt, sodass das System nicht verlangsamt wird.

Kurz gesagt: ProtoKV löst das Problem des „Vergessens“, indem es aufhört, den Versuch zu unternehmen, jedes Detail zu merken, und stattdessen die Geschichte dessen speichert, was passiert ist. Dies ermöglicht es dem System, Fragen über die ferne Vergangenheit zu beantworten, ohne einen Supercomputer-Speicher zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →