← Neueste Arbeiten
💻 computer science

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

StreamOV ist ein neuartiges Framework für das Streaming von Omni-Video-Verständnis, das die Einschränkungen von Offline-Methoden durch den Einsatz evidenzgestützten Speichers für ein effizientes Kontextmanagement und eines durch versteckte Zustände gesteuerten Triggers für die proaktive Generierung von Antworten adressiert und durch den neu eingeführten SOVBench validiert wird.

Ursprüngliche Autoren: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

Veröffentlicht 2026-05-26
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie beobachten einen Live-Nachrichtenfeed, der 24 Stunden lang ununterbrochen läuft. Sie möchten mit einer intelligenten KI über das sprechen, was gerade passiert, aber Sie können das Video nicht anhalten und nicht zurückspulen, um zu sehen, was vor einer Stunde geschah. Die KI muss live zuschauen, zuhören, sich erinnern und in Echtzeit antworten.

Genau dieses Problem löst StreamOV.

Das Problem: Der „überforderte Bibliothekar"

Die meisten aktuellen KI-Video-Modelle sind wie Bibliothekare, die nur arbeiten, wenn die Bibliothek geschlossen ist. Sie warten, bis der gesamte Film zu Ende ist, lesen das ganze Skript und beantworten dann Ihre Fragen. Das funktioniert nicht für Live-Streams.

Wenn Sie versuchen würden, diese „offline" arbeitenden Bibliothekare live arbeiten zu lassen, stünden sie vor zwei großen Problemen:

  1. Der Speicherüberlauf: Wenn sie versuchen würden, jeden einzelnen Bildrahmen und jedes Geräusch eines zweistündigen Streams zu merken, würde ihr Gehirn explodieren. Sie brauchen eine Möglichkeit, die langweiligen Teile zu vergessen und nur das Wichtige zu behalten.
  2. Das „Schweigen"-Problem: In einem Live-Chat ist manchmal die beste Antwort keine Antwort. Wenn Sie fragen: „Was kocht der Koch?", der Koch aber noch nicht angefangen hat, sollte die KI nicht raten oder eine Antwort halluzinieren. Sie sollte ruhig bleiben, bis der Koch tatsächlich ein Messer in die Hand nimmt. Bestehende KIs haben damit oft Schwierigkeiten; sie sprechen entweder zu viel (füllen die Stille mit Unsinn) oder benötigen einen separaten, umständlichen „Manager", der ihnen sagt, wann sie sprechen sollen.

Die Lösung: StreamOV

Die Autoren haben StreamOV entwickelt, ein System, das speziell für diese lebendige, „omni-modale" (sehende und hörende) Welt konzipiert ist. So funktioniert es, anhand einiger einfacher Metaphern:

1. Der „intelligente Sieb" (Evidenzgesteuertes Gedächtnis)

Stellen Sie sich vor, Sie schauen einem Stream zu, haben aber nur ein kleines Notizbuch, um Notizen zu machen. Sie können nicht alles aufschreiben.

  • Der alte Weg: Alles aufschreiben und versuchen, es später unterzubringen.
  • Der StreamOV-Weg: Es verfügt über einen intelligenten Sieb. Während das Video läuft, fragt es ständig: „Ist dieser Moment wichtig?"
    • Hat sich die visuelle Szene drastisch verändert? (Der Koch hat eine Pfanne fallen lassen!) -> Behalten.
    • Ist das Audio laut oder plötzlich geworden? (Ein Krach!) -> Behalten.
    • Entspricht dies dem, was der Benutzer gerade gefragt hat? (Der Benutzer fragte nach Eiern; der Koch hat gerade ein Ei aufgeschlagen.) -> Behalten.
    • Ist es nur Hintergrundgeräusch oder eine statische Einstellung? -> Wegwerfen.

Es baut ein „Lang- und Kurzzeitgedächtnis" auf. Das Kurzzeitgedächtnis ist ein dichter Puffer dessen, was gerade passiert ist (die letzten paar Sekunden). Das Langzeitgedächtnis ist eine spärliche Sammlung der „evidenzreichsten" Momente der letzten Stunde. Dies hält den Speicher der KI begrenzt (klein), aber unglaublich aussagekräftig.

2. Der „innere Bauchcheck" (Auslösen der Antwort)

Dies ist der cleverste Trick des Papiers.

  • Der alte Weg: Die KI generiert ein spezielles „Schweige-Token" (wie das Tippen von „..." oder „warte"), um sich selbst zum Schweigen zu bringen, oder sie verwendet einen separaten, kleineren KI-Roboter als Türsteher, der entscheidet, wann gesprochen werden soll.
  • Der StreamOV-Weg: Die KI nutzt ihren eigenen inneren Bauchcheck.
    Stellen Sie sich das Gehirn der KI als eine Phase des „Vor-Denkens" vor, bevor es tatsächlich spricht. StreamOV betrachtet den allerersten Funken eines Gedankens (den verborgenen Zustand) im Gehirn der KI.
    • Fühlt sich das Gehirn sicher? -> Sprechen.
    • Fühlt sich das Gehirn so, als fehlten Informationen? -> Schweigen.

Es muss nicht „warte" tippen oder einen separaten Roboter fragen. Es entscheidet einfach intern: „Ich habe jetzt genug Beweise", und beginnt zu sprechen. Wenn nicht, stoppt es einfach die Verarbeitung dieses Durchgangs, spart Energie und vermeidet Unsinn.

3. Der neue Test: SOVBench

Um zu beweisen, dass dies funktioniert, konnten die Autoren nicht einfach alte Tests verwenden, denn alte Tests waren wie „Pop-Quizzes" zu fertigen Filmen. Sie bauten SOVBench, eine neue Live-Feuer-Prüfung.

  • Es testet das Echtzeit-Verständnis (Antworten über das, was gerade passiert).
  • Es testet das Erinnern (Erinnern an das, was vor 10 Minuten geschah).
  • Es testet die Proaktivität (Wissen, wann man sprechen und wann man schweigen soll).
  • Es enthält sowohl Video als auch Audio, um sicherzustellen, dass die KI nicht nur „zuschaut", sondern auch „zuhört".

Die Ergebnisse

Als sie die Tests durchführten, spielte StreamOV nicht nur das Spiel mit; es gewann.

  • Es übertraf massive, leistungsstarke Offline-Modelle (wie Qwen3-Omni), die gezwungen wurden, im Streaming-Modus zu arbeiten.
  • Es war besser darin zu wissen, wann es sprechen und wann es schweigen sollte, im Vergleich zu anderen Streaming-Modellen.
  • Es bewies, dass eine KI durch die Verwendung eines „intelligenten Siebs" für das Gedächtnis und eines „inneren Bauchchecks" für den Zeitpunkt Live-Video-Streams effizient verstehen kann, ohne unendlichen Speicher oder externe Manager zu benötigen.

Kurz gesagt: StreamOV ist die erste KI, die einen Live-Video-Stream ohne Ende beobachten, nur die wichtigen Teile merken und genau wissen kann, wann sie in das Gespräch eingreifen und wann sie ruhig bleiben soll – alles, ohne überfordert zu werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →