← Nieuwste papers
💻 computer science

StreamOV: Streaming Omni-Video Understanding via Evidence-Guided Memory and Response Triggering

StreamOV is een nieuw raamwerk voor het streamen van omni-videobegrip dat de beperkingen van offline methoden aanpakt door gebruik te maken van bewijsgeleide geheugen voor efficiënt contextbeheer en een door verborgen toestanden gestuurde trigger voor proactieve responsgeneratie, gevalideerd door de nieuw geïntroduceerde SOVBench.

Oorspronkelijke auteurs: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

Gepubliceerd 2026-05-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Ming Xie, Zizheng Huang, Xudong Tan, Chao Wang, Xiangyu Zeng, Wenxiao Wu, Tao Chen, Limin Wang, Yanwei Fu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een live, 24-uurs nieuwsfeed bekijkt die nooit stopt. Je wilt chatten met een slimme AI over wat er op dit moment gebeurt, maar je kunt de video niet pauzeren en je kunt niet terugspoelen om te zien wat er een uur geleden gebeurde. De AI moet in real-time kijken, luisteren, onthouden en terugpraten.

Dit is het probleem dat StreamOV oplost.

Het Probleem: De "Overweldigde Bibliothecaris"

De meeste huidige AI-video-modellen zijn als bibliothecarissen die alleen werken als de bibliotheek gesloten is. Ze wachten tot de hele film klaar is, lezen het volledige script en beantwoorden dan pas je vragen. Dit werkt niet voor live streams.

Als je deze "offline" bibliothecarissen probeerde live te laten werken, zouden ze met twee grote hoofdpijnklachten geconfronteerd worden:

  1. De Geheugenoverload: Als ze zouden proberen elk enkel beeldje en geluid van een 2-uurs stream te onthouden, zouden hun hersenen ontploffen. Ze hebben een manier nodig om de saaie delen te vergeten en alleen het belangrijke materiaal te bewaren.
  2. Het "Stilte"-Probleem: In een live chat is het beste antwoord soms geen antwoord. Als je vraagt: "Wat kookt de chef?" en de chef is nog niet begonnen, mag de AI niet gokken of een antwoord hallucineren. Het moet stil blijven tot de chef daadwerkelijk een mes pakt. Bestaande AI's worstelen hier vaak mee; ze praten te veel (vullen de stilte met onzin) of hebben een aparte, onhandige "manager" nodig om hen te vertellen wanneer ze moeten spreken.

De Oplossing: StreamOV

De auteurs creëerden StreamOV, een systeem dat specifiek is ontworpen voor deze live, "omni-modaal" (zien en horen) wereld. Hier is hoe het werkt, met behulp van enkele simpele metaforen:

1. De "Slimme Zeef" (Evidentie-gestuurd Geheugen)

Stel je voor dat je een stream bekijkt, maar je hebt slechts een klein notitieblok om aantekeningen in te maken. Je kunt niet alles opschrijven.

  • Oude manier: Alles opschrijven en proberen het later allemaal te proppen.
  • StreamOV-methode: Het heeft een Slimme Zeef. Terwijl de video afspeelt, vraagt het constant: "Is dit moment belangrijk?"
    • Veranderde het visuele tafereel drastisch? (De chef liet een pan vallen!) -> Bewaren.
    • Klonk het geluid luid of plotseling? (Een klap!) -> Bewaren.
    • Komt dit overeen met wat de gebruiker zojuist vroeg? (Gebruiker vroeg over eieren; de chef brak zojuist een ei.) -> Bewaren.
    • Is het gewoon achtergrondgeluid of een statisch shot? -> Weggooien.

Het bouwt een "Kort- en Langetermijngeheugen" op. Het Kortetermijngeheugen is een dichte buffer van wat net gebeurde (de laatste paar seconden). Het Langetermijngeheugen is een schaarse verzameling van de meest "evidentierijke" momenten van het afgelopen uur. Dit houdt het geheugen van de AI begrensd (klein), maar ongelooflijk informatief.

2. De "Interne Buikgevoel-Check" (Antwoordtriggering)

Dit is de slimste truc van het paper.

  • Oude manier: De AI genereert een speciaal "stilte-token" (zoals het typen van "..." of "wacht") om zichzelf te vertellen te zwijgen, of het gebruikt een aparte, kleinere AI-robot als bouncer die beslist wanneer gesproken moet worden.

  • StreamOV-methode: De AI gebruikt zijn eigen Interne Buikgevoel-Check.
    Denk aan het brein van de AI als een fase van "voor-denken" voordat het daadwerkelijk spreekt. StreamOV kijkt naar de allereerste vonk van gedachte (de verborgen toestand) binnen het brein van de AI.

    • Voelt het brein zich zeker? -> Spreken.
    • Voelt het brein alsof het informatie mist? -> Stil blijven.

    Het hoeft niet "wacht" te typen of een aparte robot te vragen. Het beslist intern: "Ik heb nu genoeg bewijs," en begint te spreken. Als dat niet zo is, stopt het simpelweg met het verwerken van die beurt, wat energie bespaart en onzin voorkomt.

3. De Nieuwe Test: SOVBench

Om te bewijzen dat dit werkt, konden de auteurs niet zomaar oude tests gebruiken, omdat oude tests als "pop-up toetsen" over afgemaakte films waren. Ze bouwden SOVBench, een nieuwe, live vuurproef.

  • Het test Real-time begrip (antwoorden over wat er nu gebeurt).
  • Het test Terugroepen (onthouden wat er 10 minuten geleden gebeurde).
  • Het test Proactiviteit (weten wanneer te spreken en wanneer stil te blijven).
  • Het bevat zowel video als audio, zodat de AI niet alleen "kijkt" maar ook "luistert".

De Resultaten

Toen ze de tests uitvoerden, speelde StreamOV niet alleen mee; het won.

  • Het presteerde beter dan enorme, krachtige offline-modellen (zoals Qwen3-Omni) die gedwongen werden om in een streamingmodus te werken.
  • Het was beter in het weten wanneer te spreken en wanneer stil te blijven in vergelijking met andere streamingmodellen.
  • Het bewees dat door een "Slimme Zeef" te gebruiken voor het geheugen en een "Interne Buikgevoel-Check" voor timing, een AI live video streams efficiënt kan begrijpen zonder onbeperkt geheugen of externe managers nodig te hebben.

Kortom: StreamOV is de eerste AI die een live, eindeloze video kan bekijken, alleen de belangrijke delen onthoudt en precies weet wanneer het in het gesprek moet springen en wanneer het stil moet blijven, alles zonder overweldigd te raken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →