← Nieuwste papers
🤖 machine learning

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

ProtoKV is een streaming video-begripsframework dat de uitdaging van vertraagde queries aanpakt door een constante geheugenvoetafdruk te behouden via een hybride aanpak van exacte nabij-venster KV-caching en een geheugen met een vaste capaciteit voor samenvattende toestanden van historische inhoud, waardoor de nauwkeurigheid aanzienlijk wordt verbeterd ten opzien van token-retentie baselines naarmate de query-vertraging toeneemt.

Oorspronkelijke auteurs: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Gepubliceerd 2026-06-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Le Tu Ngoc Minh (KAIST), Jinyeong Lim (KAIST), Dongsu Han (KAIST)

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een zeer lange, continue videostream kijkt, zoals een beveiligingscamerafeed van 24 uur. Jouw taak is om vragen te beantwoorden over wat er in die video is gebeurd. Het probleem? Je hebt een piepklein brein (beperkt computergeheugen) en je kunt de video niet pauzeren om terug te spoelen en alles opnieuw te bekijken. Je moet blijven kijken terwijl je wacht tot iemand een vraag stelt, wat minuten of zelfs uren na een specifieke gebeurtenis kan zijn.

Dit is de uitdaging van Streaming Video Understanding.

Het Probleem: Het "Vergetelijke" Brein

De meeste huidige systemen proberen dit op te lossen door een "sliding window" (schuivend venster) van de laatste paar minuten video in hun geheugen te houden.

  • De Analogie: Stel je voor dat je een emmer water vasthoudt (je geheugen). Terwijl nieuw water (videoframes) binnenstroomt, moet je oud water eruit laten om te voorkomen dat de emmer overloopt.
  • Het Gebrek: Als er een cruciale gebeurtenis plaatsvindt (zoals een dief die een portemonnee steelt) en er volgen daarna 20 minuten saaie beelden voordat iemand vraagt: "Heb je de dief gezien?", is het oude water (de dief) al uit de emmer geleegd. Het systeem is het antwoord vergeten.

Andere systemen proberen een lijst met "belangrijke momenten" (tokens) bij te houden die ze hebben opgeslagen. Maar als de video lang is, moeten ze constant beslissen welke opgeslagen momenten ze moeten weggooien om ruimte te maken voor nieuwe. Als ze het verkeerde moment weggooien, is het antwoord voor altijd verloren.

De Oplossing: ProtoKV (Het "Samenvattende Notitieblok")

De auteurs stellen een nieuw systeem voor genaamd ProtoKV. In plaats van te proberen elk enkel frame of slechts een paar specifieke momenten op te slaan, gebruikt ProtoKV een tweeledig geheugensysteem dat werkt als een slim notitieblok.

1. Het "Recente Verleden" (Het Exacte Venster)

Voor het meest recente deel van de video (bijvoorbeeld de laatste paar minuten) houdt ProtoKV een perfecte, high-definition kopie van alles bij.

  • Analogie: Dit is alsof je een heldere, hoogwaardige foto hebt van wat er in de afgelopen 5 minuten is gebeurd. Als je een vraag stelt over nú, staat het antwoord daar, kristalhelder.

2. Het "Verre Verleden" (De Prototype Bank)

Voor alles wat er vóór dat recente venster is gebeurd, stopt ProtoKV met het opslaan van individuele frames. In plaats daarvan maakt het samenvattingen.

  • De Analogie: Stel je voor dat je een parade bekijkt. Je herinnert je niet elk gezicht van elke persoon van 2 uur geleden. In plaats daarvan herinner je je: "Er was een fanfare," "Er was een praalwagen met een reusachtige kat," en "Er was een groep mensen in rode shirts."
  • Hoe het werkt: ProtoKV groepeert vergelijkbare zaken samen in "Prototypes."
    • Als een persoon loopt, maakt ProtoKV een "Lopende Persoon"-samenvatting.
    • Als die persoon 10 minuten lang loopt, slaat het systeem niet 10 minuten aan video op. Het werkt alleen de "Lopende Persoon"-samenvatting bij met de tekst: "Deze persoon is al een lange tijd aan het lopen."
    • Het houdt ook een "residuele" notitie bij: "De meeste tijd liep de persoon normaal, maar af en toe zwaaide hij." Dit legt de variatie vast zonder elke stap te hoeven opslaan.

De Magische Truk: De "Ghost Token"

Wanneer er eindelijk een vraag arriveert (bijv. "Wat deed de persoon in het rode shirt 30 minuten geleden?"), moet het systeem deze informatie aan het AI-model voeden. Maar het model verwacht echter echte videoframes te zien, en geen samenvattingen.

ProtoKV gebruikt een slimme truc genaamd Pseudo-Tokens.

  • De Analogie: Stel je voor dat je een samenvattende notitie hebt die zegt "Reusachtige Kat Praalwagen". Om dit aan de AI te laten zien, creëert ProtoKV een paar "ghost" (geest) frames die eruitzien als de "Reusachtige Kat Praalwagen" op basis van de samenvattende notities.
  • Deze geesten zijn geen echte frames; het zijn wiskundige reconstructies van de samenvatting. Het AI-model ziet deze geesten en behandelt ze net als echte videoframes.
  • Cruciaal is dat het systeem bijhoudt hoeveel echte momenten in die samenvatting zijn gegaan. Als de "Reusachtige Kat Praalwagen"-samenvatting gebouwd is uit 500 echte seconden video, vertelt het systeem de AI: "Deze geest vertegenwoordigt 500 seconden aan bewijs," zodat de AI er meer aandacht aan besteedt.

Waarom dit beter is

De paper beweert dat ProtoKV veel beter is in het beantwoorden van vragen over dingen die een lange tijd geleden zijn gebeurd (hoge "delay/vertraging") vergeleken met andere methoden.

  • Oude Methode (Sliding Window): Als de gebeurtenis 30 minuten geleden plaatsvond, heeft het systeem deze al verwijderd. De nauwkeurigheid daalt naar nul.
  • Oude Methode (Token Retention): Het systeem probeerde specifieke momenten te bewaren, maar moest er enkele verwijderen om ruimte te maken voor nieuwe. Het kan het exacte moment waarop de dief verscheen, hebben verwijderd.
  • ProtoKV: Het verwijdert nooit het concept van de gebeurtenis. Het comprimeert het simpelweg tot een samenvatting. Zelfs na 30 minuten nieuwe video is de "Dief"-samenvatting er nog steeds, bijgewerkt met nieuwe details, klaar om te worden omgezet in een "ghost"-frame zodat de AI de vraag kan beantwoorden.

De Resultaten

De auteurs hebben dit getest op verschillende video-benchmarks. Ze vonden dat:

  1. Nauwkeurigheid: ProtoKV behaalde aanzienlijk hogere scores (tot wel 12,5 punten hoger) op vragen over gebeurtenissen die een lange tijd geleden plaatsvonden.
  2. Stabiliteit: Naarmate de tijdsafstand tussen de gebeurtenis en de vraag groter werd, bleef de prestatie van ProtoKV stabiel, terwijl andere methoden instortten.
  3. Snelheid: Het beantwoordt vragen net zo snel als de andere methoden omdat de "samenvatting" klein is en gemakkelijk in het geheugen van de computer past, waardoor het systeem niet vertraagt.

Kortom, ProtoKV lost het probleem van "vergeten" op door te stoppen met de poging om elk detail te onthouden en in plaats daarvan het verhaal van wat er is gebeurd te onthouden, waardoor het vragen over het verre verleden kan beantwoorden zonder een supercomputer aan geheugen nodig te hebben.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →