← Nieuwste papers
💻 computer science

ObjectStream: Latent Objects as Memory Anchors for Streaming Video Understanding

ObjectStream is een training-vrij framework dat het begrijpen van stromende video verbetert door bevroren Video-LLM-representaties te organiseren in persistente latente objectankers, wat efficiënte, hoogwaardige redenering over objectgeschiedenissen en interacties mogelijk maakt terwijl het geheugengebruik en het aantal tokens aanzienlijk wordt verminderd.

Oorspronkelijke auteurs: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

Gepubliceerd 2026-07-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Mingkang Dong, Muxin Pu, Jie Li, Bohan Guo, Songruo Chen, Bin Ren, Xu Zheng, Chen Zhao, Tianwen Qian, Mohamed Elhoseiny, Yuqian Fu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je naar een livestream kijkt van een drukke stadsstraat. Auto's razen voorbij, mensen steken de weg over en een vogel landt op een lantaarnpaal. Stel je nu voor dat je een robot bent die vragen probeert te beantwoorden over deze straat, maar dat je alleen een minuscuul fragment van wat je ziet op elk gegeven moment kunt onthouden. Als iemand vraagt: "Welke kleur had de auto die tien minuten geleden voorbijreed?" of "Heeft die persoon zijn sleutels laten vallen?", kan je geheugen een blanco muur zijn. Dit is de uitdaging van streaming video understanding (het begrijpen van videostreams). Het is een tak van kunstmatige intelligentie waarbij computers proberen betekenis te geven aan video die in realtime binnenkomt, zoals een live feed, in plaats van een film die ze kunnen pauzeren en terugspoelen. Het grote probleem is dat video enorm groot is; het is een vloedgolf aan visuele data. Als een computer probeert elke enkele frame op te slaan, raakt het zijn geheugen (zijn hersencapaciteit) kwijt en wordt het te traag om snel vragen te beantwoorden. Daarom moeten wetenschappers uitzoeken hoe ze de saaie delen (zoals een lege lucht) kunnen weggooien en de belangrijke delen (zoals een rennende hond) kunnen bewaren zonder het verhaal te verliezen.

Maak kennis met ObjectStream, een nieuwe methode die fungeert als een supergeorganiseerde bibliothecaris voor het geheugen van een robot. In plaats van te proberen elk enkel pixel van de videostream te onthouden, besluit ObjectStream om objecten als de hoofdrolspelers van het verhaal te onthouden. Denk er bijvoorbeeld zo over: als je een chaotisch feestje aan een vriend zou beschrijven, zou je niet elke persoon die door de deur kwam opsommen. In plaats daarvan houd je de "belangrijke spelers" in de gaten: de DJ, de persoon die op de tafel danst, de man met de rode hoed. ObjectStream doet precies dit voor robots. Het kijkt naar de bevroren videodata en zegt: "Hé, die verzameling pixels lijkt op een beker," en vervolgens houdt het een dagboek bij van die beker. Het houdt bij waar de beker naartoe gaat, of hij omvalt, of dat hij verdwijnt. Het heeft geen apart team van experts nodig (zoals externe objectdetectoren) om deze items te vinden; het ontdekt het allemaal zelf via het bestaande brein van de robot.

Het artikel introduceert een slim drie-onderdelen systeem om dit geheugen te beheren. Ten eerste creëert het "Latent Object Anchors" (latente objectankers). Stel je deze voor als post-its die je op de belangrijke dingen in de video plakt. Terwijl de video speelt, werkt de robot deze briefjes bij: "De oranje mok staat nu op de tafel," of "De blauwe beker wordt vastgehouden." Het houdt een geschiedenis bij van deze objecten, zelfs als ze bewegen of licht veranderen. Ten tweede heeft het een speciale sectie voor "Transient Changes" (tijdelijke veranderingen). Soms gebeuren er dingen snel—een mes snijdt door een komkommer, of een bal stuitert. Dit zijn snelle momenten die mogelijk worden gladgestreken als je alleen naar de langetermijnhistorie kijkt. ObjectStream houdt een "snapshot" bij van deze snelle veranderingen, zodat de robot de actie niet mist. Ten derde houdt het een "Recent Visual Grounding Window" bij, wat simpelweg een helder, hoogwaardig beeld is van de laatste paar seconden van de video. Dit zorgt ervoor dat als iemand vraagt: "Wat is er op dit moment aan de hand?", de robot een vers, ongeblurd beeld heeft om naar te kijken.

De onderzoekers testten dit idee op bestaande AI-modellen die al goed waren in het begrijpen van video's, maar moeite hadden met live streams. Ze ontdekten dat door dit "objectanker"-systeem toe te voegen, de modellen veel beter werden in het beantwoorden van vragen over wat er in de video gebeurde. Bijvoorbeeld, op een test genaamd OVO-Bench, die controleert hoe goed een robot in realtime zaken kan waarnemen, steeg de score van het model met 10,0 punten (van 63,3 naar 73,3). Nog indrukwekkender was dat het dit deed terwijl het ongeveer 50% minder geheugen gebruikte en vragen twee keer zo snel beantwoordde als voorheen. Sterker nog, het systeem was zo efficiënt dat het 82,5% van de ruwe videodata (de "tokens") kon weggooien en nog steeds beter presteerde dan modellen die probeerden alles te bewaren.

Het artikel suggereert dat deze aanpak een praktische manier is om het geheugenprobleem op te lossen zonder de volledige AI-modellen vanaf nul te hoeven hertrainen. Het laat zien dat het organiseren van het geheugen rondom "dingen" (objecten) in plaats van alleen "momenten" (frames), robots helpt om het verhaal bij te houden. De auteurs ontdekten dat deze methode goed werkt voor zowel live streams als lange, vooraf opgenomen video's, wat bewijst dat het bijhouden van een dagboek van objecten een slimme manier is om de vloedgolf aan visuele informatie te beheersen. Het is geen magische oplossing die elk probleem in de wereld oplost, maar het suggereert dat als we willen dat robots onze drukke, bewegende wereld in realtime begrijpen, we ze moeten leren om de personages te onthouden, en niet alleen het decor.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →