← Nieuwste papers
💻 computer science

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

Het artikel stelt SMORE voor, een geheugenefficiënt framework voor Video Moment Retrieval dat gebruikmaakt van query-gestuurde bijschriften, belangsmodulatie en adaptieve framecompressie om state-of-the-art prestaties op meerdere benchmarks te behalen terwijl de geheugenbeperkingen van dichte frameverwerking worden overwonnen.

Oorspronkelijke auteurs: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

Gepubliceerd 2026-01-15
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een film van 2 uur hebt, maar je hebt slechts een klein notitieblokje om op te schrijven wat er gebeurt. Je moet een specifieke scène vinden op basis van een beschrijving zoals: "Het moment dat de puppy achter de rode bal aanrent."

Het Probleem:
De meeste huidige AI-systemen proberen dit op twee manieren op te lossen, en beide hebben gebreken:

  1. De "Sparse Snapshot"-aanpak: Ze maken elke paar seconden een paar willekeurige foto's van de film. Als de puppy tussen deze snapshots door over het scherm rent, mist de AI het volledig. Het is alsoer dat je een boek probeert te lezen door alleen naar pagina 1, pagina 50 en pagina 100 te kijken.
  2. De "Full Description"-aanpak: Ze proberen een gedetailleerde samenvatting te schrijven van elke enkele seconde van de film. Dit legt alles vast, maar het vult je notitieblok (geheugen) zo snel dat de computer crasht voordat het zelfs maar klaar is.

De Oplossing: SMORE (See MORE, store less)
De auteurs stellen een nieuw framework voor genaamd SMORE. Denk aan SMORE als een super-slimme, geheugenefficiënte assistent die precies weet waar je naar op zoek bent voordat hij zelfs maar begint met het lezen van het script.

Zo werkt SMORE, met drie eenvoudige trucs:

1. De "Customized Highlighter" (Query-Guided Captions)

In plaats van generieke aantekeningen te maken zoals "Een hond loopt," luistert SMORE eerst naar jouw specifieke vraag.

  • De oude manier: De AI schrijft: "Een hond loopt." (Generiek, helpt je misschien niet om de specifieke scène te vinden).
  • De SMORE-manier: Als je vraagt: "Waar is de puppy die achter de bal aanrent?", kijkt de AI naar de video en schrijft: "Een puppy is een bal aan het achternaslaan."
  • De Analogie: Stel je een bibliothecaris voor die, in plaats van elk boek alleen op kleur te catalogiseren, jouw verzoek leest ("Ik zoek een boek over de ruimte") en dan een speciale notitie op de relevante boeken schrijft: "Deze gaat over de ruimte!" Dit zorgt ervoor dat de aantekeningen exact overeenkomen met waar je naar op zoek bent.

2. De "Volume Knob" (Query-Aware Importance)

Niet alle aantekeningen zijn even belangrijk. Sommige scènes zijn slechts achtergrondruis; andere zijn de hoofdgebeurtenis.

  • Hoe het werkt: SMORE geeft een "volumehendel" aan elke aantekening die het maakt. Als een aantekening perfect bij jouw zoekopdracht past, draait het volume omhoog (hoge belangrijkheid). Als een aantekening over iets onrelevant gaat (zoals een kat die op de achtergrond slaapt terwijl je vroeg naar een puppy), draait het volume omlaag.
  • De Analogie: Het is als een DJ die een afspeellijst mixt. Wanneer het nummer dat je wilt horen begint, draait de DJ het volume flink omhoog. Wanneer een nummer speelt waar je niet om geeft, laat hij het wegsterven zodat het niet afleidt. Dit helpt de AI om zich alleen te concentreren op de "luide" (belangrijke) delen van de video.

3. De "Smart Compressor" (Structured Visual Compression)

Video's bevatten vaak veel frames die bijna identiek zijn (bijv. een auto die over een rechte weg rijdt gedurende 10 seconden). Het opslaan van elk afzonderlijk frame is verspilling van ruimte.

  • Hoe het werkt: SMORE kijkt naar opeenvolgende frames. Als twee frames bijna hetzelfde zijn, gooit het er niet zomaar één weg (wat informatieverlies zou betekenen). In plaats daarvan "perst" het ze wiskundig samen tot één compacte samenvatting die de belangrijkste details behoudt.
  • De Analogie: Stel je voor dat je een stapel van 100 foto's hebt van een zonsondergang waarbij de zon nauwelijks beweegt. In plaats van alle 100 foto's te bewaren, neem je de beste 5 en meng je deze tot één hoogwaardige "superfoto" die de hele beweging vastlegt zonder dat je 100 aparte bestanden nodig hebt.

De Resultaten

De paper testte dit systeem op drie grote videodatabases (QVHighlights, Charades-STA, en ActivityNet-Captions).

  • Prestaties: SMORE versloeg de huidige beste modellen (zoals Chrono en LLaVA-MR) in het vinden van de juiste videomomenten.
  • Efficiëntie: Het deed dit terwijl het minder geheugen gebruikte. Terwijl andere topmodellen een enorme, dure computerchip (80GB geheugen) nodig hadden om te draaien, kon SMORE betere resultaten behalen op een kleinere, meer gangbare chip (48GB geheugen).

In een Notendop:
SMORE is als een detective die niet zomaar blindelings een heel dossier doorleest. In plaats daarvan leest de detective de specifieize clue die je geeft, markeert de relevante pagina's, draait het lawaai zachter en vat de saaie delen samen, zodat hij het mysterie sneller en met minder papier kan oplossen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →