← Nieuwste papers
💬 NLP

CoPE-VideoLM: Leveraging Codec Primitives For Efficient Video Language Modeling

CoPE-VideoLM is een efficiënt video-taalmodel dat gebruikmaakt van codec-primitieven zoals bewegingsvectoren en residuen om de temporale dekking te verbeteren en de rekenkosten te verlagen, waardoor de tijd tot het eerste token met tot 86% en het tokengebruik met tot 93% wordt gereduceerd zonder in te leveren op prestaties.

Oorspronkelijke auteurs: Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

Gepubliceerd 2026-03-31
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sayan Deb Sarkar, Rémi Pautrat, Ondrej Miksik, Marc Pollefeys, Iro Armeni, Mahdi Rad, Mihai Dusmanu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

CoPE-VideoLM: De Slimme Videobewerker die "Tussenstappen" Leest

Stel je voor dat je een heel lang verhaal wilt vertellen aan een robot, maar de robot heeft maar een heel kort geheugen. Als je de robot elke seconde een nieuwe foto geeft van wat er gebeurt, raakt zijn geheugen vol en wordt hij traag. Dat is precies het probleem waar huidige videobots last van hebben: ze kijken naar duizenden foto's (frames) per minuut, wat veel te zwaar is.

De onderzoekers van CoPE-VideoLM hebben een slimme oplossing bedacht. Ze kijken niet naar de "volledige foto's", maar naar de geheime instructies die videobewerkingssoftware al gebruikt om bestanden klein te houden.

Hier is hoe het werkt, vertaald naar alledaagse beelden:

1. Het Probleem: De "Alles-Opnieuw" Methode

Stel je voor dat je een animatie maakt van een bal die over een veld rolt.

  • De oude manier (Standard VideoLM): De computer slaat voor elke seconde een volledige, nieuwe foto op van het hele veld, de lucht, de bomen en de bal. Zelfs als de bal maar een millimeter is bewogen, wordt de hele foto opnieuw opgeslagen. Dit is als een boek schrijven waarbij je op elke pagina het hele verhaal herhaalt, alleen met één woord veranderd. Het kost enorm veel ruimte en tijd.

2. De Oplossing: De "Verschil-Notitie"

Video's worden normaal gesproken gecomprimeerd (zoals bij Netflix of YouTube) om ze snel te sturen. De software doet iets slim:

  • Ze slaat één keer een volledige foto op (een "I-frame").
  • Voor de volgende momenten slaat ze alleen op: "De bal is 5 centimeter naar rechts bewogen" (bewegingsvectoren) en "Hier is een klein stukje schaduw veranderd" (residuen). Dit noemen ze P-frames.

De meeste AI-modellen negeren deze slimme "verschil-notities" en decoderen alles weer terug naar volledige foto's. CoPE-VideoLM doet het anders: het leest direct de notities.

3. De Analogie: De Chef en de Knecht

Stel je een restaurant voor:

  • De Chef (de AI): Moet het menu (het antwoord) bedenken.
  • De Knecht (de Video): Brengt de ingrediënten.

Huidige methode: De knecht brengt voor elke gang een volledige, nieuwe versie van het hele restaurant, inclusief tafels, stoelen en ramen, alleen met één bordje op de tafel veranderd. De Chef moet elke keer alles opnieuw bekijken voordat hij kan beslissen wat hij ziet. Dit duurt eeuwen.

CoPE-methode: De knecht brengt de eerste gang (de volledige foto). Voor de volgende gangen zegt hij alleen: "Ik heb het bordje 5 cm naar rechts geschoven en er staat nu een sausje op."
De Chef (CoPE-VideoLM) is slim genoeg om deze korte instructies direct te begrijpen en in zijn hoofd de nieuwe situatie te reconstrueren. Hij hoeft niet naar de hele kamer te kijken, alleen naar de veranderingen.

Wat levert dit op?

  1. Snelheid (TTFT): Omdat de AI niet hoeft te wachten op het laden van duizenden foto's, kan hij binnen een fractie van een seconde beginnen met praten. De paper zegt dat dit 86% sneller is. Het is alsof je van een trein overstapt op een raket.
  2. Ruimtebesparing: De AI gebruikt 93% minder "woorden" (tokens) om dezelfde video te begrijpen. In plaats van 100 foto's te lezen, leest hij 1 foto en 9 korte notities.
  3. Beter Begrip: Omdat de AI de beweging (de "notities") direct ziet, is hij juist beter in het begrijpen van acties en timing dan modellen die alleen naar statische foto's kijken. Het is alsof je een dansje ziet door naar de beweging te kijken, in plaats van naar een reeks stilstaande foto's.

Conclusie

CoPE-VideoLM is een revolutie omdat het stopt met het "opnieuw uitvinden van de wielen". Het gebruikt de slimme trucs die videobewerkingssoftware al decennialang gebruikt. Door direct te kijken naar wat er verandert in plaats van wat er blijft, kunnen AI's nu video's van urenlang bekijken, in real-time reageren, en dat allemaal met een heel klein stukje rekenkracht.

Het is de overstap van "alles opnieuw fotograferen" naar "gewoon noteren wat er verschuift".

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →