← Nieuwste papers
💻 computer science

EarlyTom: Early Token Compression Completes Fast Video Understanding

Het artikel stelt EarlyTom voor, een trainingsvrij raamwerk dat vroege visuele tokencompressie uitvoert binnen de visuele encoder om de latentie tot het eerste token en de rekenkosten aanzienlijk te verminderen, terwijl een nauwkeurigheid wordt behouden die vergelijkbaar is met die van baselines met volledige tokens.

Oorspronkelijke auteurs: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

Gepubliceerd 2026-05-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Hesong Wang, Xin Jin, Lu Lu, Chenhaowen Li, Jian Chen, Qiang Liu, Huan Wang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een 30 minuten durende film te beschrijven aan een zeer slim, maar zeer drukke vriend (de AI). Je vriend moet de hele film eerst bekijken voordat hij je vragen kan beantwoorden.

Het Probleem: Het "Langzame Begin"
Op dit moment gedraagt een AI zich bij het begrijpen van een video als een student die erop staat elk enkel pagina van een leerboek te lezen voordat hij één vraag beantwoordt.

  • De Oude Manier: De AI bekijkt elk enkel frame van de video, breekt het op in duizenden kleine stukjes (tokens) en geeft die enorme stapel vervolgens door aan zijn "hersenen" (het Large Language Model) om te verwerken.
  • De Bottleneck: Het onderzoek ontdekte dat de grootste vertraging niet de denk tijd van de AI is; het is de tijd die wordt besteed aan het bekijken en organiseren van de video in de eerste plaats. Het is alsof je 40 minuten besteedt aan het sorteren van een kaartspel voordat je überhaupt begint met het spelen van het spel. Zelfs wanneer andere methoden probeerden later wat kaarten weg te gooien, was het initiële sorteren nog steeds traag.

De Oplossing: EarlyTom (De "Slimme Redacteur")
De auteurs creëerden een nieuwe methode genaamd EarlyTom. Denk aan EarlyTom als een super-efficiënte filmredacteur die ingrijpt terwijl de video wordt bekeken, niet erna.

In plaats van te wachten tot de video volledig is verwerkt om te beslissen wat bewaard moet worden, bewerkt EarlyTom de video tijdens het kijkproces. Het gebruikt twee belangrijkste trucs:

1. De "Samenvoeg"-truc (Tijdscompressie)
Stel je voor dat je een video bekijkt waarin een persoon 10 seconden stil staat en praat. De video bevat 300 frames van diezelfde persoon.

  • Oude Manier: De AI verwerkt alle 300 frames individueel.
  • EarlyTom: Het merkt op: "Hé, deze 300 frames zijn bijna identiek." In plaats van ze allemaal te verwerken, voegt het ze samen tot één enkel, hoogwaardig samenvattend frame. Het is alsof je een 10 minuten durend monoloog samenvat tot één zin voordat je het doorgeeft. Dit gebeurt binnenin de camera-lens (de visuele encoder), zodat het zware werk veel sneller wordt gedaan.

2. De "Schijnwerper"-truc (Ruimtelijke Selectie)
Stel je nu voor dat de AI een menigte mensen in een video moet bekijken.

  • De Valstrik: Het onderzoek vond dat AI een raar gewoonte heeft genaamd "Attention Sinking" (Aandacht Zinken). Het is alsof een schijnwerper vastloopt op een paar specifieke plekken (zoals een kale muur of een logo) en daar te fel op schijnt, waardoor hij de werkelijke actie elders negeert. Als je gewoon de "helderste" plekken kiest, kun je de belangrijke actie missen.
  • EarlyTom's Oplossing: Het splitst de menigte in twee groepen:
    • De "Bewegende" Groep: Voor delen van de video waar dingen veranderen (actie), kiest het de belangrijkste details globaal.
    • De "Stilstaande" Groep: Voor delen waar dingen statisch zijn, gebruikt het een lokale "venster"-benadering om ervoor te zorgen dat het niet afgeleid wordt door de vastzittende schijnwerper. Het zorgt ervoor dat de AI een gebalanceerd beeld van de scène ziet zonder bevooroordeeld te raken door die vastzittende plekken.

Het Resultaat: Snelheid zonder Slimheid te Verliezen
Door deze bewerking vroeg in het proces uit te voeren, bereikt EarlyTom twee geweldige dingen:

  1. Super Snel Begin: Het verkort de tijd die nodig is voor het eerste antwoord (Time-to-First-Token) met wel 2,65 keer. Als de oude manier 900 milliseconden nodig had, heeft dit er ongeveer 336 milliseconden voor nodig.
  2. Minder Werk: Het vermindert de benodigde totale rekenkracht met wel 61%.

De Conclusie
Het onderzoek claimt dat EarlyTom video-AI ongelooflijk snel en efficiënt maakt zonder dat het opnieuw getraind hoeft te worden of zijn vermogen om de video nauwkeurig te begrijpen verliest. Het bewijst dat je niet elk enkel frame hoeft te bekijken om het verhaal te begrijpen; je moet alleen weten wanneer je moet stoppen met kijken en beginnen met denken.

Kortom: EarlyTom is een trainingsvrij hulpmiddel dat de video bewerkt terwijl deze wordt bekeken, waardoor video-AI sneller en goedkoper wordt om te draaien, terwijl de antwoorden even slim blijven.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →