← Nieuwste papers
🤖 AI

TokenTrim: Inference-Time Token Pruning for Autoregressive Long Video Generation

TokenTrim pakt de temporele drift in autoregressieve lange videogeneratie aan door een methode tijdens de inferentie te introduceren die instabiele latente tokens identificeert en wegknipt voordat ze worden hergebruikt voor conditionering, waardoor de consistentie over een lange horizon wordt verbeterend zonder de modelarchitectuur of het trainingsproces te wijzigen.

Oorspronkelijke auteurs: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

Gepubliceerd 2026-02-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ariel Shaulov, Eitan Shaar, Amit Edenzon, Lior Wolf

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een heel lang verhaal aan een vriend probeert te vertellen, maar je kunt slechts één zin per keer uitspreken. Om het verhaal gaande te houden, moet je alles wat je net hebt gezegd onthouden om de volgende zin logisch te laten zijn.

Het Probleem: Het "Slecht Geheugen"-effect
In de wereld van AI-videogeneratie doet een computer iets vergelijkbaars. Het maakt een video in korte clips (zoals zinnen) en gebruikt vervolgens wat het net heeft gemaakt om de volgende clip te genereren. Dit wordt "autoregressieve" generatie genoemd.

De paper identificeert een groot gebrek in dit proces genaamd temporele drift. Stel je voor dat je een verhaal vertelt over een witte vrachtwagen.

  1. Je zegt: "Een witte vrachtwagen rijdt."
  2. De AI maakt een kleine fout in de tweede clip, bijvoorbeeld ziet de vrachtwagen er lichtgrijs uit.
  3. In de derde clip gebruikt de AI die "grijze vrachtwagen" als referentie, waardoor de AI de vrachtwagen nog donkerder maakt.
  4. Tegen de tiende clip is de vrachtwagen zwart. Bij de twintigste clip is het misschien wel een koe geworden.

De AI is niet aan het tekortschieten in denkkracht; het hergebruikt simpelweg zijn eigen fouten. Elke keer dat de AI een nieuwe clip genereert, kijkt het terug naar de vorige clips voor context. Als die vorige clips "corrupte" informatie bevatten (zoals de grijze vrachtwagen), behandelt de AI die corruptie als de waarheid en geeft het door, waardoor de fout steeds erger wordt totdat de video uit elkaar valt.

De Oplossing: TokenTrim (De "Editor")
De auteurs stellen een nieuwe methode voor genaamd TokenTrim. Zie de videodata die de AI gebruikt als een stapel plaknotities (genaamd "tokens"). Sommige briefjes bevatten goede informatie, en sommige bevatten "corrupte" of onstabiele informatie.

TokenTrim werkt als een slimme editor die de plaknotities controleert voordat de AI ze voor de volgende stap gebruikt. Zo werkt het in eenvoudige termen:

  1. De Controle: Voordat de AI begint met het maken van de volgende clip, vergelijkt TokenTrim de "samenvatting" van de nieuwe clip die het wil maken met de samenvatting van de clip die het net heeft voltooid.
  2. Het Alarm: Als een specifiek deel van de video (een specifieke "token" of plaknotitie) er wild verschillend of onstabiel uitziet vergeleken met wat eraan voorafging, markeert het systeem dit. Het is alsof je merkt dat de notitie "witte vrachtwagen" plotseling "paarse olifant" zegt.
  3. Het Snoeien: In plaats van die slechte notitie te gebruiken, gooit TokenTrim deze weg (snoeit het weg). Het verwijdert de gecorrumpeerde informatie uit het geheugenbank van de AI.
  4. De Herpoging: De AI wordt vervolgens gedwongen om de nieuwe clip te genereren zonder die slechte notitie. Het moet vertrouwen op de resterende, stabiele notities om te bepalen wat het nu moet doen.

Het Resultaat
Door actief de "slechte herinneringen" (onstabiele tokens) te verwijderen voordat ze de volgende stap kunnen vergiftigen, blijft de video consistent. De vrachtwagen blijft wit, het gezicht van een persoon smelt niet weg en de achtergrond vervormt niet, zelfs niet nadat de video een lange tijd heeft gedraaid.

Belangrijkste inzichten uit de paper:

  • Geen hertraining nodig: Dit gaat niet over het leren van de AI een nieuwe manier om te leren. Het is een "plug-and-play" hulpmiddel dat werkt terwijl de AI al draait. Je hoeft het model niet opnieuw te trainen of de code te veranderen.
  • Het is snel: Het proces voegt bijna geen extra tijd toe aan het maken van de video. Het is een snelle controle en een snelle verwijdering.
  • Het werkt met bestaande technologie: De paper testte dit op twee populaire methoden voor videogeneratie (Rolling Forcing en Self Forcing) en liet zien dat het toevoegen van TokenTrim de video's veel beter maakt en langer laat duren zonder uit elkaar te vallen.
  • De "Eerste Clip"-truc: De auteurs ontdekten ook dat het gebruik van een speciale techniek specifiek voor de allereerste clip helpt om een stabiele basis te leggen, wat het hele proces nog soepeler maakt.

In een notendop
Lange videogeneratie mislukt meestal omdat de AI zijn eigen fouten blijft recyclen. TokenTrim lost dit op door te fungeren als een kwaliteitscontrolefilter: het detecteert de fouten in het geheugen van de AI, verwijdert ze en dwingt de AI om opnieuw te beginnen met schone data. Dit stopt het "sneeuwbal-effect" van fouten en houdt de video veel langer realistisch en consistent.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →