← Nieuwste papers
💻 computer science

Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models

Dit artikel stelt Trend-aware Pruning voor, een training-vrij framework voor Multimodale Grote Taalmodellen dat de efficiëntie verbetert door de dynamische evolutie van token-belangrijkheid over lagen te modelleren om het voortijdige verlies van kritieke visuele aanwijzingen te voorkomen, waarbij meer dan 77,8% token-reductie wordt bereikt terwijl een concurrerende prestatie behouden blijft.

Oorspronkelijke auteurs: Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

Gepubliceerd 2026-07-31
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jie Ma, Zhike Qiu, Jie Gao, Jiayi Ji, Qian Chen, Xiaoshuai Sun, Rongrong Ji

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren hoe hij de wereld begrijpt door hem foto's te laten zien en vragen te stellen. Dit vakgebied wordt Multimodale Large Language Models (MLLM's) genoemd. Denk aan deze modellen als briljante detectives die tegelijkertijd tekst kunnen lezen en naar afbeeldingen kunnen kijken. Om een afbeelding te "zien", breekt de robot deze af in duizenden kleine puzzelstukjes die "tokens" worden genoemd. Elke token is een klein fragment van de foto, zoals een stukje blauwe lucht of een wiel van een auto. Het probleem is dat wanneer je de robot een foto met een hoge resolutie laat zien, hij overweldigd raakt door te veel stukjes. Hij probeert aandacht te besteden aan elk afzonderlijk stukje, wat de robot traag, duur in gebruik en soms zelfs verward maakt door alle ruis.

Om dit op te lossen, hebben wetenschappers een simpele truc geprobeerd: gooi gewoon de stukjes weg die er aan het begin onbelangrijk uitzien. Het is als een uitsmijter bij een club die naar een menigte kijkt en onmiddellijk iedereen eruit trapt die geen specifiek gekleurd shirt draagt. Maar hier is de adder onder het gras: soms is de meest interessante persoon in de kamer degene die in het begin een saai shirt draagt, om een paar minuten later pas echt te gaan dansen en het leven van het feestje te worden. Als de uitsmijter hen te vroeg eruit trapt, is het feestje verpest. Dit artikel stelt een grote vraag: is het veilig om een definitieve beslissing te nemen over wat we behouden op basis van slechts een vluchtige blik, of moeten we kijken hoe dingen in de loop van de tijd veranderen?

De onderzoekers achter dit artikel, Jie Ma en zijn team, zeggen dat de oude "uitsmijter"-methode te rigide is. Ze stellen een nieuwe manier van denken voor genaamd Trend-aware Pruning. In plaats van alleen te kijken naar een momentopname van welke tokens op dit moment belangrijk zijn, werkt hun methode als een geduldige waarnemer die de tokens in de loop van de tijd observeert om hun "neigingen" te zien. Ze realiseerden zich dat sommige tokens als laatbloeiende bloemen zijn; ze kunnen in de vroege lagen van het brein van de robot rustig en onbelangrijk lijken, maar naarmate de robot dieper in de afbeelding duikt, worden deze tokens plotseling cruciaal voor het begrijpen van de scène.

Het team heeft een systeem gebouwd dat de "momentum" van deze tokens bijhoudt. Stel je een rivier voor waar sommige rotsen gewoon liggen, maar andere langzaam naar het midden van de stroming drijven. De oude methoden zouden de drijvende rotsen negeren omdat ze nog niet in het midden liggen. De nieuwe methode merkt de drift echter wel op. Het houdt een oogje in het zeil bij tokens die een "opwaartse trend" vertonen—wat betekent dat hun belang stijgt, ook al zijn ze nog niet de hoogste prioriteit. Als een token er interessanter uit gaat zien terwijl de robot dieper graaft, "redt" het systeem deze en brengt het terug in het gesprek voordat het te laat is. Ze houden ook in de gaten welke tokens "fluctueren" (op en neer gaan) of een "neerwaartse trend" hebben (vervagen), en behandelen elke groep anders in plaats van ze allemaal simpelweg weg te gooien.

Toen ze deze idee testten op populaire robotbreinen zoals LLaVA en Qwen, waren de resultaten indrukwekkend. De nieuwe methode bespaarde niet alleen tijd; het hielp de robot ook daadwerkelijk beter presteren. In hun experimenten waren ze in staat om het aantal visuele tokens met meer dan 77,8% te verminderen, waardoor de laatste laag slechts ongeveer 23 tokens hoefde te verwerken. Ondanks het feit dat ze zoveel data weggoiden, behield de robot 98,89% van zijn oorspronkelijke prestaties bij het halveren van de tokens, en behield zelfs een sterke 96,03% prestatie wanneer hij bijna 78% van de tokens inkortte. Dit is een grote zaak, omdat andere methoden die simpelweg de "top" tokens aan het begin kiezen, vaak belangrijke details verliezen wanneer ze zo agressief worden.

De auteurs suggereren dat deze aanpak werkt omdat het respecteert dat het begrijpen van een afbeelding een reis is, en geen enkel moment. Door de robot toe te staan van gedachten te veranderen en tokens die aanvankelijk werden over het hoofd gezien te "reactiveren", voorkomen ze het verlies van cruciale aanwijzingen. Ze ontdekten dat deze dynamische aanpak vooral goed is bij lastige taken zoals het lezen van tekst in afbeeldingen (OCR) of het spotten van kleine details, waar statische methoden vaak falen. Hoewel ze toegeven dat hun systeem leunt op een vast venster van observatie en verbeterd kan worden om langere sequenties aan te kunnen, laat hun werk zien dat het volgen van de trend van aandacht een krachtige manier is om deze slimme robots sneller en scherper te maken zonder dat ze vanaf nul opnieuw getraind hoeven te worden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →