UniPrune: Unified Progressive Visual Token Pruning with Information-Aware Budget Allocation for Efficient LLaVA-Style Vision Language Models
UniPrune is een verenigd progressief visueel token-pruning-framework dat synergetisch encoder-fase semantische belang-diversiteit-pruning combineert met LLM-fase piramidevormige dropping, versterkt door Information-Aware Budget Allocation en Cross-Stage Information Continuity mechanismen, om superieure efficiëntie en prestaties te bereiken in LLaVA-stijl Vision Language Models zelfs bij extreme compressieratio's.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Moderne kunstmatige intelligentiesystemen die kunnen zien en spreken worden opmerkelijk bekwaam, maar ze dragen een zware computationele last met zich mee. Deze vision-language modellen werken door eerst een afbeelding om te zetten in een lange sequentie van kleine digitale stukjes, vaak tokens genoemd, die verschillende delen van de foto vertegenwoordigen. Een standaardfoto kan worden afgebroken in honderden van deze stukjes. Het systeem verwerkt deze volledige sequentie vervolgens samen met tekst, vergelijkbaar met hoe een mens een zin leest terwijl hij naar een diagram kijkt. Het probleem is dat de wiskundige operaties die nodig zijn om deze stukjes met elkaar te verbinden exponentieel groeien naarmate het aantal stukjes toeneemt. Als een afbeelding 576 tokens genereert, moet de computer een enorme hoeveelheid werk verrichten om te begrijpen hoe ze met elkaar verband houden, zelfs als veel van die tokens onbelangrijke achtergronddetails vertegenwoordigen zoals een blanke muur of een stukje lucht. Deze inefficiëntie maakt het moeilijk om deze krachtige systemen op standaardhardware te draaien of om ze te gebruiken voor realtime taken zoals videoanalyse.
Onderzoekers proberen dit al lang op te lossen door de onnodige stukjes te verwijderen voordat het systeem aan het werk gaat. Sommige methoden fungeren als een filter aan het begin, waarbij ze tokens weggooien op basis van enkel hoe de afbeelding eruitziet. Anderen wachten tot het systeem de tekst en de afbeelding samen is gaan verwerken, om vervolgens stukjes te verwijderen die blijkbaar irrelevant zijn voor de specifieke vraag die gesteld wordt. Beide benaderingen hebben echter een blinde vlek. De vroege filters gooien vaak belangrijke details weg omdat ze niet weten wat de gebruiker vraagt, terwijl de latere filters energie verspillen aan het verwerken van de gehele afbeelding voordat ze überhaupt iets kunnen verwijderen. Een nieuwe studie introduceert een verenigde aanpak die de sterke punten van beide methoden combineert, waardoor een efficiënter pad ontstaat voor deze intelligente systemen om te volgen.
De onderzoekers, onder leiding van Jianhua Cui en Meizhou Ding, ontwikkelden een framework genaamd UniPrune, dat tokenreductie behandelt als een tweestapsreis in plaats van een enkele gebeurtenis. Stel je voor dat je een koffer inpakt voor een reis waarbij je de exacte weersomstandigheden nog niet weet. Je zou niet zomaar alles erin gooien en hopen op het beste, noch zou je pas beslissen wat je wilt houden nadat je de hele tas al hebt ingepakt. In plaats daarvan kun je eerst vergelijkbare items bij elkaar groeperen en de meest representatieve hiervan bewaren, en dan, zodra je je bestemming kent, een definitieve, meer precieze selectie maken. Dit is in essentie wat UniPrune doet. Het voert eerst een brede schoonmaak van de beeldgegevens uit met behulp van visuele patronen, en vervolgens, wanneer het systeem begint te begrijpen wat de context van een vraag is, voert het een tweede, scherpere schoonmaak uit.
De eerste stap van dit proces vindt plaats direct nadat de afbeelding is gescand en voordat het taalmodel erbij betrokken raakt. Het systeem groepeert de visuele tokens in clusters op basis van hun gelijkenis, vergelijkbaar met het sorteren van een stapel gemengde foto's op basis van hun algemene onderwerp. Vanuit elke groep houdt het de belangrijkste token aan en verwijdert de rest. Dit verwijdert de overduidelijke redundanties, zoals meerdere tokens die hetzelfde stukje blauwe lucht vertegenwoordigen. De onderzoekers realiseerden zich echter dat het simpelweg halveren van het aantal tokens in deze fase riskant kon zijn. Als het systeem te agressief te vroeg snijdt, kan het een token verliezen dat later cruciaal is voor het beantwoorden van een specifieke vraag. Om dit op te lossen, introduceerden ze een dynamische budgetstrategie. In plaats van een vaste regel te gebruiken voor hoeveel tokens er in deze eerste fase behouden moeten blijven, meet het systeem hoe complex de afbeelding is. Een eenvoudige afbeelding met een duidelijk onderwerp krijgt een strikter budget, terwijl een complexe, drukke scène meer tokens mag behouden. Dit zorgt ervoor dat het systeem voldoende detail behoudt om moeilijke vragen te kunnen beantwoorden zonder energie te verspillen aan eenvoudige vragen.
Zodra deze initiële selectie is gemaakt, worden de resterende tokens doorgegeven aan het grote taalmodel, dat ermee begint ze samen met de tekst te verwerken. Hier past het systeem een tweede pruning-strategie toe die werkt als een piramide. Naarmate de gegevens door de diepere lagen van het model bewegen, verwijdert het systeem geleidelijk meer tokens. De logica is dat naarmate het model de afbeelding beter begrijpt in de context van de vraag, het duidelijker wordt welke stukjes informatie niet langer nodig zijn. De onderzoekers ontdekten dat de meest effectieve manier om de taken tussen deze twee fasen te verdelen, niet is door de tokens gelijkmatig te verdelen, maar door een specifieke wiskundige balans te volgen. Ze ontdekten dat het ideale aantal tokens om te behouden na de eerste fase ongeveer de vierkantswortel is van het product van het startaantal en het uiteindelijke doelaantal. Deze vuistregel, die ze een informatiebewust budget noemen, stelt het systeem in staat om het juiste evenwicht te vinden waarbij genoeg rekenkracht wordt bespaard zonder het vermogen om vragen accuraat te beantwoorden op te offeren.
Om er zeker van te zijn dat de eerste fase niet per ongeluk tokens verwijdert die de tweede fase nuttig zou hebben gevonden, voegden de onderzoekers een derde laag intelligentie toe. Ze analyseerden hoe de visuele tokens met elkaar interageren binnen de beeldencoder zelf. Ze ontdekten dat sommige tokens fungeren als globale integratoren, die informatie over de hele afbeelding heen verbinden, terwijl andere slechts lokale detectoren zijn. Door deze globale integratoren tijdens de eerste snede extra gewicht te geven, zorgt het systeem ervoor dat de tokens die naar het taalmodel worden doorgegeven een hoogwaardige basis vormen. Deze "cross-stage continuity" betekent dat de tweede fase een betere startpositie heeft, waardoor het slimmere beslissingen kan nemen over wat er later verwijderd moet worden.
De resultaten van het testen van dit framework op twee belangrijke families van vision-language modellen waren opmerkelijk. Wanneer de onderzoekers de systemen tot de uiterste grenzen dreven, waarbij slechts een fractie van de oorspronkelijke tokens werd behouden — soms slechts 24 van de 576 — presteerde de nieuwe methode aanzienlijk beter dan bestaande technieken. Single-stage methoden, die proberen alle snijwerk in één keer te doen, zagen hun nauwkeurigheid onder deze omstandigheden scherp dalen. In contrast hiermee behield de tweestaps UniPrune-aanpak een hoge prestatie en beantwoordde correct vragen over objecten en scènes die andere methoden misten. Bijvoorbeeld, bij een standaardtest van visueel begrip behield de nieuwe methode meer dan 90% van de prestaties van het volledige, ongecomprimeerde model, terwijl deze slechts een fractie van de rekenkracht gebruikte.
Naast nauwkeurigheid mat de studie ook de praktische voordelen voor het draaien van deze modellen op echte hardware. Door het aantal tokens vroeg in het proces te verminderen, verlaagde het systeem drastisch het piekgeheugen dat nodig is om het model te draaien. Dit is een cruciale factor voor het implementeren van deze technologieën op apparaten met beperkte middelen. De onderzoekers berekenden dat de nieuwe methode de totale computationele arbeid met meer dan de helft verminderde in vergelijking met het draaien van het model zonder enige pruning, en zelfs meer vergeleken met methoden die wachten tot het einde om tokens te snijden. De overhead die werd toegevoegd door de nieuwe slimme budgettering en scoringsmechanismen was verwaarloosbaar en nam minder dan één procent van de totale tijd in beslag, wat betekent dat de winst in efficiëntie bijna volledig puur is.
De studie suggereert dat de sleutel tot efficiënte kunstmatige intelligentie niet alleen gaat over het afsnijden van hoeken, maar over het begrijpen van waar en wanneer men moet snijden. Door te erkennen dat visuele redundantie in twee verschillende vormen voorkomt — één gebaseerd op de afbeelding zelf en een andere op de taak die wordt uitgevoerd — hebben de onderzoekers een systeem gecreëerd dat beide beheert. De bevindingen wijzen erop dat een verenigde, meerfasige aanpak superieur is aan het proberen op te lossen van het probleem in één enkele stap. Dit werk biedt een duidelijk pad voor het sneller en toegankelijker maken van krachtige vision-language modellen, en bewijst dat we met de juiste strategie de overtolligheid kunnen weghalen zonder de essentie van wat deze systemen intelligent maakt, te verliezen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.