← Nieuwste papers
🤖 machine learning

AsymVLM: Asymmetric Token Pruning for Efficient Vision-Language Model Inference

AsymVLM is een efficiënt inferentieframework voor Vision-Language Modellen dat de onderscheidende eigenschappen van visuele en tekstmodi benut door agressieve, adaptieve pruning toe te passen op ruimtelijk redundante visietokens en tijdsgebonden, op drempelwaarden gebaseerde verwijdering op teksttokens, waarmee tot 54% FLOPs-besparing wordt bereikt terwijl het state-of-the-art-methoden overtreft op taken voor document- en grafiekbegrip.

Oorspronkelijke auteurs: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Gepubliceerd 2026-05-29
📖 6 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Yilin Feng, Ahmed Burak Gulhan, Mahmut Taylan Kandemir

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een Vision-Language Model (VLM) voor als een zeer intelligente, maar licht overweldigde assistent. Je toont hem een afbeelding (zoals een complex document of een grafiek) en stelt een vraag. Om de afbeelding te begrijpen, breekt de assistent deze op in duizenden kleine puzzelstukjes, zogenaamde "vision tokens". Om je vraag te begrijpen en een antwoord te formuleren, gebruikt hij een kleinere set "text tokens".

Het probleem is dat het "werkgeheugen" van de assistent (zijn GPU-geheugen) verzadigd raakt. Hij probeert elk enkel puzzelstukje en elk woord dat hij genereert vast te houden, waardoor het traag en duur wordt om het model te draaien.

Bestaande methoden proberen dit op te lossen door de afbeeldingsstukjes en de woorden exact op dezelfde manier te behandelen: ze gooien gewoon een vast percentage van alles weg (bijvoorbeeld: "verwijder 50% van de puzzelstukjes en 50% van de woorden"). De auteurs van dit artikel, AsymVLM, betogen dat dit vergelijkbaar is met het proberen een bibliotheek te organiseren door de helft van de boeken en de helft van de bladwijzers weg te gooien zonder na te denken over wat ze eigenlijk doen.

Hieronder wordt uitgelegd hoe AsymVLM werkt, met gebruikmaking van eenvoudige analogieën:

1. De twee verschillende problemen

Het artikel wijst erop dat afbeeldingsstukjes en woorden fundamenteel verschillend zijn:

  • Vision Tokens (De Puzzelstukjes): Deze zijn allemaal onafhankelijk. Als je een stukje van de lucht uit een foto verwijdert, maakt het stukje van de boom ernaast er niets van uit. Ze zijn "ruimtelijk redundant", wat betekent dat veel stukjes gewoon achtergrondruis zijn.
  • Text Tokens (Het Verhaal): Dit is een kettingreactie. Woord 2 hangt af van Woord 1, en Woord 3 hangt af van Woord 2. Als je een woord in het midden van een zin verwijdert, kan de rest van het verhaal misschien geen zin meer maken.

2. De oplossing: Een tweeledige strategie

In plaats van één regel voor alles te gebruiken, hanteert AsymVLM twee verschillende strategieën die zijn afgestemd op elk type token.

Strategie A: De "slimme redacteur" voor afbeeldingen (Vision Token Pruning)

Voordat de assistent überhaupt begint na te denken, treedt AsymVLM op als een slimme redacteur die naar de foto kijkt.

  • De oude manier: "Verwijder 50% van de pixels willekeurig" of "Verwijder degenen die het minst belangrijk lijken voor de vraag."
  • De AsymVLM-methode: Het maakt gebruik van een Learned Scorer (een geleerde scoregever). Stel je een coach voor die duizenden wedstrijden heeft gezien en precies weet welke spelers (tokens) echt helpen om de wedstrijd te winnen. Deze scorer kijkt niet alleen naar de afbeelding; hij kijkt naar hoe de afbeelding samenhangt met de specifieke vraag die je stelde.
  • Het "Adaptive Budget" (Aanpassend budget): Dit is het slimste deel. Het artikel merkt op dat sommige vragen een volledige scan van de afbeelding vereisen (bijvoorbeeld: "Hoeveel appels staan er in dit boomgaard?"), terwijl anderen slechts een klein hoekje nodig hebben (bijvoorbeeld: "Wat is de prijs van de rode appel?").
    • Als de vraag specifiek is voor één klein gebied, is het "gat" tussen belangrijke en onbelangrijke stukjes enorm. Het systeem zegt: "Geweldig, we kunnen agressief zijn en 75% van de afbeelding weggooien!"
    • Als de vraag de hele afbeelding nodig heeft, is het "gat" klein. Het systeem zegt: "Oké, houd 90% van de afbeelding vast, gewoon om op zeker te spelen."
    • Analogie: Het is alsof je een koffer inpakt. Als je voor één dag naar het strand gaat, pak je licht in. Als je op een maandlange reis gaat, pak je meer in. AsymVLM past de "inpakking" aan op basis van de specifieke reis, in plaats van voor iedereen dezelfde koffermaat te gebruiken.

Strategie B: De "herinnerings conciërge" voor tekst (Text Token Eviction)

Zodra de assistent begint met het genereren van een antwoord, schrijft hij woorden één voor één. Als het gesprek lang wordt, vult het geheugen zich.

  • De oude manier: Standaard methoden voor tekst-only AI (zoals H2O of StreamingLLM) proberen de oudste of minst "belangrijke" woorden te verwijderen om ruimte te maken voor nieuwe.
  • De AsymVLM-methode: De auteurs realiseerden zich dat bij deze visuele assistenten het gesprek meestal kort is en dat de afbeelding de belangrijkste context is.
    • Ze stellen een vast budget in. De assistent blijft schrijven totdat hij een limiet bereikt (bijvoorbeeld 500 woorden).
    • Zodra hij de limiet bereikt, begint hij de oudst gegenereerde woorden te verwijderen (diegene die niet meer nodig zijn voor de onmiddellijk volgende zin), maar hij verwijdert nooit de originele afbeelding of de originele vraag.
    • Analogie: Stel je voor dat je een verhaal vertelt aan een vriend. Je hoeft de eerste zin die je 10 minuten geleden zei niet te onthouden om de huidige zin af te maken. AsymVLM treedt op als een conciërge die de oude, irrelevante concepten van het whiteboard veegt om ruimte te maken voor de nieuwe zin, maar laat de originele prompt en de foto voor altijd aan de muur hangen.

3. De resultaten: Sneller en slimmer

Het artikel beweert dat AsymVLM, door deze twee soorten data verschillend te behandelen, het volgende bereikt:

  • Enorme snelheidswinst: Het bespaart tot 54% van de rekenkracht (FLOPs) die nodig is om het model te draaien. Dit komt omdat het onnodige afbeeldingsstukjes fysiek verwijdert voordat de zware wiskunde begint, in plaats van ze alleen tijdens de wiskunde te negeren.
  • Betere nauwkeurigheid: Bij taken zoals het lezen van documenten of het begrijpen van grafieken presteert het 2–3% beter dan eerdere methoden. Dit komt omdat het de specifieke afbeeldingsstukjes die het antwoord op de vraag bevatten, behoudt en de rest weggooit, terwijl andere methoden per ongeluk het cruciale stukje kunnen verwijderen.
  • Geheugenefficiëntie: Het vermindert het geheugen dat nodig is om het model te draaien, waardoor het past op kleinere, goedkopere computerchips die het volledige, niet-geprunte model niet aankonden.

Samenvatting

AsymVLM is een systeem dat beseft dat "één maat niet voor iedereen past". Het gebruikt een slim, adaptief filter om de overtollige vetrandjes van afbeeldingen te snijden op basis van de specifieke vraag, en een zorgvuldige conciërge om het tekstgeheugen te beheren zonder de originele context te verliezen. Het resultaat is een Vision-Language Model dat sneller is, minder geheugen gebruikt en verrassend nauwkeuriger is in het lezen van documenten en grafieken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →