← Nieuwste papers
💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune is een training-vrij, plug-and-play framework dat efficiënt de computationele kosten in multimodale grote taalmodellen vermindert door modaliteitsscheidings-tokens te gebruiken als verenigde queries om 80,2% van de visuele tokens te snoeien terwijl 96,3% van de oorspronkelijke nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Gepubliceerd 2026-07-29
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een superintelligente robot probeert te leren om tegelijkertijd te zien en te praten. Dit is de wereld van Multimodale Large Language Models (MLLM's), de AI-sterren die naar een foto van een zonsondergang kunnen kijken en er een gedicht over kunnen schrijven, of een complexe grafiek kunnen analyseren en vragen erover kunnen beantwoorden. Om dit te doen, "kijkt" de robot niet alleen naar de afbeelding; hij breekt de foto af in duizenden kleine digitale puzzelstukjes die "vision tokens" worden genoemd. Denk aan deze tokens als individuele pixels, maar dan veel slimmer—ze dragen alle details van de afbeelding bij zich.

Er is echter een addertje onder het gras. Wanneer je de robot een foto met een hoge definitie of een lange video voert, genereert hij zoveel van deze tokens dat de robot overweldigd raakt. Het is alsof je een bibliotheek vol boeken tegelijkertijd probeert te lezen; het proces wordt traag, duur en inefficiënt. Wetenschappers hebben geprobeerd dit op te lossen door uit te zoeken welke puzzelstukjes echt belangrijk zijn en welke slechts ruis zijn. Sommige methoden proberen belangrijkheid te voorspellen door te kijken naar hoe de robot aandacht besteedt aan woorden, terwijl andere proberen dubbele stukjes te vinden. Maar deze benaderingen raken vaak verstrikt in hun eigen complexiteit, waardoor de robot zelfs nog trager wordt terwijl hij probeert sneller te worden. De grote vraag blijft: hoe snijden we de ruis weg zonder het beeld te verliezen?

Maak kennis met SepPrune, een nieuwe methode die fungeert als een slimme redacteur voor deze AI-modellen. De onderzoekers achter dit werk merkten iets fascinerends op terwijl ze observeerden hoe deze modellen denken. Ze ontdekten dat het model in de vroege stadia van de verwerking een enorme hoeveelheid aandacht besteedt aan speciale "separator"-tokens—kleine markeringen die tussen de beeldgegevens en de tekstgegevens zitten en fungeren als een brug tussen deze twee werelden. Het blijkt dat deze separators de sleutel zijn tot het begrijpen van de afbeelding.

In plaats van te proberen de belangrijkheid van elke individuele vision token te berekenen door ze met elkaar te vergelijken (wat traag en rommelig is), gebruikt SepPrune de separator-token als een meester-query. Stel je de separator voor als een gids die bij de ingang van een museum staat. In plaats van elke enkele schildering te vragen: "Ben jij belangrijk?", kijkt de gids naar de hele kamer en wijst: "Jij, jij en jij zijn de meesterwerken; de rest kan wachten." Door de separator te gebruiken om de vision tokens snel te scoren, kan SepPrune direct de meest informatieve stukjes van de afbeelding identificeren en de rest weggooien.

De resultaten zijn indrukwekkend. Bij tests op krachtige modellen zoals Qwen2.5-VL-7B slaagde SepPrune erin om meer dan 80% van de vision tokens weg te gooien, terwijl het nog steeds 96,3% van de oorspronkelijke nauwkeurigheid van het model behield. Zelfs toen de pruning werd doorgevoerd naar een extreme reductie van 90,2%, behield het model 87,2% van zijn prestaties. Dit is een significante sprong vergeleken met andere methoden, die vaak moeite hebben om een dergelijk hoge nauwkeurigheid te handhaven wanneer ze zo diep snijden. Bovendien is deze methode veel sneller omdat deze geen complexe berekeningen tussen elke token vereist, en werkt het naadloos samen met bestaande technologieën voor versnelling.

De onderzoekers bewezen ook dat hun specifieke keuzes ertoe doen. Ze lieten zien dat het gebruik van de separator-token als de "gids" beter werkt dan het gebruik van andere delen van de tekst, en dat het negeren van de "positie" van de tokens (waar ze zich in de afbeelding bevinden) tijdens het selectieproces voorkomt dat het model per ongeluk alleen de onderste helft van een plaatje overhoudt. Kortom, SepPrune suggereert dat door te luisteren naar de brug tussen de afbeelding en de tekst, we deze AI-visionairs sneller en efficiënter kunnen maken zonder hen blind te maken voor de details die er echt toe doen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →