← Nieuwste papers
🤖 AI

IDPruner: Harmonizing Importance and Diversity in Visual Token Pruning for MLLMs

IDPruner is een nieuwe methode voor visuele token-pruning in multimodale grote taalmodellen die, door het Maximal Marginal Relevance-algoritme te gebruiken voor een optimale balans tussen relevantie en diversiteit zonder attentiemaps, de inferentie-efficiëntie aanzienlijk verbetert terwijl de prestaties op diverse taken behouden blijven.

Oorspronkelijke auteurs: Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

Gepubliceerd 2026-02-17
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yifan Tan, Yifu Sun, Shirui Huang, Hong Liu, Guanghua Yu, Jianchen Zhu, Yangdong Deng

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat een Multimodaal Groot Taalmodel (MLLM) een slimme detective is die foto's en teksten samen bekijkt om vragen te beantwoorden. Maar er is een probleem: als deze detective een foto bekijkt, splitst hij die op in duizenden kleine stukjes, zogenaamde "tokens". Het is alsof hij elke pixel van een foto apart bekijkt. Voor een computer is dit een enorme hoeveelheid werk, net als het proberen te lezen van een heel boek woord voor woord, letter voor letter, terwijl je eigenlijk alleen maar de hoofdpunten nodig hebt.

Dit maakt het proces traag en duur. Om dit op te lossen, proberen onderzoekers "visuele token pruning" (het snoeien van visuele tokens). Ze willen de onbelangrijke stukjes weggooien en alleen de belangrijke houden.

Het oude probleem: Te veel of te weinig
Tot nu toe hadden onderzoekers twee manieren om te beslissen wat ze moesten weggooien:

  1. De "Belangrijke" aanpak: Ze hielden alleen de tokens vast die leken op het hoofdonderwerp (bijvoorbeeld een hond in een foto). Maar hierdoor vergeten ze de achtergrond, wat soms cruciaal is om te begrijpen waar de hond is.
  2. De "Verscheidenheid" aanpak: Ze zorgden ervoor dat ze tokens uit heel verschillende delen van de foto hielden, zodat ze niets misten. Maar hierdoor hielden ze soms ook veel onbelangrijke ruis vast (zoals een wazige muur) en misten ze de fijne details van de hond.

Het was als het kiezen tussen alleen de hoofdrolspelers van een film houden (en de rest negeren) of elke willekeurige scène uit de film houden (maar dan zonder de plot te begrijpen).

De oplossing: IDPruner
De auteurs van dit paper, IDPruner, hebben een slimme nieuwe manier bedacht om dit op te lossen. Ze noemen hun methode een "harmonie" tussen belang en verscheidenheid.

Stel je voor dat je een grote groep mensen hebt en je moet er slechts een paar uitkiezen om een team te vormen voor een belangrijke missie.

  • Je wilt mensen die belangrijk zijn (de experts).
  • Maar je wilt ook dat ze verschillend zijn (zodat ze niet allemaal hetzelfde idee hebben en je een breed perspectief hebt).

Vroeger deden mensen dit door eerst de beste experts te kiezen en dan willekeurig nog een paar anderen toe te voegen. Dat werkte niet perfect.

IDPruner gebruikt een slimme truc uit de bibliotheek:
Ze gebruiken een algoritme dat MMR (Maximal Marginal Relevance) heet. Dit is eigenlijk een manier om te zeggen: "Ik kies de persoon die het meest relevant is, maar als die persoon te veel lijkt op iemand die ik al heb gekozen, dan kies ik liever iemand anders, zelfs als die iets minder relevant is."

Het is alsof je een curator bent in een museum:

  • Je wilt de beroemdste schilderijen tonen (de belangrijke tokens).
  • Maar je wilt ook dat de tentoonstelling divers is, zodat je niet alleen maar portretten ziet, maar ook landschappen en abstracte kunst (de verscheidenheid).
  • Als je al drie portretten hebt, en je ziet een vierde portret dat er precies hetzelfde uitziet, dan kies je die niet. Je kiest liever een landschap, zelfs als het landschap iets minder beroemd is, omdat het je collectie completer maakt.

Waarom is dit zo goed?

  1. Het werkt snel: De methode hoeft niet te kijken naar complexe "aandachtskaarten" (een soort interne notities van de computer). Dat maakt het heel snel en compatibel met moderne snelle technologieën (FlashAttention).
  2. Het werkt overal: Of je nu een klein model of een gigantisch model gebruikt, IDPruner werkt altijd goed.
  3. Het resultaat is geweldig: Zelfs als ze 90% van de tokens weggooien (alleen 10% houden), blijft het model nog steeds 86% zo goed als het origineel. Dat is alsof je een hele encyclopedie kunt samenvatten in één pagina, maar je kunt er nog steeds alles uit halen wat je nodig hebt.

Kortom:
IDPruner is de slimme redacteur die weet precies welke stukjes van een foto je moet houden om het verhaal te begrijpen, zonder de computer te laten verdrinken in een zee van onnodige details. Het balanceert perfect tussen "wat is belangrijk?" en "wat is anders?", zodat de AI sneller en slimmer wordt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →