← Nieuwste papers
🤖 AI

OccamToken: Efficient VLM Inference with Training-Free and Budget-Adaptive Token Pruning

OccamToken is een trainingsvrij, budgetadaptief raamwerk dat de inferentie-efficiëntie van Vision-Language-modellen verbetert door kwetsbare absolute tokenrangschikking te vervangen door registerverankerde relatieve bewijstests, waardoor extreme tokencompressie mogelijk wordt (bijvoorbeeld het reduceren van 2.880 tokens tot ongeveer 40) terwijl meer dan 93% van de oorspronkelijke nauwkeurigheid behouden blijft.

Oorspronkelijke auteurs: Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Gepubliceerd 2026-05-29
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Geng Li, Guohao Chen, Ting Chen, Shilin Shan, Kuangji Zuo, Bofan Lyu, Tuo An, Gen Li, Jianfei Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: Te Veel Lawaai in de Keuken

Stel je voor dat je een chef-kok bent (de AI) die een maaltijd probeert te bereiden op basis van een bestelling van een klant (de tekstvraag) en een enorme stapel ingrediënten (de afbeelding).

In moderne AI, wanneer je een afbeelding toont, breekt de computer deze op in duizenden kleine stukjes die "tokens" worden genoemd. Als je een foto met hoge resolutie hebt, is dat alsof je een stapel van 2.880 ingrediënten hebt. De chef moet naar elk enkel stukje kijken voordat hij begint met koken. Dit kost enorm veel tijd en energie (rekenkracht), zelfs als het grootste deel van die ingrediënten slechts achtergrondlawaai is, zoals een stofje op het aanrecht of een wazig stukje lucht.

De Oude Manier: De "Top 10"-Regel

Vroeger probeerden mensen om tijd te besparen, de "minst belangrijke" ingrediënten weg te gooien. Ze gebruikten een regel als: "Behoud de 100 meest interessante ingrediënten en gooi de rest weg."

Het artikel stelt dat deze regel gebroken is om twee redenen:

  1. Het "Schreeuwend Baby"-Effect: Soms krijgt een saai ingrediënt (zoals een kale muur) per ongeluk een zeer luid "belangrijkheidsscore" puur vanwege hoe de computer de berekeningen uitvoert. Dit harde lawaai overschreeuwt de stille, belangrijke ingrediënten (zoals een klein detail in een foto), waardoor de computer denkt dat het saaie spul eigenlijk het belangrijkst is.
  2. Het "Eén Maat Past Allen"-Probleem: Een vaste regel (zoals "houd er 100") werkt niet voor elke foto.
    • Als je vraagt: "Is er een kat?" in een foto van een bos, hoef je maar een paar plekken te controleren. Het behouden van 100 plekken is verspilling.
    • Als je vraagt: "Wat is de textuur van de stof?" in een foto van een trui, moet je misschien veel meer plekken bekijken. Het behouden van slechts 100 kan betekenen dat je het antwoord mist.

De Nieuwe Oplossing: OccamToken

De auteurs hebben een nieuwe methode ontwikkeld die OccamToken heet. In plaats van te vragen: "Welke zijn de top 100?", vragen ze: "Is dit ingrediënt nuttiger dan onze 'Referentiepot'?"

Hier is hoe het werkt, stap voor stap:

1. De "Referentiepot" (De Register Token)

Stel je voor dat je een speciale pot op het aanrecht hebt die een generiek, gemiddeld monster bevat van "alles in de keuken". Het weet niets over specifieke katten of truien; het houdt gewoon de "achtergrondvibe" van de kamer vast.

  • Waarom het helpt: In het oude systeem zou het "Schreeuwend Baby" (het saaie lawaai) alle aandacht stelen. Maar in dit nieuwe systeem absorbeert de "Referentiepot" dat lawaai. Het fungeert als een spons voor de nutteloze, luide signalen.
  • Het Resultaat: Nu kan de computer duidelijk zien welke ingrediënten echt speciaal zijn, omdat het lawaai gedempt is.

2. Fase 1: De "Afbeeldingsopruiming" (Redundantie-Pruning)

Voordat de chef zelfs de bestelling van de klant leest, maakt het keukenpersoneel een snelle sweep.

  • Ze vergelijken elk ingrediënt met de Referentiepot.
  • Als een ingrediënt er precies uitziet als de generieke achtergrond in de pot, wordt het weggegooid.
  • Analogie: Als de foto een drukke straat toont, gooit het personeel de 2.000 tokens weg die slechts "lucht" of "wazig asfalt" zijn, omdat de Referentiepot al weet hoe dat eruit ziet. Ze houden de tokens die er anders uitzien dan de pot (de auto's, de mensen).
  • Voordeel: Dit gebeurt automatisch voor elke afbeelding. Een eenvoudige foto wordt zwaar opgeschoond; een complexe foto wordt minder opgeschoond.

3. Fase 2: De "Klantbestelling"-Controle (Relevantie-Pruning)

Nu leest de chef de specifieke vraag: "Staat de man links?"

  • De chef kijkt naar de overgebleven ingrediënten.
  • Ze vergelijken ze opnieuw met de Referentiepot, maar deze keer vragen ze: "Helpt dit ingrediënt om de specifieke vraag beter te beantwoorden dan de generieke achtergrond?"
  • Analogie: Als de vraag gaat over een man, houdt de chef de tokens vast die de man en de grond waarop hij staat tonen. Als de vraag gaat over een kat in de hoek, houdt de chef die tokens vast en gooit hij de man weg.
  • Voordeel: Het aantal bewaarde ingrediënten verandert op basis van de vraag. Een eenvoudige vraag heeft misschien slechts 10 tokens nodig; een moeilijke vraag misschien 50.

De Resultaten: Minder Werk, Dezelfde Smaak

Het artikel testte dit op verschillende AI-modellen (zoals LLaVA en Qwen).

  • De Claim: Het lukte hen om 98,6% van de ingrediënten weg te gooien (van 2.880 tokens naar ongeveer 40) en toch 93% van de tijd het juiste antwoord te krijgen.
  • De Analogie: Het is alsof je beseft dat je niet elke rijstkorrel in een pan hoeft te proeven om te weten dat het zout is. Je hoeft alleen de juiste lepels te proeven.
  • Geen Training Nodig: Het beste deel is dat ze de chef niet opnieuw hoeven te leren koken. Ze veranderden alleen de regels voor hoe de chef ingrediënten selecteert. Het werkt "out of the box".

Samenvatting

OccamToken is een slim filter dat AI voorkomt tijd te verspillen aan het kijken naar saaie achtergrondlawaai. In plaats van een stijve "houd de top 100"-regel te gebruiken, maakt het gebruik van een "Referentiepot" om uit te zoeken wat er echt nieuw en nuttig is voor de specifieke vraag die wordt gesteld. Dit maakt de AI sneller en goedkoper om te draaien zonder het "dommer" te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →