← Nieuwste papers
💬 NLP

Do All Visual Tokens Matter Equally? Object-Evidence Preserving Token Merging for Vision-Language Retrieval

Het artikel stelt SaMer voor, een object-bewust token-merging framework dat de tokens aan de beeldzijde voor vision-language retrieval aanzienlijk comprimeert door tijdens de training kritieke object-niveau bewijslast te behouden, waardoor opslagkosten worden verminderd en de retrieval-prestaties worden verbeterd zonder dat er tijdens de inferentie grondwaarheid bounding boxes nodig zijn.

Oorspronkelijke auteurs: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Suhyeong Park, Junha Jung, Jungwoo Park, Jaewoo Kang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme bibliotheek met foto's hebt en je wilt de ene foto vinden die "een kat met een hoed" laat zien. In de oude dagen keek de computer naar de hele foto en gaf het een enkele "vibe-score". Maar dat is als het beoordelen van een hele pizza op basis van alleen de geur; je zou de specifieke plak met pepperoni die je begeert kunnen missen.

Moderne AI probeert slimmer te zijn. Het breekt elke foto op in honderden kleine puzzelstukjes (genaamd "tokens") en slaat de details van elk stukje apart op. Wanneer je een vraag stelt, controleert de computer elk enkel puzzelstukje tegen je woorden om de beste match te vinden. Dit is geweldig voor het vinden van specifieke details, maar het is een opslagnachtmerrie. Stel je voor dat je een bibliotheek van 1.000 kleine puzzelstukjes voor elke foto op je telefoon moet meedragen. Het neemt te veel ruimte in beslag en maakt zoeken pijnlijk traag.

Dus vroegen onderzoekers zich af: Doen al die visuele tokens er wel evenveel toe?

Het antwoord is, volgens dit paper, een luid "Nee". Maar hier komt het lastige deel: als je de "saaie" stukjes zomaar weggooit of vergelijkbaar uitziende stukjes samenvoegt, kun je per ongels een "kat"-stukje aan een "hond"-stukje vastlijmen omdat ze allebei vacht hebben. Als je dat doet, kan je computer de specifieke "kat" die je vroeg niet meer vinden. Het is alsoals het mengen van een rode Lego-steen en een blauwe Lego-steen tot paars; nu kun je geen rood kasteel meer bouwen.

De Oplossing: SaMer (Semantic-aware Merging)

De auteurs stellen een nieuwe methode voor genaamd SaMer. Denk aan SaMer als een super slimme bibliothecaris die de puzzelstukjes organiseert voordat je überhaupt een vraag stelt.

  1. De Trainings-truc: Terwijl de computer leert, gebruikt SaMer een geheim spiekbriefje (objectlabels) om te zien waar de werkelijke objecten zich bevinden. Het gebruikt dit om het systeem te leren: "Hé, lijm de oor van de kat niet vast aan de staart van de hond, ook al zien ze er hetzelfde uit!" Het dwingt het systeem om verschillende objecten gescheiden te houden, zelfs wanneer het ze samenvoegt.
  2. De Magische Samenvoeging: In plaats van 93% van de puzzelstukjes weg te gooien, mengt SaMer ze voorzichtig tot 64 super-representatieve "centroids". Dit zijn geen willekeurige gemiddelden; het zijn zorgvuldig vervaardigde samenvattingen die de identiteit van de oorspronkelijke objecten intact houden.
  3. Het Resultaat: Wanneer je vraagt naar "een kat", kan het systeem nog steeds direct naar de "kat"-samenvatting wijzen, waarbij de "hond"-samenvatting wordt genegeerd, ook al zit de "hond"-samenvatting er vlak naast.

De Cijfers (Het Bewijs)

Het paper gokt niet alleen; ze hebben dit getest op echte data. Dit is wat ze vonden:

  • Enorme Ruimtebesparing: Door slechts 64 tokens te gebruiken in plaats van de oorspronkelijke duizenden, hebben ze de opslagruimte die nodig is voor het ColPali-systeem met 16,09× verminderd. Dat is alsof je een bibliotheek van 263,7 GB verkleint naar slechts 16,4 GB.
  • Snelheidsboost: Omdat er minder stukjes vergeleken moeten worden, werd de zoekopdracht veel sneller. Op één dataset steeg de snelheid (Queries Per Second) met 4,3×, en op een andere was het bijna 9,1× sneller.
  • Betere Nauwkeurigheid: Verrassend genoeg maakte het kleiner maken van de bibliotheek het systeem juist beter in het vinden van de juiste foto. Op de Flickr30K-dataset steeg het succespercentage (R@1) van 77,0 naar 82,4. Op MSCOCO steeg het van 47,4 naar 51,6.

Wat Ze Hebben Uitgesloten

De auteurs waren zeer zorgvuldig in het aangeven van wat niet werkt. Ze lieten zien dat het simpelweg weggooien van stukjes (pruning) of het samenvoegen van alles op basis van hoe vergelijkbaar kleuren eruitzien (feature-only pooling) ervoor zorgt dat de computer het overzicht over specifieke objecten verliest. Als je vergelijkbare patches samenvoegt zonder te weten dat ze bij verschillende objecten horen, verlies je het vermogen om ze later te onderscheiden. SaMer suggereert dat de sleutel niet alleen het verminderen van het aantal tokens is, maar het bewaren van het bewijs dat toekomstige vragen nodig hebben om te selecteren.

Hoe Zeker Zijn Ze?

De auteurs hebben dit gemeten op real-world datasets zoals Flickr30K, MSCOCO, ImageCoDe en DocVQA. Ze vonden dat SaMer consequent andere compressiemethoden overtrof. Ze maten ook hoe goed het systeem in staat was om naar het exacte deel van de afbeelding te wijzen dat in de tekst wordt genoemd (grounding). SaMer liet zien dat het de "phrase-level evidence" veel beter behield dan andere methoden, waarbij een "BoxMass"-score (een maatstaf voor hoe goed de relevantie binnen het juiste object blijft) sprong van 41,3 naar 54,2.

De Kern van het Verhaal

Het paper suggereert dat voor AI om afbeeldingen efficiënt te doorzoeken, we niet informatie moeten verwijderen; we moeten het beter organiseren. Door tokens samen te voegen op een manier die de grenzen van objecten respecteert, bewijst SaMer dat je een enorme afbeeldingendatabase met 16 keer kan verkleinen zonder de details te verliezen, en zelfs dingen beter te vinden dan daarvoor. Het is een overwinning voor snelheid, een overwinning voor opslag en een overwinning voor nauwkeurigheid.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →