← Nieuwste papers
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

Dit artikel introduceert TOPS, een trainingsvrije en model-agnostische methode voor visuele token-pruning die optimale preservatiesets construeert op basis van taakrelevantie, informatiebedekking en semantische diversiteit om de inferentie-efficiëntie van MLLM's aanzienlijk te verbeteren terwijl de prestaties gelijk blijven of zelfs worden verbeterd.

Oorspronkelijke auteurs: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Gepubliceerd 2026-06-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische bibliotheek vol boeken hebt (de visuele tokens) die een superintelligente robot (het Multimodale Large Language Model) moet lezen om een vraag te beantwoorden. Het probleem is dat de bibliotheek zo enorm is dat de robot overweldigd raakt, er eeuwig over doet om te lezen en al zijn energie verbruikt aan het omslaan van pagina's.

Lange tijd probeerden mensen de robot te helpen door te zeggen: "Sla de saaie pagina's gewoon over!" Maar de oude methoden waren een beetje onhandig:

  • De "Attention"-methode was als een robot die alleen naar pagina's keek met de grootste, dikste lettertypes. Het negeerde vaak belangrijke details omdat ze in kleine letters waren geschreven, of het bleef dezelfde paragraaf vijf keer lezen omdat deze er hetzelfde uitzag.
  • De "Diversity"-methode was als een robot die probeerde pagina's te kiezen die er verschillend uitzagen van elkaar. Het kon een pagina over een kat en een pagina over een auto kiezen, maar het kon per ongeluk de pagina weggooien die daadwerkelijk antwoord geeft op de specifieke vraag van de gebruiker.

Ontmoet TOPS: De Slimme Bibliothecaris

Het artikel introduceert een nieuwe methode genaamd TOPS (Token Optimal Preservation Sets). In plaats van alleen maar te gokken welke pagina's behouden moeten blijven, werkt TOPS als een hoogst georganiseerde, vanuit eerste principes werkende biblicaris die drie specifieke vragen stelt voordat hij beslist wat er in de kast blijft staan:

  1. "Is deze pagina relevant voor de vraag?" (Taakrelevantie)
    • Analogie: Als de gebruiker vraagt: "Welke kleur heeft de auto?", weet de biblicaris onmiddellijk dat hij de pagina met de auto moet houden en de pagina over de lucht moet weggooien.
  2. "Biedt deze pagina nieuw terrein?" (Informatieafdekking)
    • Analogie: Als we al een pagina hebben die beschrijft dat de rode verf van de auto glanst, hebben we geen tweede pagina nodig die precies hetzelfde zegt. We hebben een pagina nodig die ons iets nieuws vertelt, zoals het kenteken van de auto.
  3. "Is deze pagina uniek ten opzichte van de anderen die we hebben gekozen?" (Semantische Diversiteit)
    • Analogie: We willen niet een stapel van vijf pagina's die allemaal zeggen: "De auto is rood." We willen één pagina die zegt "Rood", één die zegt "Snel" en één die zegt "Oud". Dit zorgt ervoor dat we een volledig beeld krijgen zonder herhaling.

Hoe het in de praktijk werkt

Het artikel laat zien dat TOPS geen training nodig heeft (het is "training-free"). Het kan in verschillende robotbreinen (zoals LLaVA, Qwen of InternVL) worden geplaatst en werkt direct.

  • De "Twee-fasen" Schoonmaak: Stel je voor dat de robot een lange video bekijkt.
    • Fase 1: TOPS doet een snelle scan en gooit het overduidelijke afval weg (zoals lege frames of wazige beelden) voordat de robot zelfs maar diep begint na te denken.
    • Fase 2: Terwijl de robot leest, houdt TOPS nauwlettend de conversatie in de gaten. Als de robot over een specifiek detail begint te praten, zorgt TOPS ervoor dat de meest relevante visuele pagina's nog aanwezig zijn, waarbij de selectie wordt verfijnd tot het perfecte niveau voor die specifieke vraag.

De Resultaten: Minder is Meer

Het artikel beweert dat door deze slimme, drievoudige vraagstelling te gebruiken, TOPS tot wel 90% van de visuele pagina's (tokens) kan weggooien en de robot nog steeds net zo goed antwoord geeft als wanneer hij alles had gelezen.

  • Het Magische Cijfer: Op één specifiek model (LLaVA-NeXT) verwijderde TOPS 77,8% van de visuele data, maar verbeterde het de prestaties van de robot zelfs licht (100,6%).
  • Waarom? Het artikel suggereert dat door de robot te dwingen de "opvulling" en redundante pagina's te negeren, hij eigenlijk stopt met in de war raken of feiten verzinnen (hallucinaties). Het is als het opruimen van een rommelig bureau; soms helpt het hebben van minder papieren juist om het juiste document sneller te vinden en helderder na te denken.

Samenvattend

TOPS is een nieuwe manier om AI-modellen sneller en slimmer te maken door een striktere, slimmere editor te zijn. In plaats van alleen de "luidste" of "meest verschillende" visuele aanwijzingen te kiezen, bouwt het een perfecte, compacte set aanwijzingen die relevant zijn voor de vraag, alle noodzakelijke informatie dekken en niet met elkaar herhalen. Het resultaat is een robot die sneller denkt, minder geheugen gebruikt en betere antwoorden geeft.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →