← Nieuwste papers
💻 computer science

MMTok: Multimodal Coverage Maximization for Efficient Inference of VLMs

Deze paper introduceert MMTok, een efficiënt inferentiemethode voor Vision-Language Models die door het maximaliseren van multimodale dekking zowel visuele als tekstuele tokens gebruikt om redundante visuele tokens te selecteren, waardoor de snelheid aanzienlijk wordt verhoogd zonder de prestaties significant te verlagen.

Oorspronkelijke auteurs: Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian

Gepubliceerd 2026-03-04
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Sixun Dong, Juhua Hu, Mian Zhang, Ming Yin, Yanjie Fu, Qi Qian

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Titel: MMTok: De Slimme Boekhouder voor Visuele AI

Stel je voor dat een Vision-Language Model (een slimme AI die zowel plaatjes als tekst begrijpt) als een grote, enthousiaste kok is. Deze kok moet een gerecht (een antwoord) berekenen op basis van een recept (de vraag) en een grote berg verse ingrediënten (het plaatje).

Het probleem? De kok krijgt vaak te veel ingrediënten.
Stel je voor dat je de kok vraagt: "Wat zie je op deze foto van een hond?" In plaats van de hond te bekijken, krijgt de kok 2.880 kleine stukjes van de foto gepresenteerd. Dat is alsof je een hele koe in stukjes snijdt en die aan de kok geeft, terwijl je alleen naar de hond wilt kijken. De keuken (de computer) raakt dan vol, het bereiden duurt te lang en de kok raakt in de war door alle overbodige stukken vlees.

Dit is het probleem dat het artikel MMTok oplost.

Het Oude Probleem: Alleen Kijken of Alleen Luisteren

Tot nu toe hadden andere methoden om deze "te veel ingrediënten" te verminderen twee manieren:

  1. Alleen kijken: Ze keken alleen naar het plaatje en probeerden de meest interessante stukjes te vinden. Maar ze luisterden niet naar de vraag.
  2. Alleen luisteren: Ze keken alleen naar de tekst (de vraag) en probeerden te raden welke stukjes van het plaatje daarbij hoorden.

Dit werkt niet goed. Als de vraag "Wat is de hond aan het doen?" is, moet de AI weten waar de hond is (visueel) én wat er gevraagd wordt (tekst). Als je alleen naar het plaatje kijkt, mis je de context. Kijk je alleen naar de tekst, dan mis je de details van het plaatje.

De Oplossing: MMTok (De Slimme Boekhouder)

MMTok is als een slimme boekhouder die twee lijsten tegelijkertijd bijhoudt om te beslissen welke ingrediënten echt nodig zijn:

  1. De "Luister-lijst" (Tekst naar Beeld): De boekhouder kijkt naar de vraag ("Wat doet de hond?") en zoekt in de berg ingrediënten naar de stukjes die het meest lijken op dat woord. Hij houdt vast aan de stukjes die het woord "hond" of "lopen" het beste vertegenwoordigen.
  2. De "Kijk-lijst" (Beeld naar Beeld): Tegelijkertijd kijkt de boekhouder naar de hele berg ingrediënten. Hij zorgt ervoor dat hij niet alleen naar de hond kijkt, maar ook naar de achtergrond, de kleuren en de vorm van het plaatje. Hij wil zeker weten dat het plaatje als geheel nog herkenbaar blijft, zelfs als hij 90% van de stukjes weggooit.

Het Magische Moment:
MMTok combineert deze twee lijsten. Hij kiest alleen die stukjes die twee dingen doen:

  • Ze beantwoorden de vraag (bijv. de hond).
  • Ze houden het plaatje compleet (bijv. de achtergrond of de kleur van de hond).

Door dit te doen, kan de AI van 2.880 stukjes (token's) terug naar bijvoorbeeld 64 stukjes, zonder dat de kwaliteit van het antwoord daalt. Het is alsof je van een hele koe alleen het stukje vlees en de kruiden pakt die je echt nodig hebt voor het gerecht, en de rest weggooit.

Waarom is dit zo cool?

  • Snelheid: Omdat de AI minder "ingrediënten" hoeft te verwerken, gaat het bereiden van het antwoord 1,87 keer sneller.
  • Kwaliteit: Zelfs met heel weinig stukjes (slechts 4 van de originele 2.880!), blijft de AI nog steeds 87% zo slim als voorheen.
  • Geen extra training: De kok hoeft niet opnieuw te leren koken. MMTok werkt direct op bestaande modellen, zonder dat je jarenlang moet trainen.

Samenvattend

Stel je voor dat je een film kijkt. Normaal zou je elke seconde van de film moeten bekijken om het verhaal te begrijpen. MMTok is als een slimme regisseur die zegt: "Wees gerust, we hoeven niet elke seconde te zien. Laten we alleen de scènes houden waar de actie gebeurt én die belangrijk zijn voor het verhaal."

Het resultaat? Je ziet dezelfde film, maar je hebt er de helft minder tijd voor nodig en je bent niet overbelast door onbelangrijke beelden. MMTok maakt AI sneller, slimmer en efficiënter door de juiste balans te vinden tussen wat we zien en wat we vragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →