← Nieuwste papers
🤖 AI

DUET-VLM: Dual stage Unified Efficient Token reduction for VLM Training and Inference

Het paper introduceert DUET-VLM, een plug-and-play dubbelstadium-compressieframework dat visuele tokens efficiënt vermindert tijdens training en inferentie voor Vision-Language Models, waardoor tot 93,4% minder tokens worden gebruikt met behoud van of zelfs verbeterde nauwkeurigheid ten opzichte van bestaande methoden.

Oorspronkelijke auteurs: Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

Gepubliceerd 2026-03-30
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Aditya Kumar Singh, Hitesh Kandala, Pratik Prabhanjan Brahma, Zicheng Liu, Emad Barsoum

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een zeer slimme robot hebt die foto's en video's kan bekijken en erover kan praten. Dit is een Vision-Language Model (VLM). Maar hier is het probleem: voor elke foto die deze robot ziet, moet hij duizenden kleine stukjes informatie (we noemen ze "tokens") verwerken.

Het is alsof je een foto van 10 megapixels probeert te beschrijven door elk individueel pixel apart te benoemen. Dat kost enorm veel tijd, energie en rekenkracht. De robot wordt snel moe en traag.

De auteurs van dit papier hebben een slimme oplossing bedacht, genaamd DUET-VLM. Laten we dit uitleggen met een paar creatieve vergelijkingen.

Het Probleem: De Overvolle Koffer

Stel je voor dat je op reis gaat en je moet een foto van een drukke markt in je koffer doen.

  • De oude manier: Je plakt elke stalletje, elke persoon en elke vogel op een apart stukje papier en stopt ze allemaal in de koffer. De koffer is zwaar, je kunt er nauwelijks mee lopen, en je vindt je spullen niet meer terug.
  • De huidige "snelle" manieren: Sommige mensen gooien halverwege de reis willekeurig stukjes papier weg om de koffer lichter te maken. Het nadeel? Soms gooien ze net het stukje weg waarop de sleutel van de auto staat, en dan kun je niet meer wegrijden.

De Oplossing: DUET-VLM (De Twee-Staps Reis)

DUET-VLM doet het anders. Het gebruikt een twee-traps strategie om de koffer lichter te maken zonder de belangrijke dingen kwijt te raken.

Stap 1: De "Samenvatting" (In de camera zelf)

Voordat de foto de koffer in gaat, kijkt de camera zelf eerst goed naar de foto.

  • Wat gebeurt er? De camera zegt: "Oké, deze 500 kleine stukjes papier vormen allemaal hetzelfde rode stalletje. Laten we die samenvoegen tot één stevig, duidelijk kaartje."
  • De analogie: In plaats van 500 losse post-it's over een rood stalletje, maak je er één mooie, samengevatte tekening van. Je houdt de essentie (het is een rood stalletje) maar gooit de dubbele informatie weg.
  • Resultaat: De foto is al veel lichter voordat hij de koffer in gaat.

Stap 2: De "Slimme Verwijderaar" (In de hersenen van de robot)

Nu de foto in de koffer zit, gaat de robot (de taalmodel) erover nadenken. Stel de vraag is: "Wat staat er op het shirt van de speler?"

  • Wat gebeurt er? De robot kijkt naar de tekst van de vraag. Hij zegt: "Ah, ik moet kijken naar de speler en zijn shirt. Die stukjes papier over de bomen op de achtergrond? Die heb ik niet nodig."
  • De analogie: De robot pakt de koffer en gooit alleen de stukjes papier weg die niet te maken hebben met de vraag. Hij gebruikt de vraag als een magneet om alleen de belangrijke stukjes vast te houden.
  • Resultaat: De koffer is nu nog lichter, maar bevat precies wat er nodig is om de vraag te beantwoorden.

Waarom is dit zo cool?

De onderzoekers hebben dit getest op verschillende modellen (zoals LLaVA en Video-LLaVA) en de resultaten zijn verbazingwekkend:

  1. Je gooit bijna alles weg, maar verliest niets: Ze konden tot 89% van de stukjes papier (tokens) weggooien. Dat is alsof je een koffer van 100 kilo verandert in een koffer van 11 kilo, maar je kunt er nog steeds precies hetzelfde mee doen. De robot blijft bijna even slim als voorheen (99% van de originele nauwkeurigheid).
  2. Snelheid: Omdat de koffer zo licht is, kan de robot veel sneller reizen. Het trainen van deze robots gaat 31% sneller.
  3. Video's: Het werkt zelfs voor video's! Bij video's is de hoeveelheid informatie enorm groot. DUET-VLM kon hier zelfs beter presteren dan de originele modellen, terwijl ze de helft minder informatie verwerkten.

Conclusie in één zin

DUET-VLM is als een slimme reisassistent die eerst samenvattingen maakt van je foto's en daarna alleen de relevante stukjes meeneemt op basis van wat je vraagt, zodat je robot sneller, slimmer en lichter wordt zonder zijn geheugen te verliezen.

Het bewijst dat je niet per se een zwaardere, duurdere computer nodig hebt om slim te zijn; je moet gewoon slimmer omgaan met de informatie die je al hebt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →