← Nieuwste papers
🤖 AI

CIVIC: End-to-End Sequence Compactness for Efficient Vision-Language Models

CIVIC is een end-to-end framework dat echte hardware-efficiëntie bereikt in Vision-Language-modellen door een aaneengesloten, compact visueel pad te behouden over alle inferentiestadia, waardoor het geheugengebruik en de latentie aanzienlijk worden verminderd zonder de nauwkeurigheid te compromitteren.

Oorspronkelijke auteurs: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

Gepubliceerd 2026-05-28
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Fengze Yang, Bo Yu, Xuewen Luo, Cathy Liu, Chenxi Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een complex tafereel uit een film aan een vriend uit te leggen.

Het probleem: de vriend die "te veel beschrijft"
Huidige AI-modellen (zogenaamde Vision-Language Models) zijn als vrienden die elk afzonderlijk pixel van een filmbeeld beschrijven. Als de film een 4K-resolutie heeft, proberen ze misschien wel 1.000 kleine details (tokens) te beschrijven voor slechts één seconde video. Hoewel dit gedetailleerd is, is het vermoeiend. De AI moet alle 1.000 details in zijn korte-termijngeheugen (de "KV-cache") onthouden terwijl hij probeert een verhaal te schrijven. Dit maakt de AI traag, geheugenhongerig en duur om te draaien, vooral op kleinere apparaten.

De oude oplossing: de "bewerkknop"-fout
Eerdere pogingen om dit op te lossen, waren als eerst de volledige 1.000-woordenbeschrijving schrijven en vervolgens een redacteur inhuren om de saaie delen na afloop door te halen.

  • De fout: Hoewel de redacteur woorden doorhaalde, moest de AI ze eerst opschrijven, meedragen en vervolgens verwijderen. Het is alsof je een zware rugzak vol met stenen draagt, om pas op de finishlijn de helft ervan weg te laten vallen. Je bent toch moe geworden van het dragen van het gewicht, en het "bewerkings"-proces zelf kostte extra tijd.

De nieuwe oplossing: CIVIC (de "slimme samenvatter")
Het artikel introduceert CIVIC, een nieuwe manier om na te denken over hoe AI ziet en spreekt. In plaats van de volledige beschrijving te schrijven en deze vervolgens te bewerken, leert CIVIC de AI slechts de belangrijke delen vanaf het allereerste begin te schrijven.

Zo werkt CIVIC, met behulp van eenvoudige analogieën:

  1. Het "anker"-systeem (slimme groepering):
    Stel je voor dat je naar een drukke kamer kijkt. In plaats van het gezicht van elke persoon op te sommen, kiest CIVIC een paar "ankers" (zoals het centrum van een groep vrienden) en zegt: "Deze hele groep vertegenwoordigt één idee." Het groepeert vergelijkbare visuele details samen voordat de AI ze zelfs maar begint te verwerken. Dit verandert een rommelige menigte van 1.000 items in een nette lijst van 400 kernpunten.

  2. Het "continue pad" (geen omwegen):
    De meeste andere methoden zijn als een estafettewedstrijd waarbij de loper de stok doorgeeft, stopt om hem opnieuw te verpakken, en vervolgens weer rent. CIVIC is een rechte baan. Het houdt de "compacte" (verkorte) lijst met informatie de hele weg vast, van de camera, door de projector, tot in het brein van de AI. Het schakelt nooit terug naar de "zware" versie. Dit betekent dat de AI geen energie verspillen hoeft aan het wisselen van modi of het opnieuw organiseren van gegevens.

  3. De "geheugenbespaarder" (KV-Cache):
    Omdat de AI slechts 400 kernpunten hoeft te onthouden in plaats van 1.000, krimpt zijn korte-termijngeheugen (de KV-cache) drastisch. Het artikel vond dat CIVIC slechts ongeveer een derde van de geheugenruimte gebruikt in vergelijking met de standaardmethode. Het is alsof je overgaat van het dragen van een zware koffer naar het dragen van een kleine rugzak.

  4. De "leraar-leerling"-les (training):
    Om ervoor te zorgen dat de AI niet in de war raakt door minder details, gebruikten de onderzoekers een "tekst-georiënteerde" leermethode. Stel je een leraar voor (de grote, trage AI) die een leerling (de nieuwe, snelle AI) laat zien hoe je een afbeelding beschrijft. De leraar zegt niet alleen "wees korter"; ze zeggen: "Beschrijf de betekenis van de afbeelding met minder woorden, maar zorg ervoor dat je het verhaal nog steeds goed krijgt." Dit zorgt ervoor dat de AI zijn vermogen om fijne details te begrijpen niet verliest, zoals waar een object zich in een afbeelding bevindt.

De resultaten
Toen de onderzoekers dit testten op een model genaamd Qwen3-VL:

  • Snelheid: De AI voltooide zijn taak veel sneller (dalend van ~3,5 seconde naar ~2,5 seconde).
  • Geheugen: Het gebruikte aanzienlijk minder geheugen (dalend van ~122 MB naar ~44 MB).
  • Nauwkeurigheid: Ondanks dat het sneller en kleiner was, werd het niet "dommer". Het beantwoordde nog steeds complexe vragen en lokaliseerde objecten in afbeeldingen even goed als de trage, zware versie.

Samenvattend
CIVIC voorkomt dat de AI onnodig werk doet. In plaats van een enorme hoeveelheid gegevens te genereren en deze vervolgens te proberen te verkorten, leert het om vanaf het begin een compacte, efficiënte samenvatting te genereren. Dit maakt AI sneller, goedkoper om te draaien en klaar voor gebruik in de echte wereld, zonder zijn intelligentie te verliezen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →