Visual Token Compression Enhances Robustness of MLLMs
Dit artikel stelt een methode voor voor visuele token-pruning die de robuustheid van Multimodale Grote Taalmodellen tegen jailbreak-aanvallen en hallucinaties verbetert door niet-gealigneerde, out-of-distribution visuele tokens te identificeren en te verwijderen, terwijl tegelijkertijd de inferentiekosten worden verminderd.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je een wereld voor waarin computers niet alleen woorden lezen maar ook plaatjes "zien", en deze combineren om vragen te beantwoorden, verhalen te vertellen of problemen op te lossen. Dit zijn Multimodale Large Language Models (MLLM's). Denk aan hen als superintelligente studenten die elk boek in de bibliotheek hebben gelezen en ook naar een foto kunnen kijken om de context te begrijpen. Echter, net als elke student, kunnen ze in de war raken. Soms, als je ze een lastige foto laat zien of een slimme vraag stelt, kunnen ze erdoor in de war worden gebracht om iets gevaarlijks te zeggen (een "jailbreak") of feiten te verzinnen die echt lijken maar volkomen onjuist zijn (een "hallucinatie").
Om te begrijpen waarom dit gebeurt, moeten we kijken naar hoe deze modellen informatie verwerken. Ze nemen een afbeelding, hakken deze in stukjes digitale fragmenten genaamd "visuele tokens", en mengen deze met teksttokens. Het probleem is dat de "ogen" en "oren" van de computer niet altijd perfect dezelfde taal spreken. Soms is een visuele token zo uit de toon of verwarrend dat het werkt als statische ruis in een radiosignaal. Deze ruis kan de balans van het model verstoren, waardoor het kwetsbaar wordt voor aanvallen of door het verzinnen van valse informatie. Wetenschappers weten al lang dat het opschonen van deze ruis helpt, maar ze dachten meestal dat dit alleen ging over het sneller maken van de computer, niet over het veiliger maken ervan.
Dit artikel introduceert een slimme nieuwe truc genaamd Visual Token Compression, specifweg een methode genaamd OOD-VTP (Out-of-Distribution Visual Token Pruning). De onderzoekers ontdekten dat door de "vreemde" visuele tokens te identificeren en te verwijderen—de tokens die niet goed bij de tekst passen—het model eigenlijk veel weerbaarder wordt tegen aanvallen en minder geneigd is te liegen. Het is als een uitsmijter bij een club die de onrustige gasten die er niet thuishoren eruit trapt, waardoor het feest veilig en ordelijk blijft. De studie laat zien dat dit niet alleen een theorie is; toen ze het op zeven verschillende populaire benchmarks testten, werd het model aanzienlijk moeilijker te misleiden en nauwkeuriger, terwijl het ook nog eens sneller draaide.
Het Verhaal van de Lawaaierige Kamer
Stel je voor dat je in een enorme, lawaaierige kamer bent waar een groep vrienden (de tekst) een serieus gesprek probeert te voeren. Plotseling stormt er een bende vreemden (de visuele tokens) binnen. De meeste vreemden zijn behulpzaam; ze brengen snacks mee en wijzen op dingen in de kamer die bij het gesprek passen. Maar een enkeling zijn prankster. Ze dragen maskers, schreeuwen onzin of houden borden vast met teksten die nergens op slaan bij wat je vrienden aan het bespreken zijn.
In de wereld van AI zijn deze pranksters de misalignede visuele tokens. Omdat de visuele en de taalcomponent van de computer niet perfect gesynchroniseerd zijn, fungeren deze tokens als Out-of-Distribution (OOD) inputs. In gewone mensentaal: ze zijn "niet op hun plek". Wanneer de AI probeert deze te verwerken, raakt hij in de war. Deze verwarring is wat hackers in staat stelt om een "jailbreak" uit te voeren (de AI erin te luizen om de veiligheidsregels te negeren) of veroorzaakt dat de AI gaat "hallucineren" (dingen verzinnen die niet waar zijn).
De Strategie van de Uitsmijter
De auteurs van dit artikel realiseerden zich dat eerdere methoden probeerden de AI te versnellen door willekeurige tokens te verwijderen of alleen de tokens die "redundant" leken (zoals de stillere mensen eruit trappen). Maar zij ontdekten dat dit de AI niet veiliger maakte. Sterker nog, soms maakte het de situatie zelfs erger!
Hun nieuwe methode, OOD-VTP, fungeert als een superintelligente uitsmijter. Zo werkt het:
- De Afstand Meten: De uitsmijter controleert elke individuele visuele token (elk stukje van de afbeelding) en vraagt: "Hoe ver staat deze persoon van het gesprek af?" Ze meten de afstand tussen de visuele token en de "taalkundige feature space" (de groep teksttokens).
- De Pranksters Identificeren: De tokens die het verst van de tekst af staan—degenen die totaal niet in de pas lopen—worden gemarkeerd als de OOD-tokens. Dit zijn de tokens die de problemen veroorzaken.
- Het Perfecte Timing: De onderzoekers ontdekten dat je niet zomaar mensen eruit kunt trappen op elk gewenst moment. Er zijn specifieke "robust-pruning layers" (denk aan deze als specifieke momenten in het gesprek) waar het verwijderen van de slechte tokens het beste werkt. Als je ze te vroeg of te laat verwijdert, helpt het niet. Maar als je het op het juiste moment doet (zoals laag 13 of 17 in hun tests), wordt de AI plotseling veel robuuster.
De Resultaten: Veiliger, Slimer en Sneller
Het team heeft deze uitsmijterstrategie getest op twee populaire AI-modellen: LLaVA-OneVision en Qwen-2.5-VL. Ze gebruikten zeven verschillende benchmarks om te zien hoe goed het werkte.
- Jailbreaks Stoppen: Wanneer ze probeerden de AI te misleiden om slechte dingen te doen (zoals uitleggen hoe je een bom maakt of malware injecteert), was de OOD-VTP-methode een groot succes. Gemiddeld verbeterde het de bekwaamheid van het model om "Nee, dat doe ik niet" te zeggen met 13,29%. Voor het Qwen-2.5-VL-model specifiek steeg de "Refuse-to-Answer Rate" (hoe vaak het succesvol een slecht verzoek blokkeerde) van 20,38% naar 33,67%.
- Hallucinaties Stoppen: De methode hielp de AI ook om te stoppen met het verzinnen van zaken. Op de HallusionBench verbeterde de nauwkeurigheid met 8,00% voor het Qwen-model.
- Snelheid: Als bonus draaide de AI sneller omdat ze enkele tokens hadden verwijderd. Het verwerkte minder tokens (daalde van 16.128 naar 10.512) en gebruikte minder rekenkracht (TFlops daalde van 4,29 naar 2,78), waardoor het efficiënter werd zonder aan intelligentie in te boeten.
Wat Ze Niet Hebben Gedaan (en Wat Ze Hebben Uitgesloten)
Het is belangrijk om op te merken wat dit artikel niet heeft gedaan. Ze hebben de AI niet vanaf nul opnieuw getraind. Ze hebben geen nieuwe veiligheidsregels toegevoegd of de gewichten van het "brein" van het model veranderd. Ze hebben simpelweg de slechte visuele tokens weggefilterd (gepruned) tijdens het proces.
Ze hebben ook expliciet de gedachte uitgesloten dat elke vorm van token pruning een AI veiliger maakt. Sterker nog, ze lieten zien dat als je de verkeerde tokens verwijdert—specifiek de tokens die goed uitgelijnd en behulpzaam zijn—de AI juist minder veilig wordt. Ze testten dit door de "kleinste afstand"-tokens (de goede tokens) te verwijderen, waarna de veiligheidsprestatie van het model instortte. Dit bewijst dat het niet alleen gaat om het inkorten van de hoeveelheid; het gaat erom het verwijderen van de specifieke ruis die de problemen veroorzaakt.
De Kernboodschap
Dit artikel suggereert dat de sleutel tot het veiliger maken van Multimodale AI zo eenvoudig kan zijn als het opruimen van de visuele ruis. Door de visuele tokens te identificeren en te verwijderen die niet bij de tekst passen, wordt het model stabieler, minder vatbaar voor misleiding en minder geneigd om feiten te verzinnen. Het is een "plug-and-play"-oplossing, wat betekent dat het aan bestaande modellen kan worden toegevoegd zonder dat er een enorme herstructurering nodig is. Hoewel het artikel laat zien dat deze resultaten gemeten en consistent zijn over meerdere tests, blijft het een methode die de robuustheid versterkt in plaats van een wondermiddel dat elk beveiligingsprobleem in de wereld oplost. Maar voor een nieuwsgierige tiener (of een veiligheidsbewuste AI-ontwikkelaar) is het een fascinerend kijkje in hoe een beetje snoeien een groot verschil kan maken in het veilig houden van onze digitale vrienden.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.