← Nieuwste papers
🤖 machine learning

Clustering and Token Denoising for Faster and More Robust VLMs

Het artikel introduceert ClustRS, een algoritme dat zonder training combineert van aandacht-gewogen clustering en residu-krimpende denoisings, wat het aantal visuele tokens met wel 97% vermindert terwijl de robuustheid tegen beeldruis wordt verbeterd en de prestaties op VLM-benchmarks zoals ScienceQA-IMG en MM-VET gelijk worden gehouden of verbeterd.

Oorspronkelijke auteurs: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

Gepubliceerd 2026-08-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Baptiste Rossigneux, Inna Kucher, Vincent Lorrain, Emmanuel Casseau

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een computer voor die een foto kan zien en vervolgens vragen daarover kan beantwoorden, een scène kan beschrijven of een puzzel kan oplossen op basis van wat hij ziet. Dit is de belofte van moderne visuele-taalmodellen, een type kunstmatige intelligentie dat het vermogen om afbeeldingen te begrijpen combineert met het vermogen om mensachtige tekst te genereren. Om deze systemen te laten werken, moeten ze een afbeelding eerst vertalen naar een lange lijst digitale bouwstenen, genaamd tokens, die het brein van de computer vervolgens verwerkt om een antwoord te vormen. Hoe gedetailleerder de afbeelding, hoe langer deze lijst wordt. Hoewel dit zorgt voor een grote nauwkeurigheid, creëert het een enorme flessenhals: het verwerken van honderden van deze tokens vereist enorme rekenkracht, waardoor het moeilijk is om deze slimme systemen te draaien op kleinere apparaten zoals smartphones of drones. Onderzoekers zoeken al lang naar manieren om deze lijst in te korten, door de onnodige delen te verwijderen terwijl de belangrijke delen behouden blijven, maar bestaande methoden hebben vaak moeite wanneer de afbeeldingen imperfect of ruizig zijn, wat is hoe de meeste echte foto's eruitzien.

Een team van onderzoekers heeft een nieuwe, lichtgewicht methode ontwikkeld om dit probleem op te lossen zonder de complexe AI-modellen vanaf nul opnieuw te hoeven trainen. Hun aanpak, die ze ClustRS noemen, werkt als een zeer efficiënte editor voor de lijst met beeldtokens. In plaats van simpelweg de meest voor de hand liggende delen van een afbeelding te kiezen of te proberen een grote variëteit aan onderdelen te behouden, groepeert hun systeem eerst vergelijkbare stukken informatie samen. Vervolgens selecteert het slechts één vertegenwoordiger uit elke groep, waardoor de uiteindelijke lijst de verschillende ideeën in de afbeelding dekt zonder zichzelf te herhalen. Cruciaal is dat dit groepproces is ontworpen om de visuele "statische ruis" of ruis te negeren die echte foto's vaak teisteren, zoals korreligheid of onscherpte, waardoor het systeem niet wordt misleid door gecorrumpeerde gegevens.

Na het selecteren van de beste vertegenwoordigers, past de methode een tweede, verfijnende stap toe. Het neemt de gekozen tokens en vlakt de ruis binnen hen voorzichtig uit, door de gemiddelde kenmerken van hun groep te gebruiken om eventuele fouten te corrigeren. Dit proces is volledig automatisch en vereist geen extra training, wat betekent dat het direct kan worden toegepast op bestaande modellen. De onderzoekers testten deze techniek op standaard benchmarks die meten hoe goed deze modellen kunnen redeneren over afbeeldingen, inclus\nuit taken die vragen om het beschrijven van complexe scènes of het beantwoorden van wetenschappelijke vragen. Ze ontdekten dat hun methode eerdere technieken aanzienlijk overtrof, vooral wanneer de afbeeldingen zwaar werden verstoord door ruis of wanneer het aantal toegestane tokens drastisch werd verminderd. In de meest extreme tests, waarbij het systeem werd gedwongen om met slechts zestien tokens te werken in plaats van de gebruikelijke honderden, behield hun methode een hoge nauwkeurigheid terwijl anderen faalden, wat bewees dat een slimmere manier van selecteren en schoonmaken van informatie waardevoller is dan simpelweg meer data hebben.

Het succes van deze aanpak benadrukt een verschuiving in hoe we efficiënte kunstmatige intelligentie zouden kunnen bouwen. In plaats van te proberen de modellen groter of complexer te maken om moeilijke omstandigheden aan te kunnen, lieten de onderzoekers zien dat een eenvoudige, tweestaps-methode van groeperen en schoonmaken bestaande systemen veel robuuster kan maken. Hun bevindingen suggereren dat voor deze modellen echt bruikbaar te zijn in de echte wereld, waar afbeeldingen zelden perfect zijn en rekenkracht vaak beperkt is, de focus moet liggen op de kwaliteit en veerkracht van de verwerkte informatie, en niet alleen op de kwantiteit. Door aan te tonen dat deze verbeteringen kunnen worden bereikt zonder de zware kosten van hertraining, opent hun werk de deur naar het inzetten van krachtige visuele intelligentie op een veel breder scala aan alledaagse apparaten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →