← Nieuwste papers
🤖 machine learning

MergeOver: Post-Training Token Merging for Recursive Vision Transformers

MergeOver is een post-training methode die Token Merging integreert in recursief gewichtsgedeelde Vision Transformers om het geheugengebruik en de latentie op edge-apparaten aanzienlijk te verminderen terwijl de hoge nauwkeurigheid behouden blijft, alles zonder dat kostbare hertraining vereist is.

Oorspronkelijke auteurs: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

Gepubliceerd 2026-08-14
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Junseo Kim, Uraz Odyurt, Amirreza Yousefzadeh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een super slimme robot probeert te leren om katten, honden en auto's te herkennen door alleen naar foto's te kijken. Om dit te doen, gebruikt de robot een speciaal soort brein dat een "Vision Transformer" wordt genoemd. Denk aan dit brein als een team van kleine detectives, waarbij elke afzonderlijke pixel in een foto zijn eigen detective krijgt. Hoe meer pixels er zijn, hoe meer detectives je nodig hebt, en hoe meer ze met elkaar moeten praten om te achterhalen wat ze zien. Dit is geweldig voor de nauwkeurigheid, maar het is een enorm probleem voor kleine computers, zoals die in je smartwatch of een Raspberry Pi, omdat ze niet genoeg geheugen of batterijkracht hebben om duizenden tegelijk pratende detectives te verwerken.

Om dit op te lossen, hebben wetenschappers twee belangrijke trucs geprobeerd. De eerste is "recursive weight-sharing", wat lijkt op het hebben van één superdetective die steeds hetzelfde werk doet, door hun aantekeningen herhaaldelijk te gebruiken in plaats van voor elke stap een nieuw team in te huren. Dit bespaart ruimte, maar maakt het werk van de detective trager en zwaarder. De tweede truc is "token merging", waarbij je beseft dat sommige detectives naar hetzelfde kijken, dus voeg je hen samen tot één grote detective om tijd te besparen. De grote vraag waar dit artikel een antwoord op zoekt, is: wat gebeurt er als je beide trucs tegelijkert u gebruikt zonder de hele robot vanaf nul opnieuw te hoeven trainen? Het is alsof je een enkele detective probeert te leren hoe hij met zijn klonen moet samensmelten terwijl hij al aan het werk is, zonder de kaart te verstoren die hij volgt.

De auteurs van dit artikel, Junseo Kim en zijn team van de Universiteit van Twente, zeggen dat het proberen te mengen van deze twee methoden meestal een ramp is omdat de regels van het spel worden gebroken. Ze stellen een nieuwe methode voor genaamd MergeOver om dit puzzelstukje op te lossen. Stel je voor dat het brein van de robot een gebouw met meerdere verdiepingen is waar de detectives naar boven bewegen. Elke keer als ze naar een nieuwe verdieping gaan, vereist de architectuur van het gebouw dat ze in een perfect vierkant raster staan. Maar het samenvoegen van detectives verstoort meestal dit vierkante raster, waardoor er lege plekken ontstaan die de lift breken. MergeOver introduceert een slimme "Unmerge"-truc: het splitst de samengevoegde detectives tijdelijk weer terug in hun oorspronkelijke roosterposities, net lang genoeg om door de lift te komen, en voegt hen dan weer samen zodra ze veilig op de volgende verdieping zijn. Hierdoor kan de robot zijn geheugengebruik laag houden zonder dat hij opnieuw getraind hoeft te worden.

Het team heeft dit getest op een beroemde afbeeldingendataset genaamd ImageNet-1K, met behulp van verschillende soorten computers, van krachtige grafische kaarten tot een piepkleine Raspberry Pi 5. Ze ontdekten dat MergeOver werkt, maar dat de resultaten sterk afhangen van hoeveel foto's je de robot tegelijk laat bekijken (de "batch size"). Wanneer de robot slechts één foto tegelijk bekijkt, zorgt het extra werk van het samenvoegen en ontbinden er eigenlijk voor dat het proces vertraagt. Echter, wanneer de robot 16 foto's tegelijk bekijkt, gebeurt de magie. Op een krachtige GPU verminderde deze opstelling het benodigde geheugen met 38,4% en maakte het de robot zelfs 21,7% sneller. Op de kleine Raspberry Pi maakte het de robot 17,6% sneller voor batches van 16. Het beste van alles is dat de robot niet veel dommer werd; de nauwkeurigheid daalde slechts met 1,47 procentpunt, wat de auteurs een kleine prijs vinden voor een zulke grote snelheidswinst.

De auteurs merken echter voorzichtig op dat dit geen toverstaf is die alles direct oplost. De auteurs beargumenteren expliciet tegen het idee dat je dit zomaar op elk model kunt plakken en verwachten dat het overal perfect werkt. Ze ontdekten dat voor taken met een enkele afbeelding (batch size 1), de methode de boel op krachtige computers juist vertraagt omdat de overhead van de "Unmerge"-truc de moeite niet waard is voor slechts één afbeelding. Ze wijzen er ook op dat hoewel hun methode veel geheugen bespaart en de verwerking van batches versnelt, het niet noodzakelijkerwijs alle andere soorten efficiënte AI-modellen verslaat die vanaf de grond af aan zijn ontworpen om snel te zijn. De resultaten zijn gemeten en realistisch, maar ze suggereren dat dit een veelbelovend startpunt is — een "baseline" — voor het combineren van deze technieken, in plaats van een definitieve, perfecte oplossing. De auteurs suggereren dat toekomstig werk MergeOver mogelijk moet combineren met andere trucs, zoals betere software-optimalisatie, om het nog sneller te maken, vooral voor die taken met een enkele afbeelding op kleine apparaten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →