← Nieuwste papers
💻 computer science

Elastic ViTs from Pretrained Models without Retraining

Dit artikel introduceert SnapViT, een methode voor gestructureerde pruning na de pretraining die zonder hertraining gebruikmaakt van gradiëntinformatie en een evolutionair algoritme om cross-netwerkcorrelaties te benaderen, waardoor gepretrainde Vision Transformers een elastische inferentie kunnen bereiken over een continuüm van rekenbudgetten zonder dat er gelabelde data vereist is.

Oorspronkelijke auteurs: Walter Simoncini, Michael Dorkenwald, Tijmen Blankevoort, Cees G. M. Snoek, Yuki M. Asano

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Walter Simoncini, Michael Dorkenwald, Tijmen Blankevoort, Cees G. M. Snoek, Yuki M. Asano

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ongelooflijk slimme bibliotheek hebt (een Vision Transformer of "ViT") die bijna alles in een afbeelding kan herkennen. Deze bibliotheek is zo groot dat hij een heel gebouw inneemt en een gigantische, dure generator nodig heeft om te draaien.

Het probleem? De meeste real-world apparaten (zoals je telefoon, een drone of een slimme camera) zijn klein en hebben een beperkte batterij. Ze kunnen de hele bibliotheek niet huisvesten, en ze kunnen de elektriciteit niet betalen om hem te draaien.

Normaal gesproken, als je een kleinere bibliotheek wilt, moet je een nieuwe, kleinere bibliotheek vanaf nul opbouwen. Maar de auteurs van dit paper, SnapViT, zeggen: "Waarom bouwen we er een nieuwe? Laten we de grote bibliotheek gewoon direct verkleinen tot de grootte die je ook maar nodig hebt, zonder haar slimheid te verliezen."

Zo hebben ze het gedaan, eenvoudig uitgelegd:

1. Het Probleem: Eén maat past niet iedereen

Beschouw deze AI-modellen als een set Russische matroesjka-poppen. Normaal gesproken krijg je slechts een paar specifieke maten: Klein, Medium en Groot. Als je apparaat iets kleiner nodig heeft dan "Medium" maar groter dan "Klein", heb je pech. Je moet ofwel de enorme, trage versie gebruiken, of een piekleine, domme versie.

2. De Oplossing: "Snap" naar elke maat

De auteurs hebben een methode ontwikknu die SnapViT wordt genoemd. Het is also als een magische schaar waarmee je de grote bibliotheek naar elke gewenste maat kunt knippen (10% kleiner, 50% kleiner, enz.) in één enkele "snap".

  • Geen hertraining: Normaal gesproken, als je een stuk van een machine afknipt, stopt deze met werken en moet hij urenlang of dagenlang worden gerepareerd (hertraind). SnapViT knipt het model en het werkt onmiddellijk. Geen reparatie nodig.
  • Geen labels nodig: De meeste methoden hebben een leraar nodig die hen vertelt wat belangrijk is (zoals het laten zien van duizenden foto's van katten en honden aan de AI). SnapViT is zelflerend; het ontdekt zelf wat het moet behouden door simpelweg patronen in de data zelf te bekijken.

3. Hoe het werkt: De "Slimme Schaar"

Om te weten welke delen van de AI ze moeten knippen en welke ze moeten behouden, gebruiken de auteurs een tweestaps-scoreingsysteem:

  • Stap 1: De Lokale Check (De "Pijn"-test)
    Stel je voor dat je de AI met een stokje prikt. Als het prikken in een specifiek deel ervoor zorgt dat de AI struikelt, is dat deel belangrijk. Als de AI niet reageert, is dat deel waarschijnlijk nutteloos. Ze gebruiken een "self-supervised" truc (het bekijken van dezelfde afbeelding vanuit verschillende hoeken) om te zien welke delen van het brein gevoelig zijn. Dit geeft hen een basislijst van wat er geknipt kan worden.

  • Stap 2: De Globale Check (De "Teamwerk"-test)
    Dit is het slimme gedeelte. Soms lijkt een onderdeel op zichzelf misschien nutteloos, maar is het in werkelijkheid een cruciale teamgenoot van een ander onderdeel. Als je er één wegknipt, raakt de ander in de war.
    Om deze verborgen teams te vinden, gebruiken ze een Genetisch Algoritme (denk aan een digitale evolutie-simulator). In plaats van elke enkele verbinding te berekenen (wat eeuwig zou duren), simuleren ze "wat als we dit knippen?" en "wat als we dat knippen?" duizenden keren in slechts een paar minuten. Ze laten een kaart evolueren van hoe verschillende delen van de AI op elkaar vertrouwen.

4. Het Resultaat: Elastische Inferentie

Zodra ze deze kaart hebben, kunnen ze een "continuüm" van modellen genereren.

  • Heb je een model nodig voor een supersnelle drone? SnapViT geeft je een piepkleine versie.
  • Heb je een model nodig voor een krachtige server? SnapViT geeft je een grotere versie.
  • Heb je iets ertussenin nodig? SnapViT geeft je dat ook.

Ze hebben dit getest op verschillende beroemde AI-modellen (zoals DINO en SigLIPv2). Ze ontdekten dat ze het model met 40% konden inkrimpen (waardoor het bijna de helft kleiner is) en dat het nog steeds bijna net zo goed werkte als het origineel, met vrijwel geen verlies aan nauwheid.

5. Waarom het snel is

De auteurs beweren dat ze dit hele proces in minder dan vijf minuten kunnen doen op een enkele krachtige computerchip (een A100 GPU). Dat is ongelooflijk snel vergeleken met andere methoden die dagen kunnen duren.

Samenvattende Analogie

Stel je een enorme instructiehandleiding van 100 pagina's voor voor het bouwen van een huis.

  • De oude manier: Als je maar tijd hebt om 50 pagina's te lezen, moet je de hele handleiding vanaf nul herschrijven om een 50-pagina's tellende versie te maken die nog steeds logisch is.
  • De SnapViT-manier: Je markeert direct de 50 belangrijkste pagina's. Je scheurt de rest eruit. De resterende 50 pagina's vertellen je nog steeds precies hoe je het huis perfect bouwt, en je deed dit in vijf minuten zonder een nieuwe architect nodig te hebben.

Deze methode stelt iedereen in staat om een massieve, krachtige AI te nemen en deze onmiddellijk te verkleinen zodat hij past bij hun specifieke behoeften, wat tijd, geld en energie bespaart, zonder dat de AI opnieuw getraind hoeft te worden of een leraar nodig heeft om het te laten zien.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →