← Nieuwste papers
💻 computer science

FTerViT: Fully Ternary Vision Transformer

Dit artikel introduceert FTerViT, een volledig ternair Vision Transformer dat alle gewichten en normalisatieparameters kwantiseert om aanzienlijke geheugencompressie te bereiken en efficiënte implementatie op apparaten op microcontrollers mogelijk te maken, terwijl er een concurrerende ImageNet-1K-accuraatheid wordt behouden.

Oorspronkelijke auteurs: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

Gepubliceerd 2026-05-21
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Szymon Ruciński, Pietro Bonazzi, Engin Türetken, Simon Narduzzi, Michele Magno, Nadim Maamari

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een briljante, hoogopgeleide bibliothecaris (de Vision Transformer of ViT) voor die naar een afbeelding kan kijken en je precies kan vertellen wat het is. Deze bibliothecaris is ongelooflijk slim, maar draagt een enorme bibliotheek van boeken in zijn hoofd. Als je probeert deze bibliothecaris in een tiny rugzak te stoppen (een microcontroller zoals die in een smartwatch of een goedkope camera), scheurt de rugzak open omdat de boeken te zwaar zijn en te veel ruimte innemen.

Meestal proberen ingenieurs, om een slimme AI in een klein apparaat te passen, de boeken te verkleinen. Ze zetten de tekst misschien om in een kortere code, maar ze laten vaak de belangrijkste, delicate pagina's (zoals de kaft, de inhoudsopgave en de samenvatting) in hun originele, omvangrijke formaat achter. Het artikel stelt dat dit vergelijkbaar is met het proberen een zware encyclopedie in een zak te proppen door alleen de middelste hoofdstukken te verkleinen; de kaft en de inhoudsopgave wegen nog steeds te veel.

Hier is wat de auteurs van FTerViT deden om dit op te lossen:

1. De "Drie-Kleuren" Woordenlijst

In plaats van complexe getallen (zoals 3,14159...) te gebruiken om informatie op te slaan, dwongen de auteurs de AI om slechts drie simpele symbolen te gebruiken: -1, 0 en +1.

  • Denk hierbij aan een woordenlijst waar elk woord wordt vervangen door een rode, groene of blauwe stip.
  • Door alleen deze drie opties te gebruiken, kunnen ze de informatie ongelooflijk strak inpakken. Het is als het vouwen van een gigantische kaart tot een klein vierkantje.
  • Ze noemen dit Ternair (wat "drie" betekent).

2. De "Kwetsbare" Delen

Eerdere pogingen om deze AI-modellen te verkleinen bleven steken. Ze verkleinden het hoofdherken (de "encoder"), maar lieten de Patch Embedding (hoe de AI de eerste glimp van de afbeelding ziet), de LayerNorm (hoe de AI zijn gedachten in evenwicht brengt) en de Classificator (de uiteindelijke besluitvormer) achter in hun zware, volledige formaat.

  • De auteurs realiseerden zich dat deze overgebleven zware delen op een klein apparaat eigenlijk de meeste ruimte innemen, zelfs al zijn ze klein in aantal.
  • FTerViT is de eerste die alles verkleint, inclusief deze kwetsbare delen, naar het simpele -1, 0, +1-formaat.

3. De "Leraar en Leerling" Truc

Het verkleinen van een gigantisch brein tot een klein brein zorgt er meestal voor dat het vergeet hoe het moet denken, waardoor het domme fouten maakt. Om dit op te lossen, gebruikten de auteurs een techniek genaamd Kennisdistillatie.

  • Stel je een Meesterkok (de originele, zware AI) voor die een Jonge Kok (de kleine, verkleinde AI) leert.
  • In plaats van de Jonge Kok alleen te vertellen "Dit is een kat", laat de Meesterkok zien hoe hij de kat ziet. "Kijk naar de oren, de snorharen, de vorm."
  • De Jonge Kok leert door het denkproces van de Meester na te bootsen, niet alleen het uiteindelijke antwoord. Hierdoor bleef de kleine AI slim, zelfs nadat hij tot zijn absolute kleinste formaat was verkleind.

4. Het Resultaat: Een Slimme AI in een $10 Camera

De auteurs testten dit op een zeer goedkope, veelvoorkomende microcontroller-chip genaamd de ESP32-S3 (te vinden in apparaten die ongeveer $10 kosten).

  • Voorheen: De originele AI was 88,3 MB. Hij was te groot om zelfs maar op de chip te passen.
  • Na: Hun nieuwe FTerViT-model is slechts 5,81 MB. Hij past perfect.
  • Prestaties: Hoewel hij klein is, is hij nog steeds erg slim. Hij identificeert afbeeldingen correct in ongeveer 79,6% van de gevallen. Dit is veel beter dan eerdere pogingen om AI te verkleinen, die vaak daalden tot 74% of lager.

5. Waarom Dit Belangrijk Is voor Je Zak

Het artikel toont aan dat je geen supercomputer nodig hebt om slimme visie uit te voeren. Je kunt het uitvoeren op een apparaat met 8 MB aan geheugen (ongeveer de grootte van een klein tekstbestand).

  • Snelheid: Omdat de data zo klein is, hoeft het apparaat niet zo hard te werken om informatie op te halen. Het werkt sneller en verbruikt minder batterij.
  • Efficiëntie: De auteurs bouwden een aangepaste "motor" (software) die deze kleine AI volledig op de chip uitvoert, zonder dat er verbinding nodig is met het internet of een cloudserver.

Samenvattend: Het artikel introduceert een manier om de meest geavanceerde AI-modellen voor beeldherkenning te verkleinen tot de grootte van een klein steentje, waardoor ze kunnen draaien op goedkope, batterij-aangedreven apparaten die eerder te zwak waren om ze te verwerken. Ze deden dit door de wiskunde te vereenvoudigen tot slechts drie getallen en het gebruik van een "leraar" om het kleine model te leren hoe het correct moet denken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →