← Nieuwste papers
🤖 machine learning

Low-Rank Ternary Adaptation for Fine-Tuning Transformers

Dit artikel stelt "ternaire multiplicatieve adaptatie" voor, een nieuwe low-rank methode die efficiënte fijnafstemming van ternaire transformers mogelijk maakt door discrete gewichtsupdates te representeren via kleine ternaire matrices, waardoor het ternaire domein behouden blijft en directe fusie zonder dekwantisering mogelijk wordt, terwijl het tegelijkertijd aanzienlijk de prestaties herstelt over taal- en visiemodellen heen.

Oorspronkelijke auteurs: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Gepubliceerd 2026-08-26
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Alexandru-Dragos Manolache, Yunqiang Li, Jan van Gemert

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne kunstmatige intelligentie vertrouwt op enorme computerprogramma's genaamd transformers, die de motor zijn geworden achter alles van schrijfassistenten tot beeldgeneratoren. Deze programma's zijn ongelooflijk krachtig, maar ze zijn ook zwaar; ze vereisen enorme hoeveelheden computergeheugen en energie om te draaien. Om ze bruikbaar te maken op kleinere apparaten zoals telefoons of laptops, hebben onderzoekers jarenlang geprobeerd ze kleiner te maken. Een populaire strategie is het comprimeren van de getallen binnen het programma, waarbij ze worden omgezet van complexe, hoog-precieze waarden naar eenvoudigere, laag-bit versies. Stel je voor dat je een foto met een hoge resolutie neemt en deze terugbrengt naar slechts een paar kleuren; de afbeelding wordt kleiner en sneller te verwerken, hoewel er onvermijdelijk wat detail verloren gaat. De meest agressieve vorm van deze compressie houdt in dat de interne getallen van het programma beperkt worden tot slechts drie mogelijke waarden: negatief één, nul en positief één. Deze aanpak, bekend als ternaire kwantisatie, vermindert de benodigde geheugenruimte met een factor tien, wat een model dat ooit een grote server vereiste, potentieel kan veranderen in iets dat op een standaard laptop kan draaien.

Echter, een aanzienlijk probleem heeft de voortgang van deze ultra-compacte modellen vertraagd. Hoewel de modellen klein en efficiënt zijn, zijn ze moeilijk aan te leren nieuwe taken. Standaardmethoden om deze programma's te onderwijzen omvatten het maken van minuscule, continue aanpassingen aan hun getallen. Maar wanneer een model beperkt is tot slechts drie waarden, kan het geen kleine aanpassingen maken; het kan een getal alleen van negatief naar positief flippen, of het volledig uitschakelen. Bestaande technieken voor het onderwijzen van deze gecomprimeerde modellen vereisen vaak dat de getallen tijdelijk worden uitgebreid naar hun volledige, zware omvang om de veranderingen door te voeren, om ze vervolgens weer samen te persen. Dit proces van uitbreiden en opnieuw comprimeren introduceert fouten die de prestaties van het model verslechteren, waardoor het eindresultaat vaak slechter is dan wanneer er helemaal niets was geleerd.

Een team van onderzoekers van de Delftse Universiteit van Technologie en Amazon heeft een nieuwe manier ontwikkeld om deze ultra-compacte modellen te onderwijzen die dit proces van expansie en fouten vermijdt. In plaats van te proberen kleine, continue getallen aan het model toe te voegen, werkt hun methode direct binnen het strikte drie-waardensysteem. Ze ontwierpen een systeem dat werkt als een reeks schakelaars, waardoor het model het teken van zijn interne getallen kan omdraaien of ze volledig kan uitschakelen, zonder ooit het gecomprimeerde stadium te verlaten. Om dit efficiënt te maken, probeerden ze niet elk getal afzonderlijk aan te passen. In plaats daarvan gebruikten ze een wiskundige structuur waarmee een paar kleine, eenvoudige patronen grote secties van het model tegelijkertijd kunnen aansturen. Deze aanpak, die zij een low-rank ternaire adaptatie noemen, laat het model nieuwe vaardigheden leren terwijl het perfect gecomprimeerd blijft.

De onderzoekers testten deze methode op verschillende soorten kunstmatige intelligentie, waaronder taalmodellen die in staat zijn tot redeneren en visiemodellen die afbeeldingen herkennen. Ze begonnen met modellen die al gecomprimeerd waren tot de drie-waardengrens en pasten vervolgens hun nieuwe onderwijstechniek toe. De resultaten lieten zien dat de modellen veel van de nauwkeurigheid die ze verloren waren tijdens de initiële compressie, herstelden. In tests met taaltaken presteerden de aangepaste modellen aanzienlijk beter dan eerdere pogingen die probeerden het model te dwingen te leren via expansie en hercompressie. Zo verbeterde de nieuwe methode bij een taalmodel met drie miljard parameters de gemiddelde nauwkeurigheid over negen verschillende taken van ongeveer 32 procent naar 38 procent, terwijl het de voorspellingen van het model ook veel zelfverzekerder maakte.

Misschien wel het belangrijkste is dat het eindresultaat van dit proces een enkel, verenigd model is dat in zijn ultra-compacte vorm blijft. In tegen tegenstelling tot andere methoden die een aparte, zware set instructies achterlaten die naast het kleine model geladen moet worden, integreert deze nieuwe aanpak het leren direct in de kleine gewichten. De onderzoekers ontdekten dat hun methode voor visuele taken, zoals het identificeren van objecten in afbeeldingen, een model produceerde dat veel nauwkeuriger was dan die gemaakt door na het leren te hercomprimeren. Ze ontdekten ook dat het leerproces werkte door de tekens van de bestaande getallen te herverdelen, in plaats van te proberen de genulliseerde getallen weer tot leven te wekken. Dit betekent dat het model leert door te reorganiseren wat het al heeft, in plaats van te proberen nieuwe verbindingen te creëren waar die niet bestonden.

Dit werk demonstreert dat het mogelijk is om hoog gecomprimeerde kunstmatige intelligentie-modellen te onderwijzen zonder hun efficiëntie of nauwkeurigheid op te offeren. Door de strikte grenzen van het drie-waardensysteem te respecteren en een manier te vinden om binnen die grenzen te leren, hebben de onderzoekers aangetoond dat deze kleine modellen voor veel taken net zo bekwaam kunnen zijn als hun grotere tegenhangers. De methode vereist geen extra geheugen of rekenkracht tijdens het gebruik, aangezien het leren volledig is geïntegreerd in de structuur van het model. Dit opent de deur naar het draaien van geavanceerde kunstmatige intelligentie op apparaten met zeer beperkte middelen, waardoor krachtige mogelijkheden beschikbaar komen op plaatsen waar dit voorheen onmogelijk te implementeren was.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →