← Nieuwste papers
🤖 machine learning

Jacobian-guided Noise Injection for Quantization Robustness in Large Language Models

Dit artikel stelt Jacobian-Guided Noise Injection voor, een trainingsstrategie die ruis injecteert met een variantie afgeleid van de Frobeniusnorm van de Jacobian van de softmax-operator om de gevoeligheid voor kwantiseringsfouten te onderdrukken, waardoor de robuustheid en prestaties van Large Language Models in low-bit kwantisatie-instellingen aanzienlijk worden verbeterd.

Oorspronkelijke auteurs: Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

Gepubliceerd 2026-08-24
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Deepanshu Pandey, Arnav Chavan, Nahush Lele, Sankalp Dayal, Deepak Gupta

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Moderne kunstmatige intelligentie heeft een punt bereikt waarop haar krachtigste creaties, bekend als grote taalmodellen, poëzie kunnen schrijven, complexe problemen kunnen oplossen en gesprekken kunnen voeren die opmerkelijk menselijk aanvoelen. Toch brengen deze digitale geesten een hoge prijs met zich mee: ze vereisen enorme hoeveelheden computergeheugen en energie om te draaien. Om deze modellen bruikbaar te maken op alledaagse apparaten zoals smartphones of laptops, zoeken ingenieurs al lang naar een manier om ze te verkleinen zonder ze kapot te maken. De standaardoplossing is een proces genaamd kwantisatie, dat de getallen binnen het model vereenvoudigt. Stel je voor dat je een foto met een hoge resolutie comprimeert tot een kleiner bestand; je verliest wat detail, maar de afbeelding blijft herkenbaar. In de wereld van kunstmatige intelligentie betekent dit het omzetten van de interne getallen van het model van een precies, zwaar formaat naar een lichter, grover formaat. Deze reductie kan de omvang van het model met vier keer verkleinen en het drie keer sneller maken, wat potentieel mogelijk maakt dat een brein ter grootte van een supercomputer op een mobiele chip past.

Deze compressie is echter niet zonder risico. Wanneer de getallen te grof worden, kan het model beginnen te struikelen, vooral in de delen van zijn brein die verantwoordelijk zijn voor het begrijpen van context en relaties. De onderzoekers achter deze studie richtten zich op een specifieke flessenhals in deze modellen: een mechanisme genaamd zelf-aandacht (self-attention), dat het model helpt beslissen welke woorden in een zin het belangrijkst zijn voor elkaar. Binnen dit mechanisme fungeert een wiskundige stap genaamd softmax als een poortwachter, die ruwe scores omzet in waarschijnlijkheden. Het team ontdekte dat deze poortwachter ongelooflijk fragiel is. Wanneer de getallen die naar hem toe stromen door compressie licht vervormd raken, kan de poortwachter overreageren, waardoor kleine fouten worden uitvergroot tot enorme fouten die de output van het model verruïneren. Deze gevoeligheid is bijzonder gevaarlijk wanneer het model ongepaste of extreme waarden tegenkomt, wat het hele systeem doet afwijken van het beoogde gedrag.

Om dit op te lossen, ontwikkelden de onderzoekers een nieuwe trainingsstrategie die werkt als een zachte, gerichte stresstest voor het model. In plaats van te proberen het model perfect te dwingen, introduceerden ze opzettelijk kleine, willekeurige fluctuaties in de getallen vlak voordat ze de fragiele softmax-poort bereikten. De cruciale innovatie was hoe ze de omvang van deze fluctuaties bepaalden. In plaats van een vaste hoeveelheid ruis voor elk deel van het model te gebruiken, berekenden ze een maatstaf voor gevoeligheid voor elke specifieke locatie. Als een deel van het model zeer gevoelig was voor fouten, injecteerden de onderzoekers een grotere dosis ruis om het te trainen om robuuster te zijn. Als een deel al stabiel was, injecteerden ze er zeer weinig. Deze aanpak, die zij Jacobian-gestuurde ruisinjectie noemen, leert het model stabiel te blijven, zelfs wanneer de interne getallen iets uit balans zijn. Het is vergelijkbaar met hoe een zeiler kan oefenen varen in ruwe golven om te leren hoe hij de boot stabiel houdt, in plaats van alleen te oefenen in kalm water.

De resultaten van deze methode waren opmerkelijk. Wanneer de onderzoekers hun aanpak testten op verschillende state-of-the-art taalmodellen, behielden de modellen die deze specifieke training ondergingen veel van hun intelligentie, zelfs nadat ze zwaar gecomprimeerd waren. In sommige gevallen verbeterde de methode de relatieve perplexiteit met wel 40% op WikiText voor taalmodellen in instellingen met een laag aantal bits. Voor visiemodellen, specifiek bij het gebruik van de RepQViT-methode op de SigLIP-architectuur, leverde de aanpak relatieve winsten op van tot wel 37% in Top-1 nauwkeurigheid bij dezelfde bitbreedte. Cruciaal is dat deze training de modellen niet slechter maakte wanneer ze in hun oorspronkelijke, ongecomprimeerde vorm draalden. De modellen leerden robuust te zijn zonder hun basisprestaties op te offeren, en de techniek vereiste geen extra rekenkracht wanneer de modellen daadwerkelijk werden gebruikt.

Door zich te richten op het specifieke wiskundige gedrag van het aandachtsmechanisme van het model, hebben de onderzoekers een manier gevonden om deze krachtige instrumenten praktischer te maken voor echt gebruik. Hun werk suggereert dat door precies te begrijpen waar een model kwetsbaar is, ingenieurs een precieze, adaptieve training kunnen toepassen om het te harden tegen de onvermijdelijke imperfecties van het draaien op beperkte hardware. Dit maakt modellen niet alleen kleiner; het maakt ze betrouwbaar genoeg om te worden ingezet in omgevingen waar geheugen en energie schaars zijn, waardoor de mogelijkheden van geavanceerde kunstmatige intelligentie dichter bij alledaagse apparaten worden gebracht zonder de noodzaak van enorme datacentra.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →