← Nieuwste papers
🤖 machine learning

ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization

ReRound is een kalibratievrije post-training kwantisatiemethode die een conditioneel diffusiemodel gebruikt om ambiguïteiten in het afronden van het middelpunt bij low-bit LLM-gewichten op te lossen, waarbij het consequent standaardtechnieken voor 3-bit en 4-bit kwantisatie overtreft terwijl de offline efficiëntie behouden blijft.

Oorspronkelijke auteurs: He-Yen Hsieh, H. T. Kung

Gepubliceerd 2026-08-12
📖 7 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: He-Yen Hsieh, H. T. Kung

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een gigantische, ongelooflijk gedetailleerde bibliotheek aan kennis probeert te verkleinen zodat deze in een piepkleine, draagbare rugzak past. Dit is de wereld van Large Language Models (LLM's), de superintelligente AI-hersenen die verhalen kunnen schrijven, wiskundige problemen kunnen oplossen en kunnen chatten als mensen. Deze hersenen zijn gemaakt van miljarden kleine getallen die "weights" (gewichten) worden genoemd. Om ze snel en goedkoop te laten draaien op gewone telefoons of laptops, proberen wetenschappers deze getallen in kleinere dozen te persen. Dit proces wordt kwantisatie genoemd.

Beschouw de originele, volledige getallen als foto's met een hoge resolutie. Om ruimte te besparen, willen we deze omzetten in pixel art met een lage resolutie. De standaardmanier om dit te doen, heet "Round-to-Nearest" (RTN) (afronden naar de dichtstbijzijnde waarde). Het is alsof je naar een getal kijkt en vraagt: "Ligt dit dichter bij 1 of bij 2?" Als het 1,4 is, rond je af naar beneden naar 1. Als het 1,6 is, rond je af naar boven naar 2. Het is een eenvoudige, automatische regel. Maar er is een lastig punt: wat als het getal precies 1,5 is? Of heel dicht bij 1,5 ligt, zoals 1,48? Op dit "middelpunt" is de beslissing dubbelzinnig. Naar beneden of naar boven afronden creëert bijna dezelfde hoeveelheid fout, dus de eenvoudige regel kiest er maar willekeurig één. In een enorme bibliotheek van miljarden getallen kan het maken van duizenden van deze kleine, willekeurige gokken per ongeluk de betekenis van het hele boek veranderen, waardoor de AI dommer wordt.

Dit is waar een nieuwe methode genaamd ReRound om de hoek komt kijken. In plaats van blindelings te gokken bij deze lastige middendoorpunten, werkt ReRound als een detective die naar de omliggende buurt van getallen kijkt om de beste keuze te bepalen. Het gebruikt een speciaal soort AI-training genaamd een "diffusiemodel" (dezelfde technologie die wordt gebruikt om afbeeldingen te genereren vanuit tekst) om de verborgen patronen te leren van hoe getallen in de hersenen van de AI zijn gerangschikt. Wanneer het een getal ziet dat vastzit op een middelpunt, vraagt het: "Op basis van het gezelschap dat dit getal houdt, zou het dan echt naar beneden moeten worden afgerond, of hoort het naar boven?" Door deze geleerde patronen te gebruiken om de afronding te sturen, kan ReRound de fouten van de standaardmethode herstellen zonder de hele AI opnieuw te hoeven trainen of nieuwe voorbeelden te hoeven voeren. Het is een slimme manier om meer nauwkeurigheid uit een kleinere rugzak te halen, waardoor krachtige AI toegankelijk wordt voor iedereen zonder dat daar dure supercomputers voor nodig zijn.

De Gids van de Detective voor Betere AI

In de wereld van kunstmatige intelligentie botst de zoektocht naar kleinere en snellere modellen vaak op een muur: het "middelpuntprobleem". Wanneer wetenschappers proberen de enorme getallen binnen een AI te verkleinen (een proces dat kwantisatie wordt genoemd), gebruiken ze meestal een eenvoudige regel: als een getal dichter bij de vloer ligt, rond dan naar beneden af; als het dichter bij het plafond ligt, rond dan naar boven af. Maar wat gebeurt er als een getal precies in het midden van de kamer staat? Standaardregels werpen dan gewoon een muntje op. Het paper ReRound: Reconstructive Rounding to Resolve Midpoint Ambiguity in Calibration-Free LLM Quantization betoogt dat dit muntje opgooien een gemiste kans is.

De auteurs, He-Yen Hsieh en H. T. Kung van Harvard University, stellen een nieuwe strategie voor genaamd ReRound. In plaats van getallen nabij het midden blindelings af te ronden, gebruikt ReRound een "diffusie-prior" — een geleerde gok over hoe de originele, perfecte getallen eruit zagen voordat ze werden verkleind. Stel je voor dat je een wazige, gepixelde foto van een kat hebt. Een standaard afrondingsregel zou de kleur van een wazige pixel misschien baseren op de directe buren. ReRound gebruikt echter een getrainde AI (specifiek een U-Net diffusiemodel) om te "hallucineren" of te reconstrueren hoe de gehele patch van de foto eruit zou moeten zien, gebaseerd op de patronen die het heeft geleerd van de originele, hoogwaardige afbeelding.

Zo werkt de magie, stap voor stap:

  1. De Trainingsfase: Voordat de AI zelfs wordt verkleind, neemt ReRound een blik op de volledige, hoog-precieze gewichten van het model. Het hakt deze gewichten in kleine 64x64 patches en traint een diffusiemodel om de originele, volledige patch te voorspellen door alleen naar een low-bit, wazige versie ervan te kijken. Zie dit als het leren aan een detective om de textuur van een specifieke stof te herkennen door slechts een klein, wazig stukje te voelen.
  2. De Reconstructie: Wanneer het tijd is om het model te verkleinen, rondt ReRound niet alleen de getallen af. Het haalt de wazige, low-bit getallen door zijn getrainde detective (het diffusiemodel) om een "gereconstrueerde" versie van de gewichten te genereren. Dit is niet het definitieve gewicht; het is een gids. Het is alsof de detective zegt: "Ik weet dat deze wazige pixel nabij een middelpunt ligt, maar op basis van het patroon van de hele patch, zou deze eigenlijk iets hoger moeten zijn."
  3. De Slimme Afronding: ReRound gebruikt het advies van deze detective alleen wanneer de standaardregel echt in de war is (nabij het middelpunt). Als het getal duidelijk dicht bij de vloer of het plafond ligt, houdt het zich aan de standaardregel. Maar als het getal wankelt nabij het midden, controleert ReRound de gereconstrueerde waarde. Als de reconstructie suggereert om de andere kant op af te ronden, en de "afstand" tot het middelpunt niet te groot is, schakelt ReRound de knop om.
  4. De Veiligheidscontrole: Om er zeker van te zijn dat het niet te veel schakelaars omzet en het model beschadigt, genereert ReRound een paar verschillende versies van het verkleinde model, elk met een iets andere "tolerantie" voor hoeveel het de detective vertrouwt. Het kiest vervolgens de winnaar door te kijken naar het "skelet" van de matrix (de singuliere waarden). Het kiest de versie die de belangrijkste structurele patronen van het originele, volledige model het meest intact houdt.

De resultaten zijn indrukwekkend, vooral voor kleinere AI-modellen. Het paper laat zien dat ReRound consequent beter presteert dan de standaard "Round-to-Nearest"-methode wanneer modellen wordt gecomprimeerd naar 3-bit en 4-bit precisie. Bijvoorbeeld, op modellen zoals Gemma 2 2B en Gemma 3 1B verbeterde ReRound de nauwkeurigheid met 0,1 tot 1,3 punten over diverse taaltaken. In sommige gevallen presteerde het zelfs beter dan methoden die "kalibratiedata" vereisen (het voeren van duizenden voorbeeldzinnen aan de AI om te leren hoe het moet afronden), terwijl ReRound geen enkele extra data gebruikte. Het werkte volledig offline, gebruikmakend van alleen de eigen gewichten van het model.

De auteurs merken er voorzichtig bij op dat dit geen wondermiddel is voor elk enkel probleem. De methode werkt het best wanneer de kwantisatieparameters (zoals de schaal en het nulpunt) al vaststaan. Het vereist ook het trainen van een apart diffusiemodel voor elke specifieke AI, wat tijd en rekenkracht vooraf kost (ongeveer 2 tot 3 uur training en een paar uur inferentie per model). Echter, zodeweg het is voltooid, is het daadwerkelijke proces van het verkleinen van het model snel en duurt het slechts seconden tot minuten.

Cruciaal is dat ReRound de manier waarop de AI op je telefoon of laptop draait niet verandert. Het verandert alleen de uiteindelijke gehele getallen die in het geheugen worden opgeslagen. Dit betekent dat de AI net zo snel draait als voorheen, maar met een beetje meer hersenkracht behouden. Het paper suggereert dat deze aanpak van het gebruiken van "gereconstrueerde gewichten" als gids voor afronding een nieuwe standaard kan worden voor het kleiner en slimmer maken van AI, wat bewijst dat soms de beste manier om een beslissing te nemen niet is om het getal in isolatie te bekijken, maar om de buurt te vragen wat zij ervan vindt.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →