← Nieuwste papers
🤖 machine learning

RDQ: Residual Distribution Quantization for Large Language Models

Dit artikel introduceert RDQ, een post-training kwantiseringsframework dat de superlineaire accumulatie van kwantiseringsruis in grote taalmodellen vermindert door middel van Cascaded Error Compensation om per-kanaal schalen aan te passen aan gedrifte residu-distributies, waardoor het een state-of-the-art perplexiteit bereikt bij 3-bit en 4-bit precisie met nul inferentie-overhead.

Oorspronkelijke auteurs: Prateek Singh

Gepubliceerd 2026-07-14
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Prateek Singh

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een geheime boodschap probeert te sturen door een lange, kronkelende tunnel die bestaat uit 32 verbonden kamers. In de originele, hoogwaardige versie van deze tunnel (genaamd FP16), reist je boodschap perfect helder van begin tot eind. Maar wanneer we proberen de boodschap te verkleinen om in een piepklein, gecomprimeerd formaat te passen (kwantisatie) om ruimte te besparen op je telefoon of edge-apparaat, gaat er iets mis.

Lama tijd dachten wetenschappers dat het probleem simpelweg was dat elke kamer op zichzelf een beetje rommelig was. Ze dachten: "Als we maar Kamer 1 schoonmaken, dan Kamer 2, dan Kamer 3, dan komt alles wel goed." Maar deze nieuwe paper, RDQ (Residual Distribution Quantization), heeft ontdekt dat deze "elke kamer afzonderlijk schoonmaken"-aanpak eigenlijk de verkeerde manier van denken is.

De echte schuldige: Het "sneeuwbal"-effect

De auteurs ontdekten dat het echte probleem een sneeuwbal-effect is. Elke keer dat een boodschap door een kamer gaat, wordt er een klein beetje "ruis" of statische elektriciteit aan toegevoegd. In een normale tunnel maakt dit niet uit. Maar in een gecomprimeerde tunnel verdwijnt die kleine hoeveelheid ruis niet; deze wordt meegenomen naar de volgende kamer, waar het zich mengt met nieuwe ruis uit die kamer.

Tegen de tijd dat de boodschap de 32e kamer bereikt, is die kleine hoeveelheid statische elektriciteit veranderd in een enorme storm. De auteurs maten deze "ruisaccumulatie" (ze noemen dit residual stream drift) en ontdekten iets verbazingwekkends: de hoeveelheid ruis voorspelt perfect hoe slecht de boodschap klinkt. Sterker nog, ze vonden een correlatie die zo sterk is (Pearson r=0.999) dat als je weet hoeveel het signaal is afgedreven, je precies kunt voorspellen hoe in de war de computer zal raken.

De grote ontdekking: De tunnel is niet glad

Voordat deze paper verscheen, namen de meeste experts aan dat de ruis in deze tunnels leek op een gladde, voorspelbare heuvel (een "Gaussiaanse" distributie). Ze bouwden hun schoonmaaktools op basis van die gladde heuvel.

Maar de auteurs gingen naar binnen en namen een kijkje. Ze ontdekten dat 84% van de kamers in het LLaMA-3-8B model helemaal geen gladde heuvels hebben! In plaats daarvan is de ruis grillig, vreemd en soms met twee pieken (bimodaal). Het is alsoast verwachten dat je een kalm meer aantreft, om vervolgens een onstuimige oceaan met plotselinge golven te vinden. Omdat de ruis zo vreemd is, faalden de oude "gladde heuvel"-schoonmaaktools jammerlijk, vooral wanneer ze probeerden de boodschap te verkleinen naar slechts 3 bits (een zeer kleine omvang).

De oplossing: "Cascaded Error Compensation" (CEC)

Dus, hoe lossen we een tunnel op waarbij de ruis verandert naarmate je dieper gaat? De auteurs stellen een nieuwe methode voor genaamd Cascaded Error Compensation (CEC).

In plaats van elke kamer schoon te maken terwijl men doet alsover de boodschap nog vers en schoon is (wat oude methoden deden), zegt CEC: "Laten we eerst door de tunnel lopen, precies zien hoe de boodschap eruitziet wanneer deze in elke kamer aankomt, en dan pas schoonmaken."

Zo werkt het:

  1. De rondgang: De computer draait een testboodschap door de tunnel. Hij laat de eerste paar kamers "vies" worden (gekwantiseerd), precies zoals ze dat in het echte leven zouden doen.
  2. De echte look: Wanneer de boodschap bij Kamer 10 aankomt, is deze al een beetje ruizig door de kamers 1 tot en met 9. Het systeem legt dit werkelijke, rommelige signaal vast.
  3. De op maat gemaakte fix: In plaats van een generieke schoonmaaktool te gebruiken, bouwt het systeem een specifieke schoonmaaktool voor dat rommelige signaal. Het past het "volume" (schalen) van de boodschap daar in de kamer aan.
  4. De magische vouw: Zodra de schoonmaaktool is gebouwd, wordt deze in het deurkozijn van de kamer gevouwen (de RMSNorm-gewichten). Dit betekent dat wanneer de echte boodschap later door de tunnel reist, het schoonmaken automatisch gebeurt, met nul extra tijd of snelheidsverlies.

De resultaten: Een enorme verbetering

Het team heeft dit getest op drie beroemde AI-modellen: LLaMA-3-8B, Qwen-2.5-7B en Mistral-7B.

  • De oude manier: Wanneer ze probeerden LLaMA-3-8B te verkleinen naar 3 bits met de standaardmethode (RTN), werd de boodschap bijna onverstaanbaar, waarbij de score (Perplexity) steeg van 5.83 naar 14.09. Dat is een enorme daling in kwaliteit.
  • De RDQ-manier: Met hun nieuwe "rondgang"-methode kregen ze de score omlaag naar 7.55. Dat is een verbetering van 46,4% ten opzichte van de oude methode!
  • Bij 4 bits: Ze behaalden ook de beste resultaten ooit geregistreerd, waarbij ze de vorige kampioenen met een ruime marge versloegen (bijv. 5.62 vs 6.92 voor LLaMA).

Wat dit betekent

De auteurs zijn zeer duidelijk: dit is niet zomaar een beter hulpmiddel; het is een nieuwe manier om naar het probleem te kijken. Ze bewezen dat de "drift" de belangrijkste reden is waarom deze modellen falen bij lage bit-breedtes. Ze lieten ook zien dat het oude idee van "elke kamer onafhankelijk schoonmaken" een doodlopende weg is, omdat het de sneeuwbal van ruis uit de vorige kamers negeert.

Hoewel ze het probleem voor 2-bit compressie nog niet kunnen oplossen (de ruis is daar simpelweg te sterk), hebben ze aangetoond dat we voor 3-bit en 4-bit compressie de modellen slim en snel kunnen houden. Het beste deel? Deze nieuwe methode werkt met de standaardtools die ingenieurs al gebruiken, waardoor het direct kan worden ingezet op telefoons en computers zonder dat er speciale, trage hardware voor nodig is.

Kortom: de tunnel werd rommelig omdat we de kamers in de verkeerde volgorde schoonmaakten. Door ze schoon te maken in de volgorde waarin de boodschap daadwerkelijk door de tunnel reist, kunnen we het signaal helemaal tot aan het einde helder houden.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →