← Nieuwste papers
🤖 machine learning

HyperQuant: A Rate-Distortion-Optimal Quantization Pipeline for Large Language and Diffusion Models

HyperQuant is een verenigde post-training kwantisatiepijplijn die de Randomized Hadamard Transform, optimale roosterkwantisatie, Rice-codering en biascorrectie combineert om rate-distortion-optimale compressie te bereiken voor zowel gewichten als KV-caches in grote taal- en diffusiemodellen, waarbij het bestaande methoden overtroeft bij diverse bit-rates terwijl het een bijna verliesvrije kwaliteit behoudt.

Oorspronkelijke auteurs: Yuval Domb, Hadar Sackstein, Tomer Solberg

Gepubliceerd 2026-06-23
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yuval Domb, Hadar Sackstein, Tomer Solberg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ongelooflijk gedetailleerde bibliotheek aan boeken hebt (een Large Language Model of een video-generator). Deze boeken bevatten miljarden woorden en afbeeldingen, die zoveel ruimte innemen dat ze net passen op de harde schijf van je computer. Wanneer je de computer vraagt om een zin te lezen of een video te genereren, moet hij deze zware boeken constant heen en weer slepen, wat traag en uitputtend is voor de machine.

HyperQuant is een nieuw, slim systeem dat ontworpen is om deze boeken tot een fractie van hun omvang te verkleinen zonder het verhaal te verliezen, waardoor ze sneller te lezen en gemakkelijker op te slaan zijn.

Hier is hoe het werkt, uitgelegd in eenvoudige stappen met alledaagse analogieën:

1. De "Schud"-truc (Randomized Hadamard Transform)

Stel je een rommelige stapel papier voor waarbij sommige pagina's enorm groot en zwaar zijn, terwijl andere slechts kleine snippers zijn. Als je probeert deze in een doos te pakken, steken de grote pagina's eruit en verspillen ze ruimte.
HyperQuant begint door de pagina's te husselen (shufflen). Het mengt de data zodat er in plaats van een paar gigantische uitschieters en veel kleine stukjes, een gelijkmatige verdeling ontstaat (zoals een perfecte klokvormige curve). Dit maakt de data veel gemakkelijker efficiënt te verpakken, net zoals het schudden van een kaartspel het makkelijker maakt om de kaarten gelijkmatig te verdelen.

2. De "Perfecte Verpakking" (Lattice Quantization)

Zodra de data is gehusseld, moet HyperQuant de continue getallen omzetten naar discrete "stippen" die opgeslagen kunnen worden.

  • De oude manier: Stel je voor dat je bollen in een doos probeert te pakken met een simpel rooster (zoals een schaakbord). Er is veel verspilde lege ruimte tussen de bollen.
  • De manier van HyperQuant: Het gebruikt mathematische "roosters" (zoals de E8 of D4 vormen). Denk aan dit als de meest efficiënte manier om sinaasappels in een krat te stapelen. Ze passen zo nauw tegen elkaar aan dat er bijna geen verspilde ruimte is. Hierdoor kan het systeem dezelfde hoeveelheid informatie opslaan met veel minder bits.

3. De "Ritssluiting" (Entropy Coding & Rice Codes)

Zelfs met een perfecte verpakking heb je nog steeds een lange lijst met getallen om op te schrijven.

  • De oude manier: Je schrijft elk getal met evenveel ruimte op, zelfs als sommige getallen heel vaak voorkomen en andere zelden.
  • De manier van HyperQuant: Het gebruikt een variabele lengte code (Rice coding). Denk hierbij aan een geheime taal waarbij veelvoorkomende woorden zeer korte codes krijgen (zoals "u" voor "jou") en zeldzame woorden langere codes. Omdat het systeem weet welke getallen het vaakst voorkomen, comprimeert het de data nog verder, zonder de betekenis te verliezen.

4. De "Ruisonderdrukking" (Bias Correction for KV Cache)

Wanneer een model zich eerdere woorden herinnert (de "KV cache"), moet het zeer precies zijn. Als je getallen te grof afrondt, kan het model in de war raken en onzin gaan hallucineren.
HyperQuant gebruikt een truc genaamd "subtractive dither". Stel je voor dat je een vloeistof probeert te meten, maar je beker is een beetje wiebelig. In plaats van alleen maar te gokken, voeg je een klein, willekeurig beetje water toe, meet het, en trekt dat exacte willekeurige bedrag later weer af. Dit heft de fout perfect op, waardoor het eindresultaat ongebiast en nauwkeurig blijft, zelfs wanneer de data zwaar gecomprimeerd is.

5. De "Magische Doos" (Hardware Integration)

Ten slotte is Hyperquant ontworpen om direct samen te werken met moderne computerchips (zoals NVIDIA's H100 en Blackwell GPU's). Het comprimeert de data niet alleen; het formatteert het zodat de chip het direct kan lezen zonder het eerst te hoeven uitpakken.

  • Het resultaat: Het bleek dat het gebruik van 8-bit integers (standaard gehele getallen) eigenlijk beter werkt dan 8-bit floating points (decimale getallen) voor dit specifieke type gecomprimeerde data. Het is alsof je beseft dat voor deze specifieke puzzel, hele getallen beter in de gleuf passen dan decimalen.

De Grote Winsten

Het artikel beweert dat HyperQuant het volgende bereikt:

  • Massale Compressie: Het verkleint het "geheugen" (weights) van het model met ongeveer 4 keer en het "werkgeheugen" (KV cache) met ongeveer 3,8 keer.
  • Geen Kwaliteitsverlies: Ondanks dat het de data zo sterk heeft verkleind, begrijpt en genereert het model tekst of video bijna net zo goed als de originele, ongecomprimeerde versie.
  • Succes met Video: Het heeft succesvol een video-generatiemodel met 19 miljard parameters (LTX-2) gecomprimeerd zonder zichtbare glitches in de video.
  • De Concurrentie Verslaan: Het presteert beter dan eerdere topmethoden (zoals HIGGS, TurboQuant en OCTOPUS) in bijna alle tests, vooral wanneer men probeert de data extreem ver te verkleinen (zoals naar 1,7 bits per getal).

Kortom, HyperQuant is een nieuw "verpakkingsalgoritme" dat AI-modellen husselt, stapelt en dichtritst, zodat ze in je broekzak passen zonder het verhaal te breken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →