← Nieuwste papers
🤖 machine learning

Float8@2bits: Entropy Coding Enables Data-Free Model Compression

Het artikel introduceert EntQuant, een data-vrij post-training compressiekader dat entropiecodering benut om state-of-the-art extreme bit-rate compressie (onder de 4 bits) te bereiken voor grote modellen zoals 70B parameters in minder dan 10 minuten, waarbij het succesvol de snelheid en universaliteit van data-vrije methoden verenigt met de hoge getrouwheid die gewoonlijk kalibratiedata vereist.

Oorspronkelijke auteurs: Patrick Putzky, Martin Genzel, Mattes Mollenhauer, Sebastian Schulze, Thomas Wollmann, Stefan Dietzel

Gepubliceerd 2026-06-01
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Patrick Putzky, Martin Genzel, Mattes Mollenhauer, Sebastian Schulze, Thomas Wollmann, Stefan Dietzel

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, ongelooflijk gedetailleerde bibliotheek met boeken hebt (een Large Language Model). Om deze boeken op een klein apparaat zoals een smartphone te kunnen lezen, moet je ze verkleinen. Meestal zijn er twee manieren om dit te doen:

  1. De "Snel & Slordig" Manier: Je fotocopieert de boeken snel naar piepkleine indexkaarten. Het is snel en vereist geen extra onderzoek, maar als je ze te veel verkleint (onder de 4 bits), worden de woorden wartaal en stort het verhaal in.
  2. De "Langzaam & Perfect" Manier: Je huurt een team van redacteuren in die elke zin zorgvuldig herschrijven, met behulp van een specifieke set referentieboeken om ervoor te zorgen dat de betekenis perfect blijft. Dit werkt geweldig, maar het duurt dagen, vereist veel dure computers en je hebt toegang nodig tot de originele referentieboeken (die vaak niet bestaan of privé zijn).

Maak kennis met EntQuant: Het artikel introduceert een nieuwe methode genaamd EntQuant die fungeert als een soort "magische krimpstraal" die het beste van beide werelden combineert. Het is snel, heeft geen referentieboeken nodig en houdt het verhaal intact, zelfs wanneer het tot een extreme grootte wordt gekrompen.

Zo werkt het, gebruikmakend van eenvoudige analogieën:

1. Het Probleat: De "Vaste Doos" Valstrik

Huidige methoden dwingen de woorden van de bibliotheek in vaste dozen met een bepaalde grootte.

  • Als je ruimte wilt besparen, moet je kleine doosjes gebruiken (lage bits).
  • Maar kleine doosjes kunnen slechts een paar specifieke woorden bevatten. Als de bibliotheek een complexe gedachte wil uitdrukken, loopt het vast omdat de doos te klein is. Dit is waarom huidige methoden falen wanneer ze proberen modellen onder de 4 bits te krimpen; ze raken hun "expressieve kracht" kwijt.

2. De Oplossing: Het "Slimme Archiefsysteem"

EntQuant verandert de regels. In plaats van woorden in kleine doosjes te dwingen, houdt het de woorden in standaard, hoogwaardige dozen (zoals Float8 of Int8), maar organiseert het ze zo slim dat ze bijna geen ruimte innemen.

Denk aan een verhuisdienst voor het inpakken:

  • De Oude Manier: Je moet je meubels in vooraf bepaalde kratten passen. Als je een enorme bank hebt, moet je hem in stukken snijden om in een kleine krat te passen.
  • De EntQuant Manier: Je houdt de meubels heel (hoge precisie), maar je plaatst ze zo compact dat de vrachtwagen bijna leeg is. Je gebruikt een "slim algoritme" om de items zo efficiënt te verpakken dat de vrachtwagen voor 90% uit lucht bestaat, terwijl de items perfect bewaard blijven.

3. Het Geheim: "Entropy Coding"

Het artikel maakt gebruik van een techniek genaamd Entropy Coding (specifiek iets dat ANS wordt genoemd).

  • Stel je voor dat je een geheime code schrijft. Als de letter "E" 50% van de tijd voorkomt, geef je het een zeer korte code (zoals "1"). Als "Z" zelden voorkomt, geef je het een langere code (zoals "11010").
  • EntQuant "traint" het model eerst om bepaalde getallen vaker te gebruiken dan andere (waardoor de data "lage entropie" krijgt).
  • Vervolgens gebruikt het deze slimme codering om de data te comprimeren. Omdat de getallen voorspelbaar zijn, kan de computer ze opslaan met minder dan 2 bits per parameter aan gemiddeld, ook al worden de getallen zelf nog steeds in formaten met een hoge precisie opgeslagen.

4. Waarom dit een Groot Ding is

  • Geen "Kalibratie" Nodig: De meeste hoogwaardige compressiemethoden hebben een "proefrit" nodig met een dataset om het model af te stemmen. EntQuant is data-vrij. Je kunt een model nemen, het in minder dan 10 minuten comprimeren, en het werkt gewoon. Dit is cruciaal voor private of gespecialiseerde modellen waarbij je de trainingsdata niet hebt.
  • Extreme Compressie: Het slaagt erin om enorme modellen (zoals een 70-miljard parameters model) te comprimeren tot een grootte die op een consumenten-grafische kaart past, terwijl het model slim genoeg blijft om complexe instructies op te volgen en wiskundige problemen op te lossen.
  • Snelheid: Hoewel het de data enigszienstins tijdens het lezen (decoderen), laat het artikel zien dat dit op moderne computers zo snel gebeurt dat de vertraging verwaarloosbaar is (ongeveer 1,5 tot 2 keer trager dan het origineel, wat nog steeds erg snel is).

De Kern van het Verhaal

De auteurs, Patrick Putzky en Martin Genzel (en hun team bij Merantix Momentum), hebben een hulpmiddel gecreëerd waarmee je gigantische AI-modellen kunt verkleinen tot de omvang van een kleine koffer zonder hun intelligentie te verliezen, en je kunt dit direct doen zonder dat je extra data nodig hebt. Het is alsoort bij het passen van een 70 voet lange jacht in een rugzak zonder dat deze kapot gaat.

Belangrijkste les: Ze hebben de regel doorbroken die zei dat "om ruimte te besparen, je kwaliteit moet verliezen." Door een slim archiefsysteem (entropy coding) te gebruiken in plaats van simpelweg de data in stukken te hakken, hebben ze de kwaliteit hoog gehouden terwijl ze een extreme omvangvermindering bereikten.

Kernpunt: Ze hebben de regel doorbroken die stelde dat "om ruimte te besparen, je kwaliteit moet verliezen." Door een slim archiefsysteem (entropy coding) te gebruiken in plaats van simpelweg de data in stukken te hakken, hebben ze de kwaliteit hoog gehouden terwijl ze een extreme omvangvermindering bereikten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →