← Nieuwste papers
🤖 machine learning

Theory-optimal Quantization Based on Flatness

Dit artikel introduceert Bidirectionele Diagonale Quantisatie (BDQ), een nieuw post-training quantisatiekader dat een theorie-optimale oplossing afleidt op basis van een nieuwe "Flatness"-metriek om activatie-uitbijters effectief te verspreiden, waardoor state-of-the-art nauwkeurigheid wordt bereikt bij low-bit quantisatie van Large Language Models.

Oorspronkelijke auteurs: Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Xiusheng Huang, Zhe Li, Xuanwu Yin, Lu Wang, Yequan Wang, Dong Li, Emad Barsoum, Kang Liu

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De "Luidruchtige Buur" in een Stille Kamer

Stel je voor dat je een enorme, ongelooflijk gedetailleerde bibliotheek met boeken hebt (een Large Language Model, of LLM). Om deze bibliotheek in een kleine rugzak (je telefoon of een goedkope server) te passen, moet je de boeken verkleinen. Dit proces heet quantisatie.

Meestal zijn de boeken geschreven in hoogwaardige inkt (32-bit of 16-bit precisie). Om ruimte te besparen, wil je ze herschrijven met slechts een paar simpele kleuren (4-bit of zelfs 2-bit).

Het Probleem: De meeste tekst in deze boeken is normaal, maar af en toe staat er een zin in gigantische, neon-rode letters die harder schreeuwt dan alles anders. In het artikel worden deze uitbijters genoemd.

Wanneer je probeert het hele boek te verkleinen om in een kleine ruimte te passen, dwingen de "gigantische neonletters" het hele systeem om uit te rekken om ze te accommoderen. Hierdoor wordt alle normale tekst in een klein, onleesbaar hoekje geplet. Het resultaat? Het boek wordt onbegrijpelijke onzin.

De Oude Oplossingen: Proberen de Kamer te Draaien

Vorige methoden probeerden dit op te lossen door de kamer te draaien of het meubilair te herschikken. Ze draaiden de data rond (met behulp van lineaire transformaties) in de hoop dat de gigantische neonletters zouden opgaan in de normale tekst.

De auteurs van dit artikel keken naar deze methoden en zeiden: "Het werkt niet goed genoeg." Zelfs na het draaien van de kamer zijn de neonletters er nog steeds, alleen op een andere plek. Ze blijven nog steeds alle ruimte inpalmen, waardoor de rest van de data krap zit.

Het Nieuwe Idee: "Vlakheid" en de Equalizer

De auteurs bedachten een nieuwe manier om over het probleem na te denken. In plaats van alleen te proberen de neonletters te verstoppen, wilden ze het landschap vlak maken.

Stel je de data voor als een heuvelachtig terrein. Het grootste deel van het land is vlak, maar er staan een paar enorme bergen (de uitbijters).

  • Het Doel: Je wilt dat het terrein zo vlak mogelijk is (zoals een kalme meer). Dit noemen ze Vlakheid.
  • De Maatstaf: Ze bedachten een wiskundig hulpmiddel om te meten hoe "bultig" de data is. Als de bergen te hoog zijn, is de "Vlakheid"-score slecht. Als het land glad is, is de score goed.

Ze bewezen wiskundig dat de beste manier om dit terrein vlak te maken niet door het te draaien is, maar door het gebruik van een tweezijdig rekapparaat.

De Oplossing: BDQ (Bidirectional Diagonal Quantization)

De auteurs stellen een nieuwe methode voor genaamd BDQ. Hier is hoe het werkt, gebruikmakend van een metafoor:

Stel je voor dat de data een enorm raster is van mensen die in rijen en kolommen staan.

  1. Het Probleem: Een paar mensen in specifieke rijen en kolommen zijn reuzen (uitbijters).
  2. De Oude Manier: Je probeert het hele raster te draaien. De reuzen zijn nog steeds reuzen; ze kijken alleen in een andere richting.
  3. De BDQ-Manier: Je geeft elke persoon in een specifieke rij een paar elastische broeken (een diagonale matrix) en elke persoon in een specifieke kolom een paar elastische schoenen (een andere diagonale matrix).
    • Als een rij een reus heeft, verklein je de broek voor iedereen in die rij.
    • Als een kolom een reus heeft, verklein je de schoenen voor iedereen in die kolom.
    • Het Resultaat: De reuzen worden verkleind tot een normale grootte, en de kleine mensen worden uitgerekt. Plotseling heeft iedereen ongeveer dezelfde lengte. Het "landschap" is vlak.

Omdat de reuzen de ruimte niet langer domineren, kun je nu het hele raster in een kleine rugzak comprimeren zonder belangrijke details te verliezen.

De "Overfitting"-Valstrik: De Student die Leerde

Er was nog één probleem. Toen ze de computer leerden hoe ze deze elastische broeken en schoenen moesten gebruiken, lieten ze hem alleen een klein steekproef van data zien (zoals 128 zinnen).

De computer was als een student die de antwoorden op die 128 specifieke oefenvragen perfect uit het hoofd leerde, maar faalde bij het echte examen omdat hij de algemene regels niet begreep. In technische termen heet dit overfitting.

Om dit op te lossen, voegden de auteurs een speciale regel toe genaamd Recursive Cross-Entropy Loss.

  • Analogie: In plaats van de student alleen te vertellen "Dit is het juiste antwoord", zeggen ze ook: "Kijk naar wat je voorspelde dat goed was, en zorg ervoor dat je vertrouwen overeenkomt met het werkelijke antwoord."
  • Dit dwingt de computer om het algemene patroon te leren van hoe je de data vlak maakt, in plaats van alleen de specifieke oefenzinnen uit het hoofd te leren.

De Resultaten: Een Koffer Perfect Prikken

Het artikel testte deze nieuwe methode op enkele van de slimste AI-modellen ter wereld (zoals LLaMA-3 en DeepSeek).

  • De Test: Ze probeerden de modellen te verkleinen tot extreem kleine maten (met slechts 4 bits voor gewichten en 4 bits voor activeringen, of zelfs 2 bits voor gewichten).
  • Het Resultaat:
    • Vorige methoden maakten de AI "dom" wanneer ze zo klein werden verkleind (de nauwkeurigheid daalde aanzienlijk).
    • BDQ hield de AI bijna net zo slim als de originele volledige versie.
    • In één extreme test (het verkleinen van een model met 70 miljard parameters naar 2-bit gewichten) verkleinde BDQ de prestatiekloof met bijna 40% ten opzichte van de beste bestaande methoden.

Samenvatting

Het artikel beweert dat door wiskundig te bewijzen dat "vlakheid" de sleutel is tot goede compressie, en door een tweezijdig rekapparaat (BDQ) te combineren met een slimmere leerregel (RCE), ze enorme AI-modellen kunnen verkleinen tot kleine maten zonder dat ze hun intelligentie verliezen. Ze hebben een bultig, bergachtig landschap omgetoverd tot een glad, vlak vlak dat makkelijk in een kleine rugzak past.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →