← Nieuwste papers
💬 NLP

LATMiX: Learnable Affine Transformations for Microscaling Quantization of LLMs

Dit artikel introduceert LATMiX, een methode die leerbare invertibele affiene transformaties toepast om activatiedistributies te optimaliseren voor microscaling (MX)-kwantisatie, waardoor de nauwkeurigheid van low-bit grote taalmodellen aanzienlijk wordt verbeterd ten opzichte van bestaande rotatie- of Hadamard-gebaseerde benaderingen.

Oorspronkelijke auteurs: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

Gepubliceerd 2026-04-27
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Ofir Gordon, Lior Dikstein, Arnon Netzer, Idan Achituve, Hai Victor Habi

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je een enorme, ongelooflijk gedetailleerde bibliotheek voor (een Large Language Model, of LLM) die elk vraag kan beantwoorden, code kan schrijven of verhalen kan vertellen. Het probleem is dat deze bibliotheek zo groot en zwaar is dat het duur is om op te slaan en traag om uit te lezen. Om het sneller en goedkoper te maken, proberen ingenieurs de boeken te verkleinen door ze te samenvatten in kleinere, eenvoudigere formaten. Dit proces heet kwantisatie.

Echter, er is een addertje onder het gras. In deze enorme bibliotheken bevinden een paar pagina's zich "uitbijters" – extreem lange, complexe zinnen die niet goed passen in het kleine, vereenvoudigde formaat. Als je probeert deze lange zinnen in een klein doosje te dwingen, worden ze platgedrukt en vervormd, waardoor het verhaal bedorven raakt.

Het probleem: de "blok"-flesnek

Recent werd een nieuwe manier geïntroduceerd om deze boeken te organiseren, genaamd Microscaling (MX). In plaats van de hele bibliotheek te verkleinen met één gigantische samenvatting, breekt MX de boeken op in kleine blokken en geeft elk blok zijn eigen kleine liniaal (schaalfactor) om de woorden te meten. Dit is geweldig omdat het verschillende delen van de tekst flexibeler behandelt.

Maar hier zit de hak: eerdere methoden probeerden het "uitbijter"-probleem op te lossen door de hele bibliotheek te roteren als een tol. Toen ze probeerden dit draaien te combineren met de nieuwe "blok"-linialen, ontstond er chaos. De rotatie verstoorde de blokmetingen en de bibliotheek werd onleesbaar.

Om dit op te lossen, probeerden eerdere onderzoekers een omweg: ze roteerden alleen de pagina's binnen elk klein blok, en negeerden de rest van de bibliotheek. Hoewel dit de chaos stopte, was het als proberen een file op te lossen door alleen auto's binnen één parkeerplek te verplaatsen, terwijl je de auto's die vastzitten in de volgende rij negeert. Het loste het grotere probleem niet op.

De oplossing: LATMiX (de slimme herschikker)

De auteurs van dit artikel, LATMiX, stellen een slimmere manier voor om de boeken te herschikken voordat ze worden verkleind.

Stel je de data in het model voor als een menigte mensen in een kamer. Sommige mensen staan in een enorme, dichte cluster (de uitbijters), terwijl anderen verspreid staan.

  • Oude methoden probeerden de hele kamer te draaien of mensen alleen binnen kleine groepjes te schudden.
  • LATMiX fungeert als een meester-choreograaf. Het leert een aangepaste, flexibele dansbeweging (een affiene transformatie) die de dichte menigte gelijkmatig over de hele kamer verspreidt.

Deze choreografie heeft twee speciale kenmerken:

  1. Het is leerbaar: In plaats van een vooraf ingestelde dans te gebruiken (zoals een simpele spin), gebruikt LATMiX standaard AI-tools om de perfecte dansbewegingen te leren, specifiek voor de data waar het naar kijkt. Het bedenkt precies hoe de energie moet worden verspreid zodat geen enkele plek te vol is.
  2. Het respecteert de blokken: Het is zich bewust van de "blok"-linialen (MX-formaat). Het schudt mensen niet willekeurig; het schudt ze op een manier die perfect werkt met het bloksysteem, zodat de kleine linialen iedereen nauwkeurig kunnen meten.

Hoe het werkt (de magische truc)

Het artikel legt uit dat LATMiX de bibliotheek niet vertraagt wanneer deze later wordt uitgelezen. Het is als een goochelaar die de kaarten voordat de truc begint, herschikt, en die herschikking vervolgens in het deck zelf opneemt. Zodra de truc is opgezet, hoeft de goochelaar (de computer) geen extra werk te doen om te schudden; de kaarten staan al in de perfecte volgorde. Dit betekent dat de snelheid en het geheugengebruik net zo snel blijven als voorheen, maar de kwaliteit van de "verkleinde" boeken veel hoger is.

De resultaten

De auteurs testten dit op verschillende modellen (zoals Llama en Qwen) en ontdekten dat LATMiX consequent beter presteerde dan andere methoden.

  • Betere nauwkeurigheid: De "verkleinde" modellen maakten minder fouten en begrepen vragen beter dan modellen die oudere verkleiningstechnieken gebruikten.
  • Robuustheid: Het werkte goed bij verschillende maten modellen, van kleine tot zeer grote.
  • Efficiëntie: Het behaalde deze verbeteringen zonder extra tijd of kosten toe te voegen aan het draaien van het model.

Kortom, LATMiX is een slim, leerbaar hulpmiddel dat data precies goed herschikt voordat het wordt gecomprimeerd, zodat zelfs de meest extreme "uitbijter"-informatie de verkleiningsprocedure overleeft zonder verloren te gaan, allemaal terwijl het goed samenwerkt met moderne hardware-formaten.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →