← Nieuwste papers
🤖 machine learning

TORQ: Two-Level Orthogonal Rotation for MXFP4 Quantization

Dit artikel introduceert TORQ, een trainingsvrij post-training kwantisatiekader dat twee-niveau orthogonale rotaties toepast om structurele onevenwichtigheden in MXFP4-activatiekwantisatie theoretisch aan te pakken, waardoor de nauwkeurigheidskloof tussen 4-bit inferentie en modellen met volledige precisie op grote taalmodellen aanzienlijk wordt verkleind.

Oorspronkelijke auteurs: Zukang Xu, Xing Hu, Dawei Yang

Gepubliceerd 2026-05-20
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Zukang Xu, Xing Hu, Dawei Yang

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, chaotische bibliotheek van boeken (de "activaties" binnen een slimme AI) in kleine, uniforme verzenddozen (het "MXFP4"-formaat) te verpakken, zodat ze snel en goedkoop vervoerd kunnen worden.

Het artikel stelt dat het simpelweg in de dozen proppen van deze boeken niet goed werkt. De boeken zijn te rommelig en de dozen hebben een zeer specifieke, stijve vorm. Dit veroorzaakt twee hoofdproblemen, die de auteurs TORQ (Two-Level Orthogonal Rotation) noemen.

Hieronder legt het artikel het probleem en hun oplossing uit, met behulp van eenvoudige analogieën:

Het Probleem: Twee Manieren waarop de Verpakking Faalt

1. Het "Eén Luidruchtige Buur" Probleem (Inter-block Variance Imbalance)
Stel je voor dat je bibliotheek is verdeeld in groepen van 32 boeken. In het huidige systeem krijgt elke groep één enkel "grootte-etiket" (een schalingsfactor) voor de hele groep.

  • Het Probleem: In de meeste groepen zijn de boeken klein en licht. Maar in een paar groepen zit één gigantische, zware encyclopedie.
  • Het Resultaat: Vanwege dat ene zware boek moet het etiket voor de hele groep worden ingesteld op "Extra Groot". Dit betekent dat alle kleine, lichte boeken in diezelfde groep nu worden gedwongen in een gigantische doos te passen. Ze worden verpletterd, verloren of verandert in nul, omdat de doos te groot is om hun kleine details te bevatten. Een paar "luidruchtige" groepen ruïneren de precisie voor iedereen anders.

2. Het "Lege Plank" Probleem (Intra-block Codebook Utilization Imbalance)
De verzenddozen (MXFP4) worden geleverd met een vooraf gedrukte lijst van specifieke maten die ze kunnen bevatten (een "codebook"). Deze maten zijn gescheiden als sporten op een ladder: klein, medium, groot, extra groot.

  • Het Probleem: Wereldwijde AI-gegevens zijn als een menigte mensen waarbij 90% erg klein is en slechts 10% lang.
  • Het Resultaat: Bijna alle gegevens vallen in de "kleine" sporten van de ladder. De "medium" en "grote" sporten zitten volledig leeg en ongebruikt. Het is alsof je een magazijn vol met gigantische kratten hebt, maar je gebruikt alleen de kleine, terwijl de grote stof vangen. Dit is een enorme verspilling van ruimte en potentieel.

De Oplossing: TORQ (De Grote Herordening)

In plaats van te proberen de rommelige boeken in de dozen te forceren, stellen de auteurs voor de boeken te roteren voordat ze worden verpakt. Denk hierbij aan het schudden van een kaartspel zodat de zware en lichte kaarten gelijkmatig gemengd zijn, en de lange en korte mensen verspreid zijn.

Ze doen dit in twee stappen:

Stap 1: De Macro Shuffle (Het "Luidruchtige Buur" Probleem Oplossen)

  • De Analogie: Stel je voor dat je 100 groepen boeken hebt. Sommige groepen zijn zwaar, sommige licht. De auteurs gebruiken een wiskundige truc (gebaseerd op de Schur-Horn stelling) om boeken tussen groepen te ruilen.
  • Het Doel: Ze verplaatsen de "zware" boeken van de zware groepen naar de lichte groepen, en vice versa.
  • Het Resultaat: Nu heeft elke enkele groep ongeveer hetzelfde totale gewicht. Geen enkele groep wordt gedomineerd door één gigantisch boek. Dit stelt de "grootte-etiketten" voor elke groep in staat om op een perfecte, middelgrote maat te worden ingesteld, waardoor de details van de kleine boeken behouden blijven.

Stap 2: De Micro Shuffle (Het "Lege Plank" Probleem Oplossen)

  • De Analogie: Nu de groepen in evenwicht zijn, kijk je naar binnen in één groep. De boeken zijn nog steeds samengepakt in het "kleine" gedeelte. De auteurs roteren de boeken binnen de groep.
  • Het Doel: Ze draaien de boeken zodat ze gelijkmatig verspreid zijn over de hele ladder van maten. In plaats dat 90% van de boeken "klein" is, zijn ze nu zo verdeeld dat sommige de "medium" sporten raken en sommige de "grote" sporten.
  • Het Resultaat: Ze gebruiken elke enkele sport op de ladder. Geen enkele ruimte wordt verspild. Het "codebook" wordt volledig benut.

Het Resultaat

Door deze tweestapsrotatie voordat de AI wordt gecomprimeerd (een proces genaamd Post-Training Quantization, wat betekent dat ze de AI niet opnieuw hoeven te leren), bereiken ze geweldige resultaten:

  • Nauwkeurigheid: Het lukte hen om de AI te verkleinen naar 4-bit precisie (kleine dozen) zonder veel van zijn "breinkracht" te verliezen. In tests was hun methode (TORQ) veel slimmer dan eerdere methoden en behaalde scores dicht bij de volledige, niet-gecomprimeerde AI.
  • Snelheid & Grootte: Omdat de dozen kleiner zijn, draait de AI sneller en neemt het minder geheugen in beslag op apparaten zoals telefoons of servers.
  • Geen Extra Werk: De "rotatie" wordt één keer berekend en vervolgens in de gewichten van de AI gebakken. Wanneer de AI draait, merkt het geen extra vertraging; de rotatie gebeurt automatisch als onderdeel van de wiskunde.

Kortom: Het artikel zegt: "Probeer niet een rommelige, ongelijke menigte in een stijve doos te persen. Schud in plaats daarvan de menigte zachtjes zodat iedereen gelijkmatig verspreid is, en doe ze dan in de doos. Hierdoor werkt de doos perfect."

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →