← Nieuwste papers
💬 NLP

Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling

Dit artikel introduceert "Four Over Six" (4/6), een adaptieve block-scaling-techniek voor NVFP4-quantisatie die de quantisatiefout vermindert door blokschalen dynamisch aan te passen om beter om te gaan met grote waarden, waardoor trainings- en inferentieprestaties dichter bij BF16 worden benaderd met minimale rekenkundige overhead.

Oorspronkelijke auteurs: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Jack Cook, Junxian Guo, Guangxuan Xiao, Yujun Lin, Song Han

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme bibliotheek vol boeken in een klein, draagbaar koffer te proppen. De boeken vertegenwoordigen het "brein" van een Groot Taalmodel (AI), en de koffer staat voor het geheugen van de computer. Om alles erin te krijgen, moet je de boeken verkleinen.

Lange tijd hebben we een methode gebruikt die BF16 heet (een standaard, hoogprecisie formaat), wat vergelijkbaar is met het verpakken van boeken in stevige, zware dozen. Het is nauwkeurig, maar de koffer raakt snel vol. Onlangs probeerden ingenieurs over te schakelen naar NVFP4, een veel kleiner formaat. Denk aan NVFP4 als een setje tiny, lichtgewicht origamidoosjes. Ze passen veel meer boeken in de koffer en maken de AI sneller, maar er is een addertje onder het gras: omdat de dozen zo klein zijn, worden sommige "grote" boeken platgedrukt, gekreukt of verliezen ze hun pagina's. Deze "kreukeling" wordt kwantisatiefout genoemd, en het zorgt ervoor dat de AI fouten maakt.

Het Probleem: De "Ruwe Rand" van Kleine Dozen

Het artikel legt uit dat NVFP4 een vreemde eigenaardigheid heeft. Het heeft specifieke maten die het kan bevatten: 0,5, 1, 1,5, 2, 3, 4 en 6.

  • Als een boek precies maat 4 is, past het perfect.
  • Als een boek maat 5 is, past het niet. Je moet het dwingen in de maat 4-doos of de maat 6-doos.
  • Als je een maat 5-boek dwingt in een maat 4-doos, verlies je veel informatie (het wordt verpletterd). Als je het dwingt in een maat 6-doos, verspil je veel ruimte (het rammelt erin).

De auteurs ontdekten dat het "verpletteren" het vaakst voorkomt bij boeken die bijna zo groot zijn als de grootste doos (de "near-maximal" waarden). Bij de standaardmethode is de koffer zo ontworpen dat hij het absoluut grootste mogelijke boek (maat 6) kan bevatten. Maar dit laat een enorm gat over waar boeken van maat 5 slecht worden gekreukt.

De Oplossing: "Vier Over Zes" (4/6)

De auteurs, Jack Cook en zijn team, bedachten een slimme truc die Four Over Six (4/6) heet.

Stel je voor dat je een koffer inpakt. In plaats van elk enkel item te dwingen in een "Maat 6"-doos, bekijk je elke groep items.

  • De Oude Manier: Je gaat ervan uit dat elke groep een "Maat 6"-doos nodig heeft. Als een groep een boek van maat 5 heeft, wordt het verpletterd.
  • De 4/6 Manier: Je controleert de groep. Als het grootste boek in die specifieke groep slechts maat 5 is, zeg je: "Oké, we hebben geen Maat 6-doos nodig voor deze groep. Laten we in plaats daarvan een Maat 4-doos gebruiken."

Door voor die specifieke groep over te schakelen naar een kleinere "Maat 4"-doos, past het "Maat 5"-boek (dat nu relatief kleiner is ten opzichte van de dooslimiet) veel comfortabeler. Het wordt niet langer tegen de rand verpletterd.

De Analogie:
Denk eraan als een videospelkarakter dat springt.

  • Standaard NVFP4: Het spel gaat ervan uit dat het karakter tot 10 voet kan springen. Als ze proberen 9 voet te springen, rondt het spel dit af naar 8 voet (een grote daling).
  • 4/6 Methode: Het spel controleert het specifieke niveau. Als het hoogste platform slechts 6 voet hoog is, schakelt het de "springlimiet" om naar 6 voet. Nu wordt een 5-voets sprong veel nauwkeuriger afgerond naar 6 voet (of 4 voet). Het karakter valt niet zo ver.

Hoe Het In De Praktijk Werkt

Het artikel beschrijft een slim algoritme dat voor het inpakken naar elk klein stukje data (een "blok") kijkt:

  1. Het probeert het blok in een "Maat 6"-doos te verpakken en berekent hoeveel informatie er verloren gaat.
  2. Het probeert hetzelfde blok in een "Maat 4"-doos te verpakken en berekent het verlies.
  3. Het kiest de doos die minder schade veroorzaakt (minder fout).

Meestal is voor blokken met zeer grote getallen de "Maat 4"-doos de winnaar, omdat het zorgt dat de "near-maximal" getallen beter passen.

De Resultaten

Het team testte dit op een enorm AI-model genaamd Nemotron 3 Nano (30 miljard parameters).

  • Training: Toen ze de AI trainden met 4/6, leerde de AI beter en maakte het minder fouten in vergelijking met de standaard NVFP4-methode. Het kwam veel dichter bij de prestaties van de zware, trage "BF16"-methode, maar behield de snelheids- en groottevoordelen van NVFP4.
  • Snelheid: Ze toonden aan dat deze "slimme inpakking" de computer niet vertraagt. Het voegt minder dan 15% extra werk toe, wat een kleine prijs is voor veel betere nauwkeurigheid.
  • Bestaande Modellen: Ze probeerden dit ook op al getrainde modellen (zoals Llama en Qwen). Zelfs zonder hertraining maakten deze modellen met 4/6 slimmere en nauwkeurigere prestaties op tests zoals leesbegrip en logische puzzels.

De Conclusie

Het artikel beweert dat door simpelweg slimmer na te denken over welke doosgrootte je voor verschillende groepen data moet gebruiken – soms een "4" in plaats van een "6" – je het "verpletteren" van belangrijke informatie kunt stoppen. Dit maakt lage-precisie AI (NVFP4) veel nauwkeuriger, waardoor we grotere, snellere AI-modellen op huidige hardware kunnen draaien zonder dat ze hun "breinkracht" verliezen.

Ze hebben zelfs de code (kernels) vrijgegeven zodat anderen deze "slimme inpakking"-methode kunnen gebruiken op NVIDIA's nieuwste Blackwell GPU's.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →