FOCUS: FP4 Optimization via Coupled-Relaxation and Dual-Granularity Scaling
Dit artikel introduceert FOCUS, een post-training kwantiseringsframework dat de FP4-nauwkeurigheid voor grote taalmodellen verbetert door Coupled-Relaxation Scaling te gebruiken om leerbare kwantiseringsschalen te ontkoppelen van hardwarebeperkingen en Dual-Granularity Scaling voor fijnere gewichtsaanpassing, waarmee state-of-the-art prestaties worden bereikt zonder extra inferentie-overhead.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorme, complexe bibliotheek aan kennis in een piepkleine, draagbare rugzak te passen. Dit is de dagelijkse strijd voor "Large Language Models" (LLM's), de superintelligente computerbreinen die verhalen kunnen schrijven, wiskundeproblemen kunnen oplossen en kunnen chatten als mensen. Het probleem is dat deze breinen zo groot zijn dat ze enorme hoeveelheden geheugen en stroom nodig hebben om te draaien, wat ze duur en traag maakt om op alledaagse apparaten te gebruiken. Om dit op te lossen, gebruiken wetenschappers een truc genaamd "quantization" (kwantisatie). Denk hierbij aan het vertalen van een high-definition 4K-film naar een lagere resolutie zodat hij op een oude telefoon past. Het doel is om de data te verkleinen zonder de rode draad te verliezen. Onlangs is er een nieuw, superklein formaat genaamd "FP4" opgekomen, ondersteund door moderne computerchips, dat belooft deze modellen nog verder te verkleinen. Maar er is een addertje onder het gras: de data zo klein persen zorgt er vaak voor dat het model dingen "vergeet" of in de war raakt, waardoor de nauwkeurigheid verloren gaat. De grote vraag is: hoe verkleinen we het model tot deze piekleine omvang zonder de intelligentie te ruïneren?
Dit artikel introduceert een slimme nieuwe methode genaamd FOCUS om dat exacte probleem op te lossen. De onderzoekers realiseerden zich dat de huidige manier om deze modellen te verkleinen te rigide was. Stel je voor dat je een koffer inpakt. De standaardregel zegt: "Je moet precies dezelfde kleine, vooraf gemaakte doosjes gebruiken om je kleding in te pakken, en je moet diezelfde doosjes ook gebruiken om ze later weer uit te pakken." Het artikel betoogt dat dit onzin is. Hoewel je die kleine doosjes wel nodig hebt om de kleding op te bergen (omdat dat is wat in de koffer past), hoef je diezelfde kleine doosjes niet te gebruiken om eerst uit te zoeken hoe je de kleren moet vouwen. Je zou een grote, flexibele meetlint kunnen gebruiken om het inpakken te plannen, en het resultaat vervolgens gewoon in de kleine doosjes passen.
FOCUS gebruikt dit inzicht om de manier waarop modellen worden voorbereid voor het piekleine FP4-formaat te verbeteren. Het introduceert twee belangrijke trucs:
- Coupled-Relaxation Scaling (CRS): Dit is het "flexibele meetlint". Op de oude manier moest de computer een zeer grove, laag-precieze liniaal gebruiken om te beslissen hoe de getallen te verkleinen, en moest hij diezelfde grove liniaal gebruiken om ze weer in elkaar te zetten. FOCUS zegt: "Laten we een superprecieze, volledige liniaal gebruiken om de verkleiningsberekening te doen, en het resultaat dan pas in de grove doos proppen." Dit stelt de computer in staat om een veel betere manier te vinden om de data te verpakken zonder de regels van het piekleine formaat te breken.
- Dual-Granularity Scaling (DGS): Dit gaat over het verpakken van kleinere items. De oude methode behandelde een hele groep van 32 getallen als één grote brok, waarbij één liniaal voor de hele groep werd gebruikt. Maar wat als sommige getallen in die groep enorm groot zijn en andere juist heel klein? FOCUS splitst die grote groep op in kleinere subgroepen (zoals het snijden van een grote pizza in punten) en geeft elk stukje zijn eigen op maat gemaakte liniaal. Hierdoor kan de computer zich aanpassen aan de specifieke details van de data, in plaats van alles in een "one-size-fits-all" doos te dwingen.
De resultaten zijn indrukwekkend. Wanneer de onderzoekers FOCUS testten op verschillende AI-modellen (zoals Qwen en LLaMA), presteerde het consequent beter dan alle andere methoden. Bijvoorbeeld, op een model genaamd Qwen3-4B slaagde FOCUS erin om 98,2% van de oorspronkelijke nauwkeurigheid van het model te herstellen met het NVFP4-formaat, en 96,2% met MXFP4. Dit is een significante sprong vergeleken met eerdere technieken, die vaak moeite hadden om boven de 90% of 94% te blijven.
Cruciaal is dat het artikel laat zien dat FOCUS het model niet langzamer of moeilijker in gebruik maakt. Hoewel de computer extra berekeningen uitvoert tijdens het voorbereiden van het model (tijdens de "training" of "kalibratiefase"), draait het uiteindelijke model net zo snel als elk ander FP4-model. Het duurt ongeveer 19 minuten om een Qwen3-4B-model voor te bereiden op een enkele high-end GPU, wat zelfs sneller is dan sommige concurrerende methoden. De onderzoekers benadrukken dat dit een "post-training" methode is, wat betekent dat ze het model niet vanaf nul opnieuw hoeven te leren; ze passen alleen de instructies voor het inpakken aan.
Kortom, FOCUS suggereert dat door de regels over hoe we de verkleining berekenen te versoepelen (terwijl we het uiteindelijke opslagformaat strikt houden), we deze gigantische AI-breinen in piekleine ruimtes kunnen passen zonder hun slimheid te verliezen. Het is een beetje alsocht beseffen dat je een shirt perfect kunt vouwen met behulp van een grote tafel, zelfs als je alleen een kleine lade hebt om het in op te bergen. Het artikel bewijst dat deze aanpak beter werkt dan de oude, rigide manieren, en biedt een pad om krachtige AI te draaien op apparaten die dat momenteel nog niet aankunnen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.