← Nieuwste papers
🤖 machine learning

Normalized Architectures are Natively 4-Bit

Dit artikel toont aan dat nGPT, een architectuur die gewichten en verborgen toestanden beperkt tot een eenheidshypersfeer, stabiele en efficiënte end-to-end 4-bits training mogelijk maakt door op natuurlijke wijze het signaal-ruisverhouding te verbeteren via constructieve signaalaanbouw, waardoor de noodzaak voor complexe precisiebehoudende ingrepen wordt weggenomen.

Oorspronkelijke auteurs: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Gepubliceerd 2026-05-08
📖 5 min leestijd🧠 Diepgaand

Oorspronkelijke auteurs: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Het Grote Probleem: De Code Kraken met Lage Precisie

Stel je voor dat je probeert een enorm, ongelooflijk complex Lego-kasteel te bouwen (een Large Language Model). Normaal gesproken gebruik je reusachtige, stevige bakstenen (wiskunde met hoge precisie) om ervoor te zorgen dat het kasteel hoog blijft staan en niet ineenstort.

Echter, om het kasteel sneller te bouwen en goedkoper op te slaan, willen ingenieurs kleine, breekbare 4-bit Lego-blokjes gebruiken. Het probleem is dat wanneer je deze kleine blokjes gebruikt met standaardontwerpen, het kasteel vaak instort of wankel wordt. Om dit op te lossen, moeten bouwers meestal dure steigers, extra lijm en complexe meetinstrumenten (zoals "Randomized Hadamard Transforms" en "per-tensor scaling") toevoegen, alleen om de structuur bij elkaar te houden. Deze oplossingen vertragen alles.

De Oplossing: Een Nieuw Ontwerp (nGPT)

Dit paper introduceert een nieuw ontwerp genaamd nGPT. In plaats van te proberen de breekbare 4-bit blokjes op te vullen met extra lijm, hebben de auteurs de vorm van de blokjes zelf veranderd.

In nGPT wordt elk onderdeel van het model gedwongen om op een "eenheids-hypersfeer" te blijven.

  • De Analogie: Stel je voor dat een standaard Lego-blokje elke grootte kan hebben, van een kiezelsteen tot een gigantische rotsblok. Dit maakt het moeilijk om ze netjes te stapelen als ze allemaal klein zijn.
  • De nGPT-draai: In nGPT wordt elk blokje gedwongen om precies even groot en gevormd te zijn, zoals een perfecte marmeren bol. Ze zijn allemaal beperkt tot het oppervlak van een onzichtbare bol.

Het paper beweert dat het model door deze vormbeperking inherente robuustheid bezit. Het kan volledig worden opgebouwd uit de kleine 4-bit blokjes zonder dat er extra steigers of lijm nodig zijn. Het werkt gewoon.

Waarom Werkt Het? Het "Koor"-Effect

De onderzoekers vroegen zich af: Waarom maakt deze bolvorm het model zo sterk?

Ze keken naar hoe het model wiskunde doet. Dit doet het door duizenden getallen te nemen, ze met elkaar te vermenigvuldigen en ze allemaal bij elkaar op te tellen (een "dot product").

  1. De Standaard Manier (GPT): Stel je een koor van 4.000 zangers voor. In een standaardmodel zingen de zangers allemaal verschillende noten op verschillende volumes. Wanneer je ze optelt, heffen de ruis (fouten gemaakt door de kleine 4-bit blokjes) elkaar op, maar gaat het daadwerkelijke lied (het signaal) verloren in het chaos. Het signaal is zwak.
  2. De nGPT Manier: Omdat alle zangers (getallen) gedwongen worden om even groot te zijn (op de bol), beginnen ze van nature op een licht gecoördineerde manier te zingen. Ze zijn niet perfect synchroon, maar ze hebben een zwakke, positieve correlatie.
    • De Analogie: Het is als een menigte die "De Golf" doet in een stadion. Zelfs als de golf klein is, bouwt deze zich op tot een enorme, krachtige beweging omdat iedereen in dezelfde algemene richting beweegt.
    • Het Resultaat: In nGPT bouwt het "signaal" (de beoogde wiskunde) zich constructief op, zoals een gecoördineerde golf. De "ruis" (de fouten van de kleine blokjes) heft zichzelf nog steeds op als willekeurige gepraat.

Dit creëert een veel duidelijker signaal. Het paper noemt dit een hogere Signaal-Ruisverhouding (SNR).

Het Voordeel van het "Vlakke Landschap"

Omdat het signaal zo sterk en duidelijk is, wordt het model zeer stabiel.

  • De Analogie: Stel je voor dat je over een berg loopt.
    • Standaard Model: Het is alsof je over een gezaagde, rotsachtige klif loopt. Als je een beetje de verkeerde stap zet (een slechte leersnelheid of een kleine wiskundige fout), kun je van een richel vallen. Je moet heel voorzichtig zijn.
    • nGPT Model: Het is alsof je over een breed, vlak plateau loopt. Je kunt grote stappen of kleine stappen zetten, en je valt niet af. Je kunt in elke richting lopen zonder je zorgen te maken over een crash.

Dit betekent dat ingenieurs geen uren hoeven te besteden aan het afstellen van de "leersnelheid" (hoe snel het model leert). De instellingen die werken voor de grote, zware bakstenen werken ook perfect voor de kleine 4-bit blokjes.

Wat Ze Testten

De auteurs spraken niet alleen over theorie; ze bouwden en testten deze modellen:

  • Kleine Schaal: Ze testten een model met 1,2 miljard parameters.
  • Grote Schaal: Ze testten enorme "Mixture of Experts"-modellen met tot wel 30 miljard parameters.
  • Het Resultaat: In elk geval trainden de nGPT-modellen succesvol met alleen 4-bit wiskunde. Ze hadden niet de extra "lijm" (RHT of scaling) nodig die standaardmodellen vereisen. Sterker nog, de nGPT-modellen waren vaak nauwkeuriger en sneller omdat ze niet het extra werk hoefden te doen om de wiskundefouten op te lossen.

De Conclusie

Het paper betoogt dat we niet alleen moeten proberen lage precisie-wiskunde te repareren met ingewikkelde patches. In plaats daarvan moeten we de architectuur zelf ontwerpen als "quantization-ready". Door het model te dwingen tot een bolvorm, wordt de wiskunde van nature robuust genoeg om de kleine 4-bit blokjes aan te kunnen, waardoor AI sneller, goedkoper en makkelijker te trainen wordt zonder kwaliteitsverlies.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →