Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling
Dieser Beitrag stellt „Four Over Six" (4/6) vor, eine adaptive Block-Skalierungstechnik für NVFP4-Quantisierung, die den Quantisierungsfehler durch dynamische Anpassung der Blockskalen zur besseren Handhabung großer Werte reduziert und dadurch Trainings- und Inferenzleistung nahe an BF16 mit minimalem Rechenaufwand erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, eine massive Bibliothek voller Bücher in einen winzigen, tragbaren Koffer zu packen. Die Bücher repräsentieren das „Gehirn" eines Large Language Models (KI), und der Koffer steht für den Arbeitsspeicher des Computers. Um alles unterzubringen, müssen Sie die Bücher verkleinern.
Lange Zeit haben wir eine Methode namens BF16 (ein Standardformat mit hoher Präzision) verwendet, die sich anfühlt, als würden Sie die Bücher in stabile, schwere Kisten packen. Das ist präzise, aber der Koffer füllt sich schnell. Kürzlich haben Ingenieure versucht, zu NVFP4 zu wechseln, einem viel kleineren Format. Stellen Sie sich NVFP4 als eine Reihe winziger, leichter Origami-Kisten vor. Sie passen viel mehr Bücher in den Koffer und lassen die KI schneller laufen, aber es gibt einen Haken: Da die Kisten so klein sind, werden einige der „großen" Bücher gequetscht, zerknittert oder verlieren ihre Seiten. Dieses „Zerknittern" nennt man Quantisierungsfehler, und es führt dazu, dass die KI Fehler macht.
Das Problem: Die „raue Kante" kleiner Kisten
Die Arbeit erklärt, dass NVFP4 eine seltsame Eigenart hat. Es kann nur bestimmte Größen aufnehmen: 0,5; 1; 1,5; 2; 3; 4 und 6.
- Wenn ein Buch genau Größe 4 hat, passt es perfekt.
- Wenn ein Buch Größe 5 hat, passt es nicht. Sie müssen es in die Kiste der Größe 4 oder die Kiste der Größe 6 zwängen.
- Wenn Sie ein Buch der Größe 5 in eine Kiste der Größe 4 zwängen, verlieren Sie viele Informationen (es wird zerquetscht). Wenn Sie es in eine Kiste der Größe 6 zwängen, verschwenden Sie viel Platz (es klappert herum).
Die Autoren stellten fest, dass das „Zerquetschen" am häufigsten bei Büchern auftritt, die fast so groß wie die größte Kiste sind (die „nahe-maximalen" Werte). Bei der Standardmethode ist der Koffer so dimensioniert, dass er das absolut größte mögliche Buch (Größe 6) aufnehmen kann. Dies hinterlässt jedoch eine riesige Lücke, in der Bücher der Größe 5 stark gequetscht werden.
Die Lösung: „Vier über Sechs" (4/6)
Die Autoren, Jack Cook und sein Team, haben einen cleveren Trick namens Four Over Six (Vier über Sechs) entwickelt.
Stellen Sie sich vor, Sie packen einen Koffer. Anstatt jedes einzelne Item in eine „Größe-6"-Kiste zu zwängen, betrachten Sie jede Gruppe von Items.
- Der alte Weg: Sie gehen davon aus, dass jede Gruppe eine „Größe-6"-Kiste benötigt. Wenn eine Gruppe ein Buch der Größe 5 enthält, wird es zerquetscht.
- Die 4/6-Methode: Sie prüfen die Gruppe. Wenn das größte Buch in dieser spezifischen Gruppe nur Größe 5 hat, sagen Sie: „Okay, wir brauchen für diese Gruppe keine Größe-6-Kiste. Nehmen wir stattdessen eine Größe-4-Kiste."
Indem Sie für diese spezifische Gruppe auf eine kleinere „Größe-4"-Kiste wechseln, passt das „Buch der Größe 5" (das nun relativ zur Kistentgrenze kleiner ist) viel bequemer hinein. Es wird nicht mehr gegen die Kante gequetscht.
Die Analogie:
Stellen Sie sich vor, es ist wie das Springen einer Videospiel-Figur.
- Standard-NVFP4: Das Spiel geht davon aus, dass die Figur bis zu 10 Fuß springen kann. Wenn sie versucht, 9 Fuß zu springen, rundet das Spiel es auf 8 Fuß ab (ein großer Abfall).
- 4/6-Methode: Das Spiel prüft das spezifische Level. Wenn die höchste Plattform nur 6 Fuß hoch ist, wechselt es das „Sprunglimit" auf 6 Fuß. Jetzt wird ein 5-Fuß-Sprung viel genauer auf 6 Fuß (oder 4 Fuß) abgerundet. Die Figur fällt nicht so weit herunter.
Wie es in der Praxis funktioniert
Die Arbeit beschreibt einen intelligenten Algorithmus, der vor dem Verpacken jeden kleinen Datenblock (ein sogenannter „Block") betrachtet:
- Er versucht, den Block in eine „Größe-6"-Kiste zu packen und berechnet, wie viel Information verloren geht.
- Er versucht, denselben Block in eine „Größe-4"-Kiste zu packen und berechnet den Verlust.
- Er wählt die Kiste aus, die weniger Schaden (weniger Fehler) verursacht.
Normalerweise gewinnt bei Blöcken mit sehr großen Zahlen die „Größe-4"-Kiste, da sie die „nahe-maximalen" Zahlen besser unterbringt.
Die Ergebnisse
Das Team testete dies an einem massiven KI-Modell namens Nemotron 3 Nano (30 Milliarden Parameter).
- Training: Als sie die KI mit 4/6 trainierten, lernte die KI besser und machte weniger Fehler im Vergleich zur Standard-NVFP4-Methode. Sie kam der Leistung der schweren, langsamen „BF16"-Methode viel näher, behielt aber die Geschwindigkeits- und Größenvorteile von NVFP4 bei.
- Geschwindigkeit: Sie zeigten, dass dieses „intelligente Verpacken" den Computer nicht verlangsamt. Es fügt weniger als 15 % zusätzlichen Aufwand hinzu, was ein kleiner Preis für eine deutlich bessere Genauigkeit ist.
- Bestehende Modelle: Sie testeten dies auch an bereits trainierten Modellen (wie Llama und Qwen). Selbst ohne Nachtraining machten diese Modelle mit 4/6 bei Tests wie Leseverständnis und Logikrätseln schlauere und genauere Ergebnisse.
Das Fazit
Die Arbeit behauptet, dass Sie durch einfaches, intelligenteres Entscheiden, welche Kistentgröße für verschiedene Datengruppen zu verwenden ist – manchmal eine „4" statt einer „6" –, das „Zerquetschen" wichtiger Informationen stoppen können. Dies macht KI mit niedriger Präzision (NVFP4) viel genauer und ermöglicht es uns, größere, schnellere KI-Modelle auf aktueller Hardware auszuführen, ohne dass sie ihre „Denkkraft" verlieren.
Sie haben sogar den Code (Kernels) veröffentlicht, damit andere diese „intelligente Verpackungs"-Methode auf den neuesten Blackwell-GPUs von NVIDIA verwenden können.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.