Full-Stack FP4: Stable LLM Pretraining with Quantized Projections, Optimizers, and Attention
Dieses Paper stellt Full-Stack FP4 vor, ein modulares Framework, das die NVFP4-Quantisierung über lineare Projektionen hinaus auf stabile Optimizer-Zustände, Root/Muon-Berechnungen und Mixed-Precision-Attention erweitert und so eine nahezu BF16-äquivalente Pretraining-Performance mit signifikanten Speicher- und Geschwindigkeitsgewinnen auf einer einzelnen RTX 5090 erreicht.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich vor, Sie versuchen, einem riesigen, digitalen Gehirn das Sprechen, Schreiben und Denken beizubringen. Dieses „Gehirn“ ist ein Large Language Model (LLM), und um zu lernen, muss es Berge von Informationen verarbeiten. Aber es gibt einen Haken: Je mehr es lernt, desto hungriger wird es nach Computerspeicher und Elektrizität. Es ist, als würde man versuchen, einen massiven High-Definition-Film auf einem winzigen, alten Laptop laufen zu lassen; der Bildschirm wird unscharf und der Lüfter schreit auf. Um dies zu lösen, haben Wissenschaftler versucht, die Zahlen, die der Computer für seine Berechnungen verwendet, zu verkleinern. Anstatt superpräzise, schwere Zahlen (wie eine detaillierte Fotografie) zu verwenden, haben sie gewechselt zu kleineren, leichteren Zahlen (wie eine pixelige Skizze). Dies wird als „Low-Precision Training“ bezeichnet. Vor kurzem ist eine neue Art von winziger Zahl namens „FP4“ (4-Bit Floating Point) erschienen, die verspricht, diese riesigen Gehirne viel kleiner und schneller zu machen. Aber hier liegt das Problem: Während die Hauptteile des Gehirns mit diesen winzigen Zahlen zurechtkommen, stürzen die „Helfer“-Teile – wie das Gedächtnis, das es sich für das Lernen merkt, und die komplexen mathematischen Operationen, die es braucht, um Sätze zu verstehen – ständig ab oder werden verwirrt, wenn sie gezwungen werden, solche kleinen Zahlen zu verwenden. Es ist, als hätte man einen Rennwagenmotor, versucht aber, ihn mit einer Fahrradkette zu betreiben; der Motor ist bereit, aber der Rest der Maschine kann nicht mithalten.
Dieses Paper stellt ein cleveres neues Toolkit namens Full-Stack FP4 vor, das wie ein Meistermechaniker für diese digitalen Gehirne fungiert. Die Forscher erkannten, dass man nicht für jeden einzelnen Teil des Gehirns dieselben winzigen Zahlen-Regeln verwenden kann. Einige Teile, wie die Hauptverbindungen, können mit den winzigen Zahlen gut umgehen. Aber andere Teile, wie das „Gedächtnis“, das der Computer nutzt, um sich zu merken, was er gestern gelernt hat, sind sehr empfindlich und benötigen eine spezielle Art der Pflege. Das Team entwickelte ein modulares System, bei dem sie für verschiedene Teile des Gehirns unterschiedliche „Rezepte“ verwenden. Für die Hauptverbindungen nutzen sie einen Trick namens LoRA-SVD, was so ist, als würde man eine hochauflösende Skizze der wichtigsten Details behalten, während man für den Rest pixelige Blöcke verwendet. Für das Gedächtnis erfanden sie eine Methode, um die Zahlen zu „glätten“, bevor sie in winzige Boxen gepresst werden, damit sie nicht verloren gehen. Für die Mathematik, die dem Gehirn hilft, sich auf die richtigen Wörter zu konzentrieren (Attention), entschieden sie sich, die empfindlichsten Teile in High-Definition zu behalten, während der Rest pixelig bleiben darf.
Als sie dieses Gesamtsystem auf ein Modell mit 3 Milliarden Parametern (ein mittelgroßes digitales Gehirn) mit 64 Milliarden Wörtern an Trainingsdaten testeten, waren die Ergebnisse beeindruckend. Das „Full-Stack FP4“-Gehirn lernte fast exakt so gut wie die traditionelle, schwergewichtige Version. Der Unterschied in ihren Lernwerten war winzige 0,838 %, was kaum merkbar ist. Tatsächlich, als sie testeten, wie gut das neue, kleinzahlige Modell Fragen beantworten konnte, die es noch nie gesehen hatte, war es sogar etwas besser darin, die richtigen Wörter zu erraten, obwohl es viel weniger Speicher verbrauchte. Auf einer leistungsstarken Grafikkarte (einer RTX 5090) machte diese neue Methode den Lernprozess des Gehirns für bestimmte Aufgaben 2,5- bis 2,8-mal schneller und verbrauchte 38 % bis 42 % weniger Speicher als die Standardmethode mit hoher Präzision.
Die Forscher weisen vorsichtig darauf hin, dass dies zwar hervorragend für Modelle bis zu 3 Milliarden Parametern funktioniert, sie aber noch nicht bewiesen haben, ob es auch für noch größere Gehirne oder über viel längere Trainingszeiten hinweg funktioniert. Sie fanden auch heraus, dass man nicht einfach winzige Zahlen auf alles werfen kann; wenn man versucht, die empfindlichsten Teile des Gehirns ohne diese speziellen Rezepte zu zwingen, die kleinsten Zahlen zu verwenden, bricht das Lernen zusammen. Aber für den Moment zeigt dieser „Full-Stack“-Ansatz, dass wir smartere, schnellere und günstigere KI bauen können, indem wir die verschiedenen Teile des Gehirns mit dem spezifischen Präzisionsgrad behandeln, den sie tatsächlich benötigen, anstatt das gesamte System zu einer Einheitsgröße zu machen.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.