Stable FP4 Training via Transposition-Invariant Block Quantization
Dieses Paper führt ein stabiles FP4-Trainingsframework für große Sprachmodelle ein, das die durch Tensor-Transposition verursachte Optimierungsinstabilität konventioneller Mikroskalierungsansätze durch die Durchsetzung einer transpositions-invarianten 2D-Blockquantisierung behebt und so eine mit BF16 vergleichbare Leistung mit minimaler Degradation bei Modellen bis zu 30 Milliarden Parametern erzielt.
Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen
Stellen Sie sich die Welt der künstlichen Intelligenz als eine riesige, geschäftige Bibliothek vor, in der gigantische Roboter (genannt Large Language Models) versuchen zu lernen, zu lesen, zu schreiben und zu schlussfolgern. Um dies zu tun, müssen sie Berge von Informationen verarbeiten, was eine enorme Menge an Energie und Speicher erfordert. Es ist, als würde man versuchen, einen Supercomputer mit einer einzelnen AA-Batterie zu betreiben; das funktioniert einfach nicht gut. Wissenschaftler haben versucht, diese Roboter effizienter zu machen, indem sie ihnen beibringen, in „einfacheren“ Zahlen zu denken. Anstatt komplexe, hochpräzise Dezimalzahlen zu verwenden (wie etwa eine Distanz auf den Millionstel Millimeter genau zu messen), versuchen sie es mit gröberen 4-Bit-Zahlen (wie das Messen in ganzen Zoll). Dies spart eine enorme Menge an Platz und Energie. Doch es gibt einen Haken: Wenn die Roboter mit diesen groben Zahlen zu lernen versuchen, werden sie oft verwirrt, machen Fehler und hören ganz auf zu lernen. Es ist, als würde man versuchen, ein Labyrinth mit einer Karte zu navigieren, deren Regeln sich ständig selbst ändern.
Das Papier, das Sie gleich lesen werden, befasst sich genau mit dieser Verwirrung. Es stellt die Frage: Warum führt das Lehren dieser KI-Roboter mit ultra-einfachen Zahlen dazu, dass sie abstürzen? Die Autoren entdeckten, dass das Problem nicht nur die einfachen Zahlen sind; es ist die Art und Weise, wie die Roboter diese Zahlen organisieren, wenn sie vom „Vorwärtslernen“ (einen Satz lesen) zum „Rückwärtslernen“ (ihre Fehler überprüfen) wechseln. Es ist, als ob der Roboter ein Buch von links nach rechts liest, aber wenn er seine Notizen überprüft, plötzlich von rechts nach links liest, wodurch die Seitenzahlen durcheinandergeraten und der rote Faden verloren geht. Das Papier schlägt eine clevere Lösung vor: eine neue Art, die Zahlen zu organisieren, sodass die Regeln gleich bleiben, egal in welche Richtung der Roboter blickt. Dies ermöglicht es den Robotern, stabil zu lernen, selbst mit den einfachsten Zahlen, was das Training schneller und kostengünstiger macht, ohne dass sie ihre Intelligenz verlieren.
Das große Zahlen-Durcheinander: Den Speicherfehler der KI beheben
Sie wollen also eine superintelligente KI bauen, aber Ihr Computer geht zur Neige, was Saft und Speicherplatz angeht. Der übliche Trick ist, der KI zu sagen, dass sie „niedrigpräzise“ Mathematik verwendet. Denken Sie an Folgendes: Normalerweise misst die KI Dinge mit einem superpräzisen Lineal, das winzige, winzige Markierungen hat (wie BF16 oder FP8). Aber um Platz zu sparen, wollen wir, dass sie ein Lineal mit nur vier großen, klobigen Markierungen verwendet (FP4). Das ist viel schneller und nimmt weniger Platz ein. Aber hier liegt das Problem: Wenn die KI versucht, mit diesen klobigen Markierungen zu lernen, bricht sie oft zusammen. Sie beginnt, wilde Vermutungen anzustellen, und das Training stürzt ab.
Lange Zeit dachten Wissenschaftler, das Problem sei lediglich, dass die klobigen Markierungen nicht detailliert genug seien. Sie versuchten, dies zu beheben, indem sie Zahlen gruppierten und jeder Gruppe einen gemeinsamen „Skalierungsfaktor“ (eine Möglichkeit, die Zahlen zu dehnen oder zu stauchen) gaben. Das funktionierte ganz ordentlich, aber das neue Paper von Mehdi Rahimifar und seinem Team sagt: „Warten Sie mal! Wir haben den wahren Übeltäter gefunden.“
Der Übeltiger ist ein hinterlistiger kleiner Fehler namens Transponierung.
Das Problem „Von links nach rechts vs. von rechts nach links“
Stellen Sie sich vor, Sie haben ein Raster aus Klebezetteln an einer Wand, angeordnet in Reihen. Sie schreiben eine Zahl auf jeden Zettel und setzen ein Etikett für die ganze Reihe, um anzugeben, wie groß die Zahlen sind. So organisiert die KI normalerweise ihre Daten.
Stellen Sie sich nun vor, die KI lernt. Zuerst liest sie die Zettel von links nach rechts (den „Forward Pass“). Sie sieht die Zahlen und die Etiketten und lernt daraus. Aber dann, um ihre Arbeit zu überprüfen und Fehler zu korrigieren, muss sie das Raster umdrehen (was in der Mathematik als „Transponierung“ bezeichnet wird). Plötzlich werden aus Reihen Spalten.
Hier tritt die Katastrophe ein: Auf die alte Art des Vorgehens (genannt 1D-Block-Quantisierung) werden die Klebezettel beim Umdrehen des Rasters in neue Gruppen neu sortiert. Ein Zettel, der in „Gruppe A“ mit einem bestimmten Etikett war, befindet sich nun in „Gruppe B“ mit einem völlig anderen Etikett. Die KI denkt: „Moment, ich dachte, diese Zahl wäre klein, aber jetzt sagt das Etikett, dass sie riesig ist!“ Diese Diskrepanz zwischen dem, was die KI beim Lernen sah, und dem, was sie beim Überprüfen sieht, erzeugt ein verwirrendes, verzerrtes Signal. Es ist, als würde man versuchen, einem Rezept zu folgen, bei dem sich die Zutatenliste jedes Mal ändert, wenn man die Seite umblättert. Das Ergebnis? Die KI wird schwindelig, das Training wird instabil und es scheitert am Lernen.
Die 2D-Quadrat-Lösung
Die Autoren dieses Papiers hatten eine brillante Idee: Lassen Sie die Gruppen nicht wechseln, wenn Sie das Raster umdrehen.
Sie schlugen vor, 2D-Quadratblöcke zu verwenden. Stellen Sie sich vor, anstatt langer Reihen von Klebezetteln ordnen Sie diese in perfekten Quadraten an (wie ein 32x32 Schachbrettmuster). Wenn Sie ein quadratisches Gitter umdrehen, bleiben die Quadrate Quadrate. Die Klebezettel, die in der oberen linken Ecke eines Quadrats waren, befinden sich immer noch in einem Quadrat, das demselben Gruppenwert entspricht, nur eben gedreht. Das Etikett (der Skalierungsfaktor) bleibt für diese Zahlen exakt gleich, egal ob die KI vorwärts oder rückwärts blickt.
Durch die Durchsetzung dieser transpositions-invarianten Regel wird die KI nicht mehr verwirrt. Die Zahlen, die sie beim Lernen sieht, sind dieselben Zahlen, die sie beim Korrigieren sieht. Diese einfache Änderung behebt das „Schwindelgefühl“ und ermöglicht es der KI, stabil mit den ultra-einfachen FP4-Zahlen zu trainieren.
Das Sicherheitsnetz: Kein Abschneiden und kein zufälliges Raten
Aber warten Sie, da ist noch mehr! Nur die Gruppen zu korrigieren, war nicht genug. Da FP4-Zahlen so einfach sind, können sie leicht zu groß werden (Überlauf) oder auf eine Weise gerundet werden, die eine Verzerrung einführt (zum Beispiel immer aufrunden).
Um dies zu beheben, fügte das Team zwei Sicherheitsfunktionen hinzu:
- Abschneidungsfreie Skalierung (Truncation-Free Scaling): Anstatt Zahlen, die zu groß sind, einfach abzuschneiden (was die Daten verzerrt), passen sie das „Lineal“ selbst an, sodass jede Zahl bequem in den Bereich passt. Es ist, als würde man das Lineal so dehnen, dass die größte Person im Raum noch hineinpasst, ohne dass ihr Kopf abgeschnitten wird.
- Stochastisches Runden (Stochastic Rounding): Wenn eine Zahl zwischen zwei Markierungen auf dem Lineal liegt, wirft die KI anstatt immer zur nächsten Markierung zu runden (was eine Verzerrung erzeugt), eine Münze. Manchmal wird aufgerundet, manchmal abgerundet. Im Durchschnitt bleibt die Genauigkeit perfekt. Es ist wie ein faires Spiel, bei dem das Haus nicht schummelt.
Die „Geheimzutat“ für die Attention
Es gibt einen kniffligen Teil des KI-Gehirns namens „Attention“ (Aufmerksamkeit), bei dem das Modell entscheidet, welche Wörter in einem Satz wichtig sind. Dieser Teil ist super sensibel. Wenn man hier die einfachen FP4-Zahlen verwendet, wird die KI verwirrt.
Deshalb entwickelten die Autoren eine Mixed-Precision-Strategie. Sie nutzen die hocheffizienten FP4-Zahlen für die Hauptarbeit (die mathematischen Grundoperationen), aber sie verwenden ein etwas präziseres Format (MXFP8) speziell für den „Attention“-Teil. Das ist so, als würde man eine grobe, schnelle Schaufel zum Graben eines großen Lochs benutzen, aber zu einem präzisen Kellenwerkzeug wechseln, sobald man das empfindliche Blumenbeet in der Mitte bearbeitet. Dies hält das gesamte System schnell und effizient, während die sensibelsten Teile geschützt werden.
Funktioniert es tatsächlich?
Das Team testete diese Idee an einigen sehr großen KI-Modellen, einschließlich Modellen mit bis zu 30 Milliarden Parametern (das sind sehr viele Gehirnzellen!). Sie trainierten sie auf bis zu 100 Milliarden Token (Wörter und Symbole).
Die Ergebnisse waren beeindruckend:
- Stabilität: Die Modelle trainierten von Anfang bis Ende reibungslos. Die alten Methoden, die dieses 2D-Quadrat-Trick nicht verwendeten, brachen frühzeitig ab.
- Leistung: Die mit dieser neuen Methode trainierten KI-Modelle schnitten fast identisch ab wie Modelle, die mit den langsamen, schweren, hochpräzisen Zahlen trainiert wurden. Der Qualitätsunterschied war minimal – in einigen Tests weniger als 1,3 %.
- Effizienz: Sie sparten eine massive Menge an Speicher (etwa 65 % weniger) und könnten theoretlich 3,5-mal schneller laufen auf zukünftiger Hardware, die speziell dafür entwickelt wurde.
Das Fazit
Dieses Papier legt nahe, dass die größte Hürde für ein super-effizientes KI-Training nicht nur darin besteht, kleinere Zahlen zu verwenden, sondern sicherzustellen, dass diese Zahlen konsistent bleiben, egal aus welcher Perspektive die KI sie betrachtet. Durch den Wechsel von unordentlichen, sich verschiebenden Reihen zu sauberen, stabilen Quadraten haben die Autoren einen Weg gefunden, das KI-Training sowohl blitzschnell als auch absolut solide zu machen.
Natürlich gibt es noch Hürden. Das Team musste dies auf aktuellen Computern simulieren, da die speziellen Chips, die diese Mathematik nativ ausführen können, noch nicht weit verbreitet sind. Aber die Mathematik geht auf, und der Weg nach vorne ist klar: Wenn wir wollen, dass KI schneller und günstiger wird, müssen wir aufhören, die Zahlen zu vertauschen, und die Regeln konsistent halten.
Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?
Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.