← Neueste Arbeiten
🤖 machine learning

Normalized Architectures are Natively 4-Bit

Dieser Artikel zeigt, dass nGPT, eine Architektur, die Gewichte und versteckte Zustände auf eine Einheits-Hypersphäre beschränkt, durch konstruktive Signalakkumulation eine natürliche Verbesserung des Signal-zu-Rausch-Verhältnisses ermöglicht und somit stabile und effiziente End-to-End-4-Bit-Training ohne komplexe präziserhaltende Eingriffe erlaubt.

Ursprüngliche Autoren: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Veröffentlicht 2026-05-08
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Maxim Fishman, Brian Chmiel, Ron Banner, Daniel Soudry, Boris Ginsburg

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Den Code mit geringer Präzision knacken

Stellen Sie sich vor, Sie versuchen, eine riesige, unglaublich komplexe Legoburg (ein Large Language Model) zu bauen. Normalerweise verwenden Sie riesige, stabile Steine (Mathematik mit hoher Präzision), um sicherzustellen, dass die Burg hoch steht und nicht zusammenbricht.

Um die Burg jedoch schneller zu bauen und günstiger zu speichern, möchten Ingenieure winzige, zerbrechliche 4-Bit-Legosteine verwenden. Das Problem ist, dass die Burg bei Verwendung dieser winzigen Steine mit Standarddesigns oft einstürzt oder wackelig wird. Um dies zu beheben, müssen Bauherren normalerweise teure Gerüste, zusätzlichen Kleber und komplexe Messwerkzeuge (wie „Randomized Hadamard Transforms" und „per-tensor scaling") hinzufügen, nur um die Struktur vor dem Auseinanderfallen zu bewahren. Diese Reparaturen verlangsamen alles.

Die Lösung: Ein neuer Bauplan (nGPT)

Dieses Paper stellt einen neuen Bauplan namens nGPT vor. Anstatt die zerbrechlichen 4-Bit-Steine mit zusätzlichem Kleber zu flicken, haben die Autoren die Form der Steine selbst verändert.

In nGPT wird jedes Teil des Modells gezwungen, auf einer „Einheits-Hypersphäre" zu bleiben.

  • Die Analogie: Stellen Sie sich vor, ein Standard-Legostein kann jede Größe haben, von einem winzigen Kieselstein bis zu einem riesigen Felsbrocken. Dies macht es schwierig, sie ordentlich zu stapeln, wenn sie alle winzig sind.
  • Die nGPT-Wendung: In nGPT wird jeder Stein gezwungen, genau die gleiche Größe und Form zu haben, wie eine perfekte Murmel. Sie sind alle darauf beschränkt, auf der Oberfläche einer unsichtbaren Kugel zu sitzen.

Das Paper behauptet, dass das Modell aufgrund dieser Formbeschränkung von Natur aus robust ist. Es kann vollständig aus den winzigen 4-Bit-Steinen gebaut werden, ohne dass zusätzliche Gerüste oder Kleber benötigt werden. Es funktioniert einfach.

Warum funktioniert es? Der „Chor"-Effekt

Die Forscher fragten: Warum macht diese Kugelform das Modell so stark?

Sie untersuchten, wie das Modell Mathematik betreibt. Dies geschieht, indem es Tausende von Zahlen nimmt, sie multipliziert und alles addiert (ein „Skalarprodukt").

  1. Der Standardweg (GPT): Stellen Sie sich einen Chor von 4.000 Sängern vor. In einem Standardmodell singen alle Sänger verschiedene Noten in verschiedenen Lautstärken. Wenn man sie addiert, heben sich das Rauschen (Fehler, die durch die winzigen 4-Bit-Steine verursacht werden) zwar auf, aber das eigentliche Lied (das Signal) geht im Chaos verloren. Das Signal ist schwach.
  2. Der nGPT-Weg: Da alle Sänger (Zahlen) gezwungen sind, die gleiche Größe zu haben (auf der Kugel), beginnen sie natürlich, auf eine leicht koordinierte Weise zu singen. Sie sind nicht perfekt synchron, aber sie weisen eine schwache, positive Korrelation auf.
    • Die Analogie: Es ist wie eine Menge, die im Stadion „Die Welle" macht. Selbst wenn die Welle klein ist, baut sie sich, weil sich alle in die gleiche allgemeine Richtung bewegen, zu einer riesigen, kraftvollen Bewegung auf.
    • Das Ergebnis: In nGPT baut sich das „Signal" (die beabsichtigte Mathematik) konstruktiv auf, wie eine koordinierte Welle. Das „Rauschen" (die Fehler der winzigen Steine) hebt sich immer noch wie zufälliges Geplauder auf.

Dies erzeugt ein viel klareres Signal. Das Paper nennt dies ein höheres Signal-Rausch-Verhältnis (SNR).

Der Vorteil der „flachen Landschaft"

Da das Signal so stark und klar ist, wird das Modell sehr stabil.

  • Die Analogie: Stellen Sie sich vor, Sie gehen auf einem Berg.
    • Standardmodell: Es ist wie das Gehen auf einer zerklüfteten, felsigen Klippe. Wenn Sie einen leicht falschen Schritt tun (eine schlechte Lernrate oder ein kleiner mathematischer Fehler), könnten Sie von einer Kante fallen. Sie müssen sehr vorsichtig sein.
    • nGPT-Modell: Es ist wie das Gehen auf einem breiten, flachen Plateau. Sie können große oder kleine Schritte machen, und Sie werden nicht herunterfallen. Sie können in jede Richtung gehen, ohne befürchten zu müssen, zu Abstürzen.

Dies bedeutet, dass Ingenieure keine Stunden damit verbringen müssen, die „Lernrate" (wie schnell das Modell lernt) zu justieren. Die Einstellungen, die für die großen, schweren Steine funktionieren, funktionieren auch perfekt für die winzigen 4-Bit-Steine.

Was sie getestet haben

Die Autoren sprachen nicht nur über Theorie; sie bauten und testeten diese Modelle:

  • Kleiner Maßstab: Sie testeten ein Modell mit 1,2 Milliarden Parametern.
  • Großer Maßstab: Sie testeten massive „Mixture of Experts"-Modelle mit bis zu 30 Milliarden Parametern.
  • Das Ergebnis: In jedem Fall trainierten die nGPT-Modelle erfolgreich unter Verwendung ausschließlich von 4-Bit-Mathematik. Sie benötigten nicht den zusätzlichen „Kleber" (RHT oder Skalierung), den Standardmodelle erfordern. Tatsächlich waren die nGPT-Modelle oft genauer und schneller, weil sie keine zusätzliche Arbeit leisten mussten, um die mathematischen Fehler zu beheben.

Das Fazit

Das Paper argumentiert, dass wir nicht nur versuchen sollten, Mathematik mit geringer Präzision mit komplizierten Patches zu reparieren. Stattdessen sollten wir die Architektur selbst so entwerfen, dass sie „quantisierungsbereit" ist. Indem wir das Modell in eine kugelförmige Form zwingen, wird die Mathematik von Natur aus robust genug, um die winzigen 4-Bit-Steine zu bewältigen, was KI schneller, günstiger und einfacher zu trainieren macht, ohne an Qualität zu verlieren.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →