← Neueste Arbeiten
📊 statistics

Numerical stability analysis of large language models

Diese Arbeit präsentiert eine Mixed-Precision-Analyse der Transformer-Inferenz, die neuartige Fehlerschranken und Stabilitätsbedingungen für Schlüsselkomponenten wie LayerNorm, RMSNorm und Self-Attention herleitet und letztlich aufzeigt, dass die numerische Stabilität durch das Zusammenspiel zwischen Gewichtsmagnituden und dem Wachstum des Residual-Streams bestimmt wird, eine Erkenntnis, die durch Experimente an GPT-2 validiert wurde.

Ursprüngliche Autoren: Stanislav Budzinskiy, Wenyi Fang, Longbin Zeng, Philipp Petersen

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Stanislav Budzinskiy, Wenyi Fang, Longbin Zeng, Philipp Petersen

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich ein Large Language Model (wie die, die Chatbots antreiben) als eine riesige, mehrstöckige Fabrik vor. In dieser Fabrik fließt Information vom Erdgeschoss bis in das oberste Stockwerk und passiert dabei hunderte von Räumen (Layern). In jedem Raum wird die Information verarbeitet, gemischt und umgeformt, bevor sie an den nächsten Raum weitergegeben wird.

Das von Ihnen bereitgestellte Dokument ist ein Sicherheitsinspektionsbericht für diese Fabrik. Die Autoren stellen die Frage: "Wenn wir im ersten Raum mit einem winzigen, fast unsichtbaren Staubkorn (einem winzigen Computer-Rundungsfehler) beginnen, wie groß wird dieses Staubkorn sein, wenn es das oberste Stockwerk erreicht?"

Hier ist eine Aufschlüsselung ihrer Ergebnisse unter Verwendung einfacher Analogien:

1. Die „Low-Precision“-Abkürzung

Um diese Fabriken schnell und kostengünstig zu betreiben, verwenden Ingenieure oft „Low-Precision“-Mathematik (Mathematik mit geringer Präzision). Denken Sie an das Messen von Zutaten mit einem Lineal, das nur Zollstriche statt Millimeterstriche hat. Es ist schneller, aber man verliert ein wenig an Genauigkeit.

  • Das Problem: Wenn man tausende Berechnungen hintereinander durchführt, können sich diese winzigen „Zollstrich“-Fehler anhäufen. Die Autoren wollten wissen: Bricht die Fabrik unter dem Gewicht dieser winzigen Fehler zusammen oder bleibt sie stabil?

2. Die „Normalisierungs-Türen“ (LayerNorm vs. RMSNorm)

Bevor die Information einen neuen Raum betritt, muss sie durch eine „Normalisierungstür“ gehen, die die Größe der Daten anpasst.

  • Die alte Tür (LayerNorm): Diese Tür subtrahiert die durchschnittliche Größe der Daten. Die Autoren fanden heraus, dass diese Tür wackelig werden kann, wenn die Daten einen massiven Ausreißer haben (eine einzige riesige Zahl, die viel größer ist als der Rest). Es ist, als würde man versuchen, eine Wippe auszubalancieren, auf deren einer Seite ein Elefant und auf der anderen ein Mäuschen sitzt; die Mathematik wird dadurch empfindlich.
  • Die neue Tür (RMSNorm): Dies ist die moderne Tür, die in Top-Modellen verwendet wird. Sie subtrahiert nicht den Durchschnitt, sondern skaliert lediglich basierend auf der Gesamtgröße. Die Autoren fanden heraus, dass diese Tür bedingungslos stabil ist. Selbst mit diesem Elefanten auf der Wippe hält die Tür stand. Es ist ein robusteres Design.

3. Das „Attention“-Spotlight (Aufmerksamkeits-Scheinwerfer)

Der berühmteste Teil dieser Modelle ist die „Self-Attention“, die entscheidet, welche Wörter in einem Satz wichtig füreinander sind.

  • Der „Softmax“-Schalter: Dies ist der Mechanismus, der Rohwerte in Wahrscheinlichkeiten (Prozentzahlen) umwandelt. Die Autoren analysierten einen gängigen Trick namens „Shifting“ (das Subtrahieren der größten Zahl vor der Berechnung), um zu verhindern, dass die Mathematik explodiert (überläuft).
  • Das Ergebnis: Sie haben bewiesen, dass dieser „Shifting“-Trick sicher ist. Er mag das System etwas empfindlicher gegenüber Rauschen machen (höchstens um den Faktor 4), aber er bringt die Mathematik nicht zum Einsturz. Es ist, als würde man eine Sonnenbrille tragen, um in die Sonne zu schauen; es verändert die Art und Weise, wie man Dinge sieht, ein wenig, aber es macht einen nicht blind.
  • Der „Attention Sink“: Sie bemerkten auch, dass sich das Modell in langen Gesprächen oft stark auf die ersten paar Wörter konzentriert (den „Sink“). Ihre Mathematik zeigt, dass die Fehler bei diesen langen Sequenzen nicht so sehr außer Kontrolle geraten, wie alte Theorien vermuten ließen.

4. Der „Residual Stream“ (Das Förderband)

Die Daten fließen auf einem „Residual Stream“ durch die Fabrik – einem Förderband, das die Hauptbotschaft vorwärts trägt.

  • Das Wachstum: Während die Daten in die oberen Stockwerke wandern, wird das Förderband von Natur aus „schwerer“ (die Zahlen werden größer).
  • Die Gewichte: Die Maschinen auf dem Förderband (die Gewichte) werden skaliert, während die Fabrik höher wird, um das Gleichgewicht zu halten.
  • Die große Entdeckung: Die Autoren fanden eine goldene Regel: Wenn man das Förderband hoch oder runter skaliert, bleibt der relative Fehler gleich.
    • Analogie: Stellen Sie sich vor, Sie gehen auf einem Laufband. Wenn Sie die Geschwindigkeit des Laufbands verdoppeln und gleichzeitig die Größe Ihrer Schuhe verdoppeln, ändert sich Ihr Gangstil (relativ zu Ihrer Größe) nicht.
    • Die Einschränkung: Dies funktioniert nur, wenn das Förderband „linear“ (vorhersehbar) agiert. Wenn man die Gewichte zu stark skaliert, könnte das Förderband plötzlich in einen völlig anderen Betriebsmodus wechseln (einen „qualitativen Übergang“). In diesem speziellen Fall bricht die Stabilität zusammen. Aber solange das Band in seinem normalen Rhythmus bleibt, schadet die Skalierung der Gewichte der Genauigkeit nicht.

5. Das „GPT-2“-Experiment

Um zu beweisen, dass ihre Mathematik nicht nur Theorie war, testeten sie sie an einem echten Modell namens GPT-2.

  • Zufällige Gewichte: Als sie ein Modell mit zufälligen, ungetrainierten Gewichten verwendeten, wuchsen die Fehler langsam und vorhersehbar.
  • Trainierte Gewichte: Als sie ein echtes, trainiertes Modell verwendeten, wuchsen die Fehler etwas schneller (exponentiell), aber immer noch innerhalb beherrschbarer Grenzen.
  • Das Urteil: Die Mathematik hielt stand. Der „relative Fehler“ (der Fehler im Verhältnis zur Größe der Daten) blieb konsistent, es sei denn, man zwang das Modell durch zu drastische Änderungen der Gewichte in einen seltsamen, instabilen Zustand.

Zusammenfassung

Das Paper kommt zu dem Schluss, dass Large Language Models numerisch stabil sind.
Obwohl sie eine „grobe“ Mathematik (Low Precision) verwenden und mit massiven Zahlen umgehen müssen, ist die Architektur so konzipiert, dass die Fehler nicht zu einer Katastrophe anschwellen. Der Schlüssel zu dieser Stabilität ist das Zusammenspiel zwischen der Größe der Gewichte und dem Wachstum des Datenstroms. Solange das Modell nicht in einen seltsamen, instabilen Zustand gedrängt wird, bleibt das durch die Low-Precision-Mathematik eingeführte „Rauschen“ ein winziges, handhabbares Staubkorn und kein Erdrutsch.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →