← Neueste Arbeiten
🤖 machine learning

Learning Rate Transfer in Normalized Transformers

Dieser Beitrag stellt ν\nuGPT vor, eine neuartige Parametrisierung des Normalized Transformer, die Ausrichtungsexponenten nutzt, um eine Lernratenübertragung über Modellbreite, -tiefe und Token-Horizont hinweg zu erreichen und damit eine wesentliche Einschränkung des ursprünglichen nGPT adressiert.

Ursprüngliche Autoren: Boris Shigida, Boris Hanin, Andrey Gromov

Veröffentlicht 2026-05-01
📖 6 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Boris Shigida, Boris Hanin, Andrey Gromov

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Bild: Das „Goldlöckchen"-Problem

Stellen Sie sich vor, Sie backen einen riesigen Kuchen (ein massives KI-Modell). Sie haben ein Rezept für einen kleinen Cupcake (ein winziges Modell). Sie wissen genau, wie viel Zucker und Hitze (Hyperparameter wie die Lernrate) für den Cupcake funktionieren.

Das Problem? Wenn Sie blindlings die Zutaten für einen größeren Kuchen verdoppeln, könnte er verbrennen oder roh bleiben. In der KI funktioniert es so: Wenn Forscher Modelle vergrößern (breiter oder tiefer), funktionieren die „perfekten" Einstellungen für das kleine Modell normalerweise nicht mehr für das große. Man muss von vorne beginnen und die neuen Einstellungen raten, was langsam und teuer ist.

Dieses Papier stellt eine neue Methode vor, um diese „Kuchen" (genannt nGPT-Modelle) zu backen, sodass die Einstellungen, die Sie für ein kleines Modell finden, perfekt für einen riesigen funktionieren, ohne dass man raten muss. Sie nennen dieses neue Rezept νGPT (ausgesprochen „nu-GPT").


Die Zutaten: Was ist nGPT?

Zunächst arbeiten die Autoren mit einer bestimmten Art von KI namens nGPT (Normalized Transformer).

  • Der alte Weg: Traditionelle KI-Modelle sind wie ein Auto mit einem sehr empfindlichen Motor. Wenn Sie zu stark auf das Gas drücken (hohe Lernrate), explodiert der Motor. Wenn Sie zu sanft drücken, kommt es nirgendwohin. Um es sicher zu halten, benötigen Sie eine „Bremse" namens Weight Decay (Gewichtsabfall) und müssen den Motor langsam „aufwärmen", bevor Sie schnell fahren.
  • Der nGPT-Weg: Das nGPT-Modell ist wie ein Auto mit einer selbststabilisierenden Federung. Es hält Geschwindigkeit und Balance von Natur aus im Griff. Deshalb braucht es keine „Bremsen" (Weight Decay) oder ein „Aufwärmen". Es trainiert schneller und ist effizienter.

Der Haken: Obwohl nGPT großartig ist, stellten die Autoren fest, dass sich seine „Geschwindigkeitseinstellungen" (Lernraten) immer noch nicht gut übertragen ließen. Wenn man die Geschwindigkeit für ein kleines nGPT abstimmt und dann versucht, dieselben Einstellungen für ein riesiges nGPT zu verwenden, performt das große Modell schlecht.

Die Lösung: Das νGPT-Rezept

Die Autoren haben νGPT entwickelt. Stellen Sie sich dies als eine neue Anleitung vor, wie man die Zutaten basierend auf der Größe des Kuchens skaliert.

Sie entdeckten drei spezifische Regeln, um die Einstellungen perfekt zu „übertragen":

1. Die Token-Horizont-Regel (Die „Distanz"-Regel)

  • Das Konzept: Stellen Sie sich vor, Sie trainieren einen Hund. Wenn Sie ihn nur 10 Minuten spazieren führen, können Sie schnell laufen. Wenn Sie planen, ihn 10 Stunden zu führen, müssen Sie langsamer beginnen, damit er sich nicht erschöpft.
  • Die Erkenntnis: Das Papier fand heraus, dass die Lernrate nicht so schnell sinken sollte, wie die Leute dachten, wenn die KI „länger läuft" (mehr Datentokens verarbeitet). Anstatt wie ein schwerer Stein zu fallen, sollte sie wie eine Feder herabschweben.
  • Die Mathematik: Sie fanden heraus, dass die Geschwindigkeit um die Kubikwurzel der gelaufenen Zeit sinken sollte (spezifisch die 1/31/3-Potenz), nicht um die Quadratwurzel (1/21/2), wie andere Theorien nahelegten.

2. Die Breiten-Regel (Die „Teamgröße"-Regel)

  • Das Konzept: Stellen Sie sich einen Chor vor. Wenn Sie die Anzahl der Sänger verdoppeln (Breite), wird der Sound lauter. Wenn Sie die Lautstärke des Dirigenten (Lernrate) nicht anpassen, könnte der Chor zu laut werden und verzerrt klingen oder zu leise, um gehört zu werden.
  • Die Erkenntnis: Die Autoren stellten fest, dass bei diesen spezifischen Modellen die „Stimmen" (Aktivierungen) und die „Sänger" (Gewichte) nicht perfekt übereinstimmen. Sie sind nur teilweise abgestimmt.
  • Die Korrektur: Sie passten die Lernrate für die verborgenen Teile des Modells so an, dass sie um einen bestimmten Betrag (3/43/4-Potenz) sinkt, wenn das Modell breiter wird. Dies unterscheidet sich von früheren Theorien (wie μ\muP), die davon ausgingen, dass Stimmen und Sänger perfekt abgestimmt sind. Indem sie annahmen, dass sie nur teilweise abgestimmt sind, fanden sie eine „goldene Mitte", die besser funktioniert.

3. Die Tiefen-Regel (Die „Schicht"-Regel)

  • Das Konzept: Stellen Sie sich ein Staffellauf vor. Wenn Sie mehr Läufer (Schichten) zum Team hinzufügen, wird der Stab dann schneller oder langsamer übergeben?
  • Die Erkenntnis: Überraschenderweise muss für diese spezifische Modellart die Lernrate für die verborgenen Schichten nicht viel ändern, wenn Sie mehr Schichten hinzufügen. Das Modell ist von Natur aus stabil. Allerdings stellten sie fest, dass die „Start"-Einstellungen (Initialisierung) für die allererste und die allerletzte Schicht eine winzige Anpassung benötigen, um den Lauf reibungslos zu halten.

Die Ergebnisse: Warum es wichtig ist

Die Autoren testeten dieses neue νGPT-Rezept gegen das alte.

  • Der alte Weg (nGPT): Als sie das Modell vergrößerten, war die Performanzkurve chaotisch. Die „beste" Lernrate für ein kleines Modell war die „schlechteste" für ein großes Modell.
  • Der neue Weg (νGPT): Als sie das Modell vergrößerten, war die Performanzkurve perfekt. Die Lernrate, die für das kleine Modell funktionierte, funktionierte auch für das große Modell, und das größere Modell performte genauso gut (oder sogar etwas besser) als wenn sie es von Grund auf neu abgestimmt hätten.

Zusammenfassende Analogie

Stellen Sie sich die Lernrate als den Lautstärkeregler an einem Radio vor.

  • Alte Theorie: „Wenn Sie einen größeren Lautsprecher kaufen (breiteres Modell), müssen Sie den Lautstärkeregler um die Hälfte herunterdrehen."
  • Die Entdeckung des Papiers: „Tatsächlich müssen Sie, wegen der Funktionsweise dieses spezifischen Lautsprechers, den Lautstärkeregler nur um einen bestimmten, berechneten Betrag herunterdrehen (die 3/43/4-Regel), um den perfekten Klang zu erhalten. Wenn Sie diese Regel befolgen, können Sie einen Lautsprecher kaufen, der 100-mal größer ist, und dieselbe Lautstärkeeinstellung wird perfekt klingen."

Was sie NICHT behauptet haben

  • Sie haben nicht behauptet, dass dies KI intelligenter macht oder ihr ermöglicht, neue Dinge zu tun (wie Krankheiten zu heilen).
  • Sie haben nicht behauptet, dass dies für jeden KI-Modelltyp funktioniert (es ist spezifisch für Normalized Transformers/nGPT).
  • Sie haben nicht behauptet, dass dies die Notwendigkeit des Abstimmens vollständig eliminiert; es bedeutet nur, dass Sie ein kleines Modell abstimmen können und darauf vertrauen können, dass es für ein großes Modell funktioniert.

Kurz gesagt: Das Papier bietet einen mathematischen „Übersetzungsleitfaden", der es Ingenieuren ermöglicht, die Einstellungen von einer kleinen, schnellen KI zu nehmen und sie mit Zuversicht auf eine massive KI anzuwenden, wodurch Zeit und Rechenleistung gespart werden.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →