← Neueste Arbeiten
🤖 machine learning

FORGE: Fused On-Register Gradient Elimination for Memory-Efficient LLM Training

FORGE ist eine speichereffiziente LLM-Trainingsmethode, die den Optimierungsschritt in den Backward-Pass integriert, um materialisierte Gradienten zu eliminieren, indem sie diese vollständig in Registern verarbeitet, wodurch der Speicherbedarf des Optimierers halbiert, das Training beschleunigt und die volle Präzisionsgenauigkeit bewahrt wird, ohne die zugrunde liegende Update-Logik zu verändern.

Ursprüngliche Autoren: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

Veröffentlicht 2026-06-23
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria, Timothy Liu, Aik Beng Ng, Simon See, Bapi Chatterjee

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Das große Problem: Die „überladene Werkstatt“

Stellen Sie sich vor, Sie trainieren ein riesiges KI-Modell (wie ein Robotergehirn) auf einem Computer. Um diesen Roboter zu lehren, muss der Computer eine gewaltige Menge an Mathematik betreiben.

Auf die Standard-Art und Weise (genannt „Reverse-mode differentiation“) folgt der Computer einem strengen zweistufigen Prozess:

  1. Die Fehler berechnen: Er schaut sich die Daten an, findet heraus, wo der Roboter einen Fehler gemacht hat, und schreibt eine riesige Liste mit „Korrekturhinweisen“ (Gradienten) für jeden einzelnen Teil des Robotergehirns auf. Er schreibt diese Notizen auf ein riesiges Whiteboard (den Speicher des Computers).
  2. Die Korrekturen anwenden: Erst nachdem das gesamte Whiteboard vollgeschrieben ist, nimmt der Computer einen Radiergummi und einen Marker in die Hand, um das Robotergehirn basament auf Basis dieser Notizen tatsächlich zu aktualisieren.

Der Flaschenhals: Das Problem ist, dass der Computer dieses riesige Whiteboard voller Notizen in seinem Speicher halten muss, während er gleichzeitig auch das Robotergehirn und die Notizen für den nächsten Schritt hält. Dieses „Whiteboard“ nimmt so viel Platz ein, dass der Speicher des Computers oft schon voll ist, bevor das Training überhaupt richtig beginnen kann. Es ist, als würde man versuchen, ein Auto in einer Garage zu reparieren, aber man muss gleichzeitig den gesamten Bauplan des Autos, die Werkzeuge und das Reparaturhandbuch auf dem Boden ausgebreitet halten. Wenn die Garage zu klein ist, passt das Auto gar nicht erst hinein.

Die Lösung: FORGE (Die „Sofort-Fix“-Methode)

Die Autoren dieses Papers, FORGE (Fused On-Register Gradient Elimination), sagen: „Warum überhaupt Notizen auf dem Whiteboard aufschreiben?“

Sie argumentieren, dass die riesige Liste von Notizen nur ein Nebenprodukt dessen ist, wie wir die Mathematik betreiben, und nicht etwas, das der Lernprozess eigentlich benötigt.

Wie FORGE funktioniert:
Anstatt die Notizen aufzuschreiben und sie dann wieder abzulesen, erledigt FORGE die Mathematik und das Reparieren gleichzeitig im schnellsten, kleinsten Speicherbereich des Computers (den sogenannten „Registern“).

  • Die Analogy: Stellen Sie sich einen Meisterkoch vor, der ein komplexes Gericht kocht.
    • Der alte Weg: Der Koch schneidet eine Zwiebel, schreibt „Zwiebel geschnitten“ auf einen Notizblock, legt die Zwiebel in eine Schüssel und geht zum nächsten Zutatenpunkt über. Sobald alle Zutaten geschnitten und aufgelistet sind, liest der Koch den Notizblock und mischt alles zusammen. Der Notizblock nimmt Arbeitsfläche weg.
    • Der FORGE-Weg: Der Koch schneidet eine Zwiebel und wirft sie sofort in den Topf. Dann schneidet er eine Karotte und wirft sie sofort hinein. Er schreibt nie etwas auf. Er braucht keinen Notizblock. Die Arbeitsfläche bleibt frei.

Warum das eine große Sache ist

Das Paper behauptet drei wesentliche Vorteile durch diesen „No-Notes“-Ansatz:

1. Es spart massiv Platz (Speicher)
Da der Computer die riesige Liste von Notizen nie in den Hauptspeicher schreibt, wird eine enorme Menge an Platz frei.

  • Das Ergebnis: Auf einem Standard-Chip (H200) konnten sie ein Modell mit 8 Milliarden Parametern trainieren, wobei sie 53 % weniger Speicher benötigten.
  • Die Analogie: Es ist, als ob man einen Esstisch für 10 Personen in ein Einzimmerapartment stellen könnte, weil man aufgehört hat, die zusätzlichen Stühle im Flur zu lagern.

2. Es ist tatsächlich schneller
Da der Computer nicht anhalten muss, um Notizen zu schreiben, zu warten und sie dann wieder abzulesen, beschleunigt sich der gesamte Prozess.

  • Das Ergebnis: Die Trainingsschritte laufen etwa 1,5-mal schneller.
  • Die Analogie: Es ist der Unterschied zwischen einem Lieferfahrer, der ein Paket abliefert, zurück zum LKW rennt, um das nächste zu holen, und das wiederholt (alter Weg), gegenüber einem Fahrer, der ein Förderband hat, das das Paket direkt auf den LKW lädt, während er es greift (FORGE).

3. Es verliert nicht an Genauigkeit
Normalerweise verliert man etwas Präzision (der Roboter lernt etwas schlechter), wenn man versucht, Platz zu sparen, indem man Schritte überspringt. Die Autoren beweisen, dass sie, da sie die Mathematik in den hochwertigsten „Registern“ (voller Präzision) durchführen, bevor sie die Daten verwerfen, das Lernen mathematisch identisch mit der alten, langsamen Methode ist.

  • Das Ergebnis: Der Roboter lernt genauso gut, aber viel effizienter.

Der „Tile“-Trick

Wie machen sie das ohne Chaos? Sie zerlegen das riesige mathematische Problem in kleine, handhabbare Stücke, sogenannte „Tiles“ (wie 128x128 Quadrate).

  • Sie bearbeiten ein Tile: Berechnen den Fehler, reparieren das Gehirn und werfen den Fehler sofort weg.
  • Dann bewegen sie sich zum nächsten Tile.
  • Da sie dies Tile für Tile tun, muss der Computer niemals die gesamte Liste der Fehler gleichzeitig halten.

Was uns das ermöglicht

Das Paper zeigt, dass man mit FORGE:

  • Größere Modelle auf demselben Computer trainieren kann.
  • Größere „Batches“ verwenden kann (dem Roboter mehr Beispiele gleichzeitig beibringen), ohne dass der Speicher voll läuft.
  • In einem speziellen Test konnten sie ein Modell auf vier GPUs trainieren, das mit der alten Methode acht GPUs benötigt hätte.

Zusammenfassung

FORGE ist eine neue Art, KI zu trainieren, die verhindert, dass der Computer seinen Speicher mit temporären „Korrekturhinweisen“ überlädt. Indem es die Fehler berechnet und das Modell sofort im schnellsten Teil des Chips repariert, halbiert es den Speicherverbrauch und beschleunigt das Training, ohne die KI weniger intelligent zu machen. Es verwandelt eine überladene, langsame Werkstatt in ein effizientes, Hochgeschwindigkeits-Fließband.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →