← Neueste Arbeiten
🤖 machine learning

FOAM: Blocked State Folding for Memory-Efficient LLM Training

Ursprüngliche Autoren: Ziqing Wen, Jiahuan Wang, Ping Luo, Dongsheng Li, Tao Sun

Veröffentlicht 2026-05-14
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Ziqing Wen, Jiahuan Wang, Ping Luo, Dongsheng Li, Tao Sun

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einem riesigen, superschlauen Roboter (ein Large Language Model) beizubringen, zu schreiben, zu chatten und zu reasoning. Um dies zu tun, zeigen Sie ihm eine massive Bibliothek voller Bücher (Trainingsdaten). Der Roboter lernt, indem er Fehler macht, seine Arbeit überprüft und seine internen „Gehirneinstellungen" (Parameter) anpasst, um besser zu werden.

Die Standardmethode für diese Anpassung ist wie ein sehr sorgfältiger Buchhalter namens Adam. Adam führt für jede einzelne Gehirneinstellung ein detailliertes Hauptbuch, das nicht nur den aktuellen Fehler, sondern auch die Geschichte vergangener Fehler verfolgt, um zu entscheiden, wie stark die Dinge geändert werden müssen.

Das Problem: Der Buchhalter ist zu schwer
Das Problem ist, dass dieser „Buchhalter" (der Optimierer) unglaublich schwer ist. Für einen Roboter mit Milliarden von Gehirneinstellungen nimmt das Hauptbuch des Buchhalters doppelt so viel Speicherplatz ein wie das Gehirn des Roboters selbst.

  • Analogie: Stellen Sie sich vor, Sie versuchen, ein Haus zu verlegen. Das Mobiliar (das Modell) ist groß, aber der Umzugswagen (die Optimierer-Zustände) ist noch größer. Wenn Sie nur einen kleinen Lkw haben (begrenzter Computerspeicher), können Sie das Haus gar nicht verlegen, egal wie gut das Haus ist. Dies ist die „Speicherengpass", der Forscher daran hindert, größere, schlauere Roboter zu trainieren.

Die alten Lösungen: Ecken schneiden
Bisherige Versuche, den Umzugswagen zu verkleinern, hatten Mängel:

  1. Teile des Hauses einfrieren: Sie bewegen einige Möbel nicht mehr und stellen nur ein paar kleine Kartons ein. Dies spart Platz, macht das Haus aber weniger flexibel (geringere Leistung).
  2. Unschärfe Fotos machen: Statt das eigentliche Mobiliar zu bewegen, machen Sie niedrig aufgelöste Fotos davon, um Platz zu sparen. Aber das Berechnen dieser Fotos kostet viel Zeit und Energie (Rechen-Overhead).
  3. Hauptbücher teilen: Sie lassen verschiedene Zimmer dasselbe Notizbuch teilen. Dies spart Platz, macht die Anpassungen aber weniger präzise.

Die neue Lösung: FOAM (Die intelligente Faltmethode)
Die Arbeit stellt FOAM (Folded Optimizer with Approximate Moment) vor. Stellen Sie sich FOAM als einen Meister-Packer vor, der eine clevere „Falt"-Technik verwendet, um den riesigen Umzugswagen in einen winzigen Lieferwagen zu packen, ohne wichtige Details zu verlieren.

So funktioniert FOAM, unter Verwendung einfacher Metaphern:

1. Die „Block-Faltung" (Komprimierung)

Statt jede einzelne Gehirneinstellung individuell zu verfolgen, gruppiert FOAM sie in kleine Blöcke (wie ein Gitter aus 8 oder 16 Einstellungen).

  • Die Metapher: Stellen Sie sich vor, Sie haben eine lange Reihe von 100 Personen, und Sie müssen ihre durchschnittliche Körpergröße merken. Statt 100 separate Zahlen aufzuschreiben, gruppieren Sie sie in 10 Teams von je 10 Personen. Sie schreiben nur eine Zahl auf: die durchschnittliche Körpergröße jedes Teams.
  • Das Ergebnis: Dies verringert den für das „Hauptbuch" benötigten Speicherplatz enorm (bis zu 90 % weniger).

2. Die „Residual-Korrektur" (Das Sicherheitsnetz)

Wenn Sie nur die Durchschnitte verwenden würden, würden Sie die einzigartigen Details jeder Person verlieren. Vielleicht ist eine Person in einem Team sehr groß und eine andere sehr klein. Der Durchschnitt verbirgt das.

  • Die Metapher: FOAM ist schlau. Nachdem es den „Team-Durchschnitt" aufgeschrieben hat, berechnet es schnell die Differenz (den Fehler) zwischen den echten Personen und dem Durchschnitt. Es nennt dies den „Residual".
  • Der Trick: Es behält diese Differenz nicht für immer. Es berechnet sie, nutzt sie, um das Update für diesen spezifischen Moment zu korrigieren, und wirft sie dann weg. Es ist wie ein Koch, der eine Suppe probiert, das Salz anpasst und dann den genauen Geschmack des Löffels vergisst, anstatt eine Aufzeichnung über jeden je probierten Löffel zu führen.
  • Warum es wichtig ist: Dies stellt sicher, dass der Roboter immer noch die einzigartigen Details jeder einzelnen Gehirneinstellung lernt, obwohl der Speicher komprimiert ist.

3. Das „Entfalten" (Wiederherstellung)

Wenn es Zeit ist, das Gehirn des Roboters tatsächlich zu aktualisieren, nimmt FOAM diese komprimierten „Team-Durchschnitte" und erweitert sie wieder auf die volle Größe, wobei es die „Residual"-Korrekturen oben drauflegt.

  • Das Ergebnis: Der Roboter erhält eine präzise Aktualisierung, genau wie mit dem schweren Buchhalter, aber der Computer musste nur die winzige gefaltete Version tragen.

Was die Arbeit behauptet (Die Ergebnisse)
Die Autoren testeten FOAM beim Training verschiedener Roboter-Modelle (von kleinen 60-Millionen-Parameter-Modellen bis hin zu großen 7-Milliarden-Parameter-Modellen). Hier ist, was sie herausfanden:

  • Massive Speichereinsparungen: FOAM reduziert den für den Optimierer benötigten Speicher um bis zu 90 %. Insgesamt verringert es den Speicherbedarf des Trainings um etwa 50 %. Das bedeutet, Sie können größere Modelle auf derselben Hardware trainieren oder dieselben Modelle viel schneller trainieren.
  • Kein Leistungsverlust: Trotz der starken Komprimierung performen die mit FOAM trainierten Modelle genauso gut (oder manchmal sogar besser) als Modelle, die mit dem Standard-schweren Buchhalter trainiert wurden. Sie lernen schneller und erreichen eine höhere Genauigkeit.
  • Geschwindigkeit: Da es keine schwere Last tragen muss, ist der Trainingsprozess schneller.
  • Vielseitigkeit: Es funktioniert bei verschiedenen Arten von Roboter-Architekturen (wie LLaMA, Qwen und anderen) und kann sogar mit anderen speichersparenden Tricks kombiniert werden.

Auf den Punkt gebracht
FOAM ist wie ein magischer Koffer. Es ermöglicht Ihnen, eine massive Menge an Informationen (den Speicher des Optimierers) in einen winzigen Raum zu packen, indem Sie ihn ordentlich falten und eine schnelle „Korrektur-Notiz" hinzufügen, um sicherzustellen, dass nichts verloren geht. Dies ermöglicht es Forschern, intelligentere, größere KI-Modelle zu bauen, ohne super-teure, massive Computer zu benötigen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →