← Neueste Arbeiten
💬 NLP

Folding Tensor and Sequence Parallelism for Memory-Efficient Transformer Training & Inference

Dieser Beitrag stellt Tensor- und Sequenzparallelismus (TSP) vor, eine neuartige Ausführungsstrategie, die Gewichts- und Token-Sharding auf eine einzige Geräteachse zusammenführt, um gleichzeitig den Speicherbedarf für Parameter und Aktivierungen zu senken und eine hardware-effiziente Alternative für das Training und die Inferenz von Transformer-Modellen mit langen Kontexten und begrenztem Speicher anzubieten.

Ursprüngliche Autoren: Vasu Shyam, Anna Golubeva, Quentin Anthony

Veröffentlicht 2026-04-30
📖 5 Min. Lesezeit🧠 Tiefgang

Ursprüngliche Autoren: Vasu Shyam, Anna Golubeva, Quentin Anthony

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, ein riesiges Puzzle mit einer Gruppe von Freunden zu lösen, aber Sie haben nur einen sehr kleinen Tisch (den Arbeitsspeicher Ihres Computers), um daran zu arbeiten. Das Puzzle ist so groß, dass keine einzelne Person alle Teile gleichzeitig halten kann.

Dieser Artikel stellt eine neue Methode vor, mit der ein Team von Computern (GPUs) zusammenarbeitet, um riesige KI-Modelle zu trainieren, die im Wesentlichen diese massiven Puzzles sind. Die Autoren nennen ihre neue Strategie TSP (Tensor- und Sequenzparallelismus).

Hier ist die Aufschlüsselung mit einfachen Analogien:

Das Problem: Zwei alte Wege, die Arbeit zu teilen

Um das Puzzle zu lösen, verwendet das Team normalerweise eine von zwei alten Methoden, aber beide haben Mängel:

  1. Die „Gewichtsaufteilung"-Methode (Tensor Parallelism):
    Stellen Sie sich vor, die Puzzleteile sind die „Regeln" des Spiels (die Gewichte des Modells). Bei dieser Methode schneiden Sie das Regelbuch in zwei Hälften. Person A hält die erste Hälfte der Regeln, und Person B hält die zweite Hälfte.

    • Das Gute: Sie sparen Platz auf dem Tisch, weil Sie nicht das gesamte Regelbuch doppelt speichern müssen.
    • Das Schlechte: Wenn das Puzzle eine lange Geschichte hat (eine lange Wortsequenz), muss jeder immer noch die gesamte Geschichte in den Händen halten, um zu spielen. Wenn die Geschichte riesig ist, werden Ihre Hände (der Speicher) voll, und Sie stürzen ab.
  2. Die „Geschichtsaufteilung"-Methode (Sequence Parallelism):
    Stellen Sie sich vor, die Puzzleteile sind die Geschichte selbst. Bei dieser Methode hält Person A die erste Hälfte der Geschichte, und Person B hält die zweite Hälfte.

    • Das Gute: Sie sparen Platz auf dem Tisch, weil Sie nicht die ganze Geschichte auf einmal halten müssen.
    • Das Schlechte: Jeder muss immer noch das gesamte Regelbuch auswendig lernen. Wenn das Regelbuch riesig ist, wird Ihr Gehirn (der Speicher) voll, und Sie stürzen ab.

Der alte Hybrid: Normalerweise versuchen Teams, beides zu tun, indem sie zwei separate Gruppen von Freunden einsetzen. Eine Gruppe teilt die Regeln auf, und eine andere Gruppe teilt die Geschichte auf. Dies ist jedoch ineffizient, da es alle Ihre Freunde nur für die Arbeitsteilung beansprucht, sodass niemand übrig bleibt, um bei anderen Aufgaben zu helfen (wie beim Datenparallelismus).

Die Lösung: Die „gefoldete" Methode (TSP)

Die Autoren sagen: „Warum zwei separate Gruppen verwenden? Lassen Sie uns die Arbeit auf eine einzige Achse falten."

Bei TSP macht jede einzelne Person in der Gruppe beide Dinge gleichzeitig:

  • Sie hält einen Schnitt des Regelbuchs (Gewichte).
  • Sie hält einen Schnitt der Geschichte (Sequenz).

Die Analogie:
Stellen Sie sich vor, Sie sind auf einer Dinnerparty.

  • Alter Weg: Sie haben einen Tisch, an dem eine Person das Menü (Gewichte) herumreicht, während alle das ganze Buch lesen. An einem anderen Tisch gibt es Leute, die das Buch (Geschichte) herumreichen, während alle das ganze Menü auswendig lernen.
  • TSP-Weg: Jeder am Tisch bekommt ein kleines Stück des Menüs und ein kleines Stück der Geschichte.

Wie sie es zum Funktionieren bringen (Die Zaubertricks)

Da jeder ein winziges Stück des Menüs und ein winziges Stück der Geschichte hat, müssen sie viel miteinander sprechen, um das Puzzle zu lösen. Der Artikel beschreibt zwei clevere Wege, wie sie dies tun, ohne überwältigt zu werden:

  1. Für die „Geschichte"-Teile (Attention):
    Stellen Sie sich vor, die Gruppe muss die ganze Geschichte kennen, um einen bestimmten Satz zu verstehen. Anstatt dass alle gleichzeitig die ganze Geschichte herausschreien, nehmen sie sich abwechselnd. Eine Person sendet ihr Stück des Menüs an alle. Dann berechnet jeder seinen Teil der Geschichte, und sie tauschen schnell ihre Geschichtsstücke (Schlüssel und Werte) aus, um den vollständigen Kontext wiederherzustellen. Es ist wie eine Staffel, bei der sie den Staffelstab (Daten) laufen lassen, während sie rennen.

  2. Für die „Regeln"-Teile (MLP):
    Stellen Sie sich vor, die Gruppe muss verschiedene Regeln auf ihre Geschichtsstücke anwenden. Anstatt innezuhalten und die Regeln herausschreien zu müssen, reichen sie die Seiten des Regelbuchs im Kreis (einem Ring) herum. Person A führt ihre Mathematik mit Seite 1 durch, reicht dann Seite 1 an Person B weiter, während Person B Seite 2 an Person C weitergibt. Während die Seiten sich bewegen, sind alle damit beschäftigt, Mathematik zu betreiben. Dies hält den „Verkehr" in Bewegung, während die „Arbeit" erledigt wird.

Warum ist dies besser?

Der Artikel behauptet, TSP sei eine „hardwarebewusste" Lösung, was bedeutet, dass sie speziell dafür entwickelt wurde, wie moderne Computerchips miteinander kommunizieren.

  • Speichereinsparungen: Da jeder ein Stück der Regeln und ein Stück der Geschichte hält, sinkt der auf jedem Computer benötigte Speicher erheblich. Dies ermöglicht dem Team, viel längere Geschichten (längeren Kontext) zu verarbeiten, ohne den Speicher zu erschöpfen.
  • Geschwindigkeit: Obwohl sie mehr Daten hin und her senden (was langsamer klingt), tun sie dies so, dass es sich mit ihrem Denken überlappt. Das „Senden" geschieht, während sie „denken", sodass die Gesamtzeit nicht viel länger wird.
  • Platz im Raum: In einem Computercluster ist die schnellste Verbindung normalerweise zwischen Chips auf derselben Maschine (wie Personen, die am selben Tisch sitzen). Die langsamere Verbindung besteht zwischen verschiedenen Maschinen (Personen in verschiedenen Räumen).
    • Alte Methoden zwangen das Team oft, sich auf verschiedene Räume aufzuteilen, was sie verlangsammte.
    • TSP ermöglicht es, dass das gesamte „aufgeteilte" Team auf einer einzigen Maschine (einem Tisch) Platz findet und sie in der schnellen Spur hält.

Die Ergebnisse

Die Autoren testeten dies auf einem massiven Cluster von 1.024 leistungsstarken GPUs (MI300X).

  • Speicher: TSP verwendete bei jedem Test den geringsten Speicherverbrauch, insbesondere wenn die Geschichten sehr lang waren.
  • Geschwindigkeit: TSP war genauso schnell oder schneller als die alten Methoden.
  • Skalierbarkeit: Als sie dem Team mehr Computer hinzufügten, funktionierte TSP weiterhin gut, während die alten Methoden begannen, mit Speichergrenzen zu kämpfen.

Kurz gesagt: TSP ist eine intelligentere Art, ein Team von Computern zu organisieren. Anstatt die „Regeln" und die „Geschichte" in separate Gruppen aufzuteilen, kombiniert es sie, sodass jeder Computer ein wenig von beidem hält. Dies spart Platz, ermöglicht längere Geschichten und hält das Team effizient im selben schnellen Netzwerk am Laufen.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →