← Neueste Arbeiten
💻 computer science

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

Das Papier stellt StreamFusion vor, einen topologiebewussten verteilten Inferenz-Engine für Diffusion-Transformer, der neuartige Torus-Aufmerksamkeit und einseitige Kommunikation nutzt, um Latenz- und Synchronisationsengpässe zu überwinden und eine bis zu 1,77-fache Beschleunigung gegenüber den fortschrittlichsten Methoden zu erreichen.

Ursprüngliche Autoren: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Veröffentlicht 2026-05-26
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen, einen massiven, mehrschichtigen Kuchen (ein hochwertiges Bild oder Video) mit einem Rezept zu backen, das Tausende von winzigen Schritten erfordert. In der Welt der KI wird dieser „Kuchen" von einem Diffusion Transformer (DiT) erstellt.

Das Problem ist, dass, wenn der Kuchen größer wird (höhere Auflösung oder längere Videos), ein einzelner Küchenofen (eine einzelne GPU) die Arbeitslast nicht bewältigen kann. Es wird zu langsam, und die Zutaten (Daten) nehmen zu viel Platz ein. Also stellen wir ein Team von Öfen (mehrere GPUs) ein, die zusammenarbeiten.

Allerdings reicht es nicht aus, Öfen einfach nebeneinanderzustellen. Sie müssen ständig Zutaten hin und her reichen. Wenn sie mehr Zeit damit verbringen, Schüsseln zu übergeben, als zu backen, verlangsamt sich der gesamte Prozess. Dies ist das Problem, das SwiftFusion löst.

Hier erklärt das Papier ihre Lösung anhand von drei Hauptideen:

1. Das Problem „Autobahn vs. Feldweg" (Topologie-bewusste Planung)

Stellen Sie sich vor, Ihr Team von Öfen ist in zwei Gruppen aufgeteilt:

  • Gruppe A: Öfen in derselben Küche, verbunden durch ein superschnelles, breites Förderband (Intra-Machine-Netzwerk).
  • Gruppe B: Öfen in verschiedenen Gebäuden, verbunden durch eine langsamere, schmale Feldstraße (Inter-Machine-Netzwerk).

Frühere Methoden versuchten, die langsame Feldstraße für schwere Arbeiten und das schnelle Förderband für leichte Aufgaben zu nutzen. Das war so, als würde man versuchen, ein riesiges Sofa durch eine schmale Gasse zu bewegen – es verursachte Staus.

SwiftFusions Lösung: Sie drehten die Strategie um.

  • Sie nutzen das schnelle Förderband für das schwere, unordentliche Übergeben von Zutaten (Ring Attention).
  • Sie nutzen die langsame Feldstraße nur für den organisierten, Massentransport großer Kisten (Ulysses Attention).
    Indem sie die Aufgabe auf die richtige „Straße" abstimmen, vermeiden sie, dass die langsame Verbindung verstopft wird.

2. Der „Fließband"-Trick (Torus Attention)

Bei den alten Methoden mussten die Öfen in einer Schlange warten. Ofen 1 würde eine Schüssel an Ofen 2 weitergeben, warten, bis Ofen 2 fertig ist, und dann würde Ofen 2 an Ofen 3 weitergeben. Dies erzeugte viel „tote Zeit", in der die Öfen nur warteten.

SwiftFusions Lösung: Sie verwandelten dies in eine geschäftige Fließbandproduktion.
Anstatt zu warten, bis die gesamte Schüssel angekommen ist, bevor sie mit der Arbeit beginnen, zerlegen sie die Schüssel in Abschnitte.

  • Sobald Ofen 1 den ersten Abschnitt der Zutaten vom Nachbarn erhält, beginnt er sofort, diesen Abschnitt zu backen.
  • Während er diesen ersten Abschnitt backt, empfängt er gleichzeitig den zweiten Abschnitt.
  • Bis der zweite Abschnitt ankommt, ist der Ofen bereit, ihn sofort zu backen.

Dies nennt man Torus Attention. Es ist wie ein Koch, der anfängt, Gemüse zu schneiden, während der Lieferwagen noch den Rest des Gemüses ausliefert. Sie überlappen das „Warten" (Kommunikation) mit dem „Arbeiten" (Berechnung), sodass keine Zeit verschwendet wird.

3. Die „Selbstbedienung"-Lieferung (Einseitige Kommunikation)

Im alten System erforderte das Übergeben von Zutaten ein „Händeschütteln". Ofen 1 würde rufen: „Ich sende das!" und Ofen 2 müsste zurückrufen: „Ich bin bereit zu empfangen!" Dieses ständige Rufen und Warten erzeugte viel Lärm und Verzögerung (Synchronisations-Overhead).

SwiftFusions Lösung: Sie wechselten zu einem „Selbstbedienungs"-Modell unter Verwendung einer speziellen Bibliothek namens NVSHMEM.

  • Jetzt kann Ofen 1 einfach ein Tablett mit Zutaten auf die Theke von Ofen 2 schieben, ohne vorher um Erlaubnis zu fragen.
  • Ofen 2 kann das Tablett greifen, wann immer er bereit ist.
  • Dies entfernt die Notwendigkeit für ständiges Rufen und Warten und lässt die gesamte Küche viel reibungsloser laufen.

Das Ergebnis

Das Papier testete dieses neue System bei der Erstellung hochauflösender Bilder und langer Videos. Sie stellten fest, dass durch die Anwendung dieser drei Tricks:

  • SwiftFusion im Durchschnitt 1,35-mal schneller ist als die derzeit besten Methoden.
  • In den besten Fällen war es 1,77-mal schneller.
  • Es wurde kein zusätzlicher Speicher (Zutaten) benötigt, nur eine intelligentere Art, sie zu bewegen.

Kurz gesagt macht SwiftFusion die KI-Bild- und Videoerstellung schneller, indem es die „Küche" besser organisiert, den Öfen erlaubt, während des Wartens zu arbeiten, und die unnötigen „Händeschüttelungen" zwischen ihnen entfernt.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →