← Nieuwste papers
💻 computer science

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

Het artikel introduceert StreamFusion, een topologiebewuste gedistribueerde inferentie-engine voor Diffusion Transformers die gebruikmaakt van innovatieve Torus Attention en eenzijdige communicatie om latentie- en synchronisatieknelpunten te overwinnen, waardoor een snelheidswinst van tot 1,77x wordt bereikt ten opzichte van de meest geavanceerde methoden.

Oorspronkelijke auteurs: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Gepubliceerd 2026-05-26
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je probeert een enorme, meerlagige taart (een hoogwaardige afbeelding of video) te bakken met een recept dat duizenden kleine stappen vereist. In de wereld van AI wordt deze "taart" gecreëerd door een Diffusion Transformer (DiT).

Het probleem is dat, naarmate de taart groter wordt (hogere resolutie of langere video's), een enkele keukenoven (een enkele GPU) de werklast niet aankan. Het wordt te traag, en de ingrediënten (data) nemen te veel ruimte in beslag. Dus huren we een team van ovens (meerdere GPU's) in om samen te werken.

Echter, ovens gewoon naast elkaar plaatsen is niet genoeg. Ze moeten constant ingrediënten heen en weer doorgeven. Als ze meer tijd besteden aan het doorgeven van kommen dan aan het bakken, vertraagt het hele proces. Dit is het probleem dat SwiftFusion oplost.

Hier is hoe het artikel hun oplossing uitlegt met drie hoofdzaken:

1. Het "Snelweg versus Grindweg"-probleem (Topologie-bewuste planning)

Stel je voor dat je team van ovens is opgesplitst in twee groepen:

  • Groep A: Ovens in dezelfde keuken, verbonden door een supersnelle, brede transportband (Intra-machine netwerk).
  • Groep B: Ovens in verschillende gebouwen, verbonden door een langzamere, smalle grindweg (Inter-machine netwerk).

Vorige methoden probeerden de langzame grindweg te gebruiken voor zware arbeid en de snelle transportband voor lichte taken. Dit was als proberen een enorme bank door een smalle steeg te verplaatsen – het veroorzaakte file.

SwiftFusion's Oplossing: Ze draaiden de strategie om.

  • Ze gebruiken de snelle transportband voor het zware, rommelige doorgeven van ingrediënten (Ring Attention).
  • Ze gebruiken de langzame grindweg alleen voor de georganiseerde, bulktransport van grote kratten (Ulysses Attention).
    Door de taak af te stemmen op de juiste "weg", vermijden ze dat de langzame verbinding verstopt raakt.

2. De "Vloeiende Band"-truc (Torus Attention)

In de oude methoden moesten de ovens in een rij wachten. Oven 1 gaf een kom door aan Oven 2, wachtte tot Oven 2 klaar was, en gaf dan Oven 2 de kom door aan Oven 3. Dit creëerde veel "dode tijd" waarin ovens gewoon wachtten.

SwiftFusion's Oplossing: Ze maakten hier een drukke assemblagelijn van.
In plaats van te wachten tot de hele kom aankwam voordat ze aan het werk gingen, breken ze de kom in stukken.

  • Zodra Oven 1 het eerste stuk ingrediënten van de buur ontvangt, begint het direct met bakken van dat stuk.
  • Terwijl het dat eerste stuk bakt, ontvangt het tegelijkertijd het tweede stuk.
  • Tegen de tijd dat het tweede stuk aankomt, is de oven klaar om het direct te bakken.

Dit heet Torus Attention. Het is als een kok die begint met het snijden van groenten terwijl het bezorgtruckje nog de rest van de groente uitlaadt. Ze laten het "wachten" (communicatie) overlappen met het "werken" (berekening) zodat geen tijd verloren gaat.

3. De "Zelfbediening"-levering (Eenzijdige communicatie)

In het oude systeem vereiste het doorgeven van ingrediënten een "handdruk". Oven 1 zou roepen: "Ik stuur dit!" en Oven 2 zou terug moeten roepen: "Ik ben klaar om te ontvangen!" Dit constante roepen en wachten veroorzaakte veel lawaai en vertraging (synchronisatie-overhead).

SwiftFusion's Oplossing: Ze schakelden over naar een "zelfbedienings"-model met behulp van een speciale bibliotheek genaamd NVSHMEM.

  • Nu kan Oven 1 gewoon een dienblad met ingrediënten op het aanrecht van Oven 2 schuiven zonder eerst om toestemming te vragen.
  • Oven 2 kan het dienblad pakken wanneer het er klaar voor is.
  • Dit verwijdert de noodzaak voor constant roepen en wachten, waardoor de hele keuken veel soepeler loopt.

Het Resultaat

Het artikel testte dit nieuwe systeem op het creëren van afbeeldingen met hoge resolutie en lange video's. Ze ontdekten dat door het gebruik van deze drie trucs:

  • SwiftFusion gemiddeld 1,35 keer sneller is dan de huidige beste methoden.
  • In de beste gevallen was het 1,77 keer sneller.
  • Het vereiste geen meer geheugen (ingrediënten), alleen een slimme manier om ze te verplaatsen.

Kortom, SwiftFusion maakt AI-generatie van afbeeldingen en video's sneller door de "keuken" beter te organiseren, de ovens te laten werken terwijl ze wachten, en de onnodige "handdrukken" tussen hen te verwijderen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →