← Últimos artigos
💻 computer science

SwiftFusion: Scalable Sequence Parallelism for Distributed Inference of Diffusion Transformers on GPUs

O artigo apresenta o StreamFusion, um motor de inferência distribuída consciente da topologia para Transformers de Difusão que utiliza uma nova Atenção em Toro e comunicação unidirecional para superar gargalos de latência e sincronização, alcançando uma aceleração de até 1,77x em relação aos métodos mais avançados.

Autores originais: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jiacheng Yang, Jun Wu, Yaoyao Ding, Zhiying Xu, Yida Wang, Gennady Pekhimenko

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando assar um bolo enorme, de várias camadas (uma imagem ou vídeo de alta qualidade) usando uma receita que exige milhares de passos minúsculos. No mundo da IA, esse "bolo" é criado por um Transformador de Difusão (DiT).

O problema é que, conforme o bolo fica maior (maior resolução ou vídeos mais longos), um único forno de cozinha (uma única GPU) não consegue lidar com a carga de trabalho. Fica muito lento, e os ingredientes (dados) ocupam muito espaço. Então, contratamos uma equipe de fornos (várias GPUs) para trabalhar juntos.

No entanto, apenas colocar fornos lado a lado não é suficiente. Eles precisam passar ingredientes de um para o outro constantemente. Se gastarem mais tempo passando tigelas do que assando, todo o processo fica mais lento. Este é o problema que o SwiftFusion resolve.

Veja como o artigo explica sua solução usando três ideias principais:

1. O Problema da "Estrada de Terra vs. Rodovia" (Agendamento Consciente da Topologia)

Imagine que sua equipe de fornos está dividida em dois grupos:

  • Grupo A: Fornos na mesma cozinha, conectados por uma esteira transportadora super-rápida e larga (rede intra-máquina).
  • Grupo B: Fornos em prédios diferentes, conectados por uma estrada de terra mais lenta e estreita (rede inter-máquina).

Métodos anteriores tentavam usar a estrada de terra lenta para trabalhos pesados e a esteira rápida para tarefas leves. Era como tentar mover um sofá gigante por um beco estreito — causava engarrafamentos.

Solução do SwiftFusion: Eles inverteram a estratégia.

  • Usam a esteira rápida para a passagem pesada e bagunçada de ingredientes (Ring Attention).
  • Usam a estrada de terra lenta apenas para o transporte organizado e em massa de grandes caixotes (Ulysses Attention).
    Ao combinar a tarefa com a "estrada" certa, evitam entupir a conexão lenta.

2. O Truque da "Linha de Montagem" (Atenção Toroidal)

Nos métodos antigos, os fornos tinham que esperar em fila. O Forno 1 passaria uma tigela para o Forno 2, esperaria o Forno 2 terminar, e então o Forno 2 passaria para o Forno 3. Isso criava muito "tempo morto" em que os fornos apenas esperavam.

Solução do SwiftFusion: Eles transformaram isso em uma linha de montagem movimentada.
Em vez de esperar que a inteira tigela chegasse para começar a trabalhar, eles dividem a tigela em pedaços.

  • Assim que o Forno 1 recebe o primeiro pedaço de ingredientes do vizinho, ele começa a assar esse pedaço imediatamente.
  • Enquanto assa esse primeiro pedaço, ele recebe simultaneamente o segundo pedaço.
  • Quando o segundo pedaço chega, o forno está pronto para assá-lo instantaneamente.

Isso é chamado de Atenção Toroidal. É como um chef que começa a cortar vegetais enquanto o caminhão de entrega ainda está descarregando o restante dos produtos. Eles sobrepõem a "espera" (comunicação) com o "trabalho" (cálculo) para que nenhum tempo seja desperdiçado.

3. A Entrega "Autoatendimento" (Comunicação Unilateral)

No sistema antigo, passar ingredientes exigia um "aperto de mão". O Forno 1 gritaria: "Estou enviando isso!" e o Forno 2 teria que gritar de volta: "Estou pronto para receber!". Esse constante gritar e esperar criava muito ruído e atraso (sobrecarga de sincronização).

Solução do SwiftFusion: Eles mudaram para um modelo de "autoatendimento" usando uma biblioteca especial chamada NVSHMEM.

  • Agora, o Forno 1 pode apenas deslizar uma bandeja de ingredientes no balcão do Forno 2 sem pedir permissão primeiro.
  • O Forno 2 pode pegar a bandeja sempre que estiver pronto.
  • Isso remove a necessidade de gritar e esperar constantemente, fazendo com que toda a cozinha funcione muito mais suavemente.

O Resultado

O artigo testou esse novo sistema na criação de imagens de alta resolução e vídeos longos. Eles descobriram que, ao usar esses três truques:

  • O SwiftFusion é 1,35 vezes mais rápido em média do que os melhores métodos atuais.
  • Nos melhores casos, foi 1,77 vezes mais rápido.
  • Não exigiu mais memória (ingredientes), apenas uma maneira mais inteligente de movê-los.

Em resumo, o SwiftFusion torna a geração de imagens e vídeos por IA mais rápida organizando melhor a "cozinha", permitindo que os fornos trabalhem enquanto esperam e removendo os desnecessários "apertos de mão" entre eles.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →