← Últimos artigos
💻 computer science

DiTango: Cost-Effective Parallel Diffusion Generation with Selective Attention State Reuse

O DiTango é um framework de difusão paralelo de baixo custo que acelera a geração de DiT em múltiplos nós ao aproveitar a heterogeneidade das partições de contexto para reutilizar estrategicamente estados de atenção, alcançando até 3,2x de aceleração com escalonamento quase linear enquanto preserva a qualidade da geração.

Autores originais: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Publicado 2026-07-20
📖 3 min de leitura☕ Leitura rápida

Autores originais: Yuyang Chen, Runxin Zhong, Zan Zong, Hengjie Li, Yuyang Jin, Jidong Zhai

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde os computadores podem sonhar com filmes inteiros, não apenas imagens estáticas, mas histórias fluidas e de alta definição que duram minutos. Esta é a magia dos "Diffusion Transformers", um tipo de inteligência artificial que constrói imagens e vídeos passo a passo, transformando lentamente o ruído estático em uma cena clara e bela. Pense nisso como um escultor talhando um bloco de mármore; a IA começa com uma nuvem caótica de pixels e, ao longo de muitas rodadas de refinamento, revela um vídeo perfeito.

No entanto, há um problema: esses escultores digitais são incrivelmente lentos. Criar um único vídeo de cinco segundos pode levar mais de uma hora em um computador potente. Para acelerar o processo, os engenheiros frequentemente tentam fazer com que muitos computadores trabalhem juntos, dividindo a longa sequência de vídeo em partes e distribuindo-as como uma corrida de revezamento. Mas aqui está o problema: quando esses computadores tentam compartilhar seu trabalho, eles ficam presos em engarrafamentos. O tempo gasto esperando para passar dados de um para o outro muitas vezes anula a velocidade ganha ao ter mais trabalhadores. Isso cria um gargalo frustrante onde adicionar mais computadores não faz o vídeo terminar de fato mais rápido, e às vezes até o torna mais lento.

Apresentamos o DiTango, um novo sistema projetado para resolver esse engarrafamento. Os pesquisadores por trás do DiTango notaram algo fascinante sobre como esses modelos de IA "prestam atenção" em diferentes partes do vídeo. Eles descobriram que nem todas as partes do vídeo são igualmente importantes em todos os momentos. Assim como você foca intensamente na pessoa que está falando bem na sua frente, mas mal nota a pessoa que está três salas de distância, a atenção da IA é mais forte para partes próximas do vídeo e muito mais fraca para partes distantes.

O DiTango usa essa percepção para jogar um jogo inteligente de "pular e reutilizar". Em vez de forçar cada computador a buscar e calcular constantemente cada única peça de dados de todos os outros computadores (o que causa o engarrafamento), o planejador inteligente do DiTango decide quais partes são cruciais para calcular do zero e quais partes são tão pouco importantes que o computador pode simplesmente usar um resultado antigo, armazenado em cache, de alguns segundos atrás. É como um grupo de chefs em uma cozinha enorme: em vez de todos correrem até a despensa para pegar o mesmo tempero toda vez, eles percebem que, para a guarnição no lado distante da mesa, o pote de tempero que está no balcão ali perto é "bom o suficiente" e não precisa de uma nova viagem.

Ao ser seletivo, o DiTango reduz drasticamente o tempo que os computadores passam conversando entre si. Em testes usando modelos de vídeo potentes, essa abordagem tornou o processo de geração quase duas vezes mais rápido de ponta a ponta e acelerou os cálculos centrais de "atenção" em mais de três vezes ao usar 32 computadores juntos. Crucialmente, os pesquisadores descobriram que esse aumento de velocidade não arruinou a qualidade do vídeo; os filmes finais pareciam tão nítidos e coerentes quanto aqueles feitos por métodos tradicionais mais lentos. O DiTango prova que, ao entender para onde a IA realmente precisa olhar, podemos impedir que ela desperdice energia com coisas que ela mal percebe, tornando o sonho da geração de vídeo por IA instantânea e de alta qualidade um pouco mais próximo da realidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →