← Últimos artigos
💻 computer science

DiffSparse: Accelerating Diffusion Transformers with Learned Token Sparsity

O artigo apresenta o DiffSparse, um framework de otimização de esparsidade diferenciável que acelera a inferência de modelos de difusão baseados em transformadores através de alocação de esparsidade aprendida e uma estratégia de treinamento em duas etapas, reduzindo significativamente os custos computacionais sem comprometer a qualidade das amostras geradas.

Autores originais: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

Publicado 2026-04-07
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haowei Zhu, Ji Liu, Ziqiong Liu, Dong Li, Junhai Yong, Bin Wang, Emad Barsoum

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um artista genial chamado DiT (Diffusion Transformer). Ele é capaz de criar pinturas e vídeos incríveis a partir de uma simples descrição de texto. No entanto, há um problema: esse artista é extremamente lento e cansativo. Para criar uma única imagem, ele precisa fazer o mesmo trabalho de "pensar e refinar" cerca de 20 a 50 vezes, como se estivesse esculpindo uma estátua, dando uma martelada, olhando, dando outra martelada, olhando novamente, e assim por diante.

Isso consome muita energia e tempo de computador.

O artigo "DiffSparse" apresenta uma solução inteligente para acelerar esse processo sem perder a qualidade da obra final. Vamos usar uma analogia de uma cozinha de restaurante para explicar como funciona.

O Problema: A Cozinha Lenta

Na cozinha do DiT, há vários chefs (camadas da rede neural) trabalhando em etapas. Em cada etapa, eles olham para todos os ingredientes (os "tokens" ou pedaços da imagem) e decidem o que fazer.

  • O problema: Em muitas etapas, os chefs estão apenas repetindo o que já fizeram na etapa anterior. Eles estão "pensando" em algo que já está quase pronto. É como se você estivesse polindo um prato de cerâmica que já está brilhante; você não precisa esfregar tão forte ou tão frequentemente.
  • As soluções antigas: Métodos anteriores tentavam acelerar isso dizendo: "Ok, vamos pular 2 etapas inteiras" ou "Vamos guardar o prato pronto e não tocar nele". Mas isso era feito de forma manual e rígida. Às vezes, eles pulavam uma etapa importante e o prato ficava torto (a imagem saía ruim).

A Solução: O Gerente de Cozinha Inteligente (DiffSparse)

O DiffSparse é como um Gerente de Cozinha Inteligente que observa os chefs e decide, em tempo real, quem pode descansar e quem precisa trabalhar duro.

Aqui estão os três segredos do DiffSparse:

1. O "Mapa de Cansaço" (Preditor de Custo)

Em vez de ter regras fixas, o DiffSparse aprende a prever onde a "economia" é possível. Ele cria um mapa mental que diz:

  • "Nesta etapa inicial, o Chef 1 precisa trabalhar muito."
  • "Na etapa 5, o Chef 3 pode apenas olhar o prato, pois ele já está quase pronto."
  • "Na etapa 10, o Chef 2 pode economizar energia porque a imagem já está definida."

Isso é feito de forma automática e aprendida, não por regras escritas à mão. O sistema aprende qual é o "preço" de pular um trabalho em cada momento.

2. O "Algoritmo de Otimização" (Programação Dinâmica)

Imagine que você tem um orçamento de energia limitado para o dia todo. O Gerente usa um supercomputador (um solucionador de programação dinâmica) para calcular a melhor distribuição desse orçamento.

  • Ele não apenas decide "pular 50% do trabalho". Ele decide: "Vamos pular 80% do trabalho no Chef 1, mas manter 100% no Chef 5, e 40% no Chef 10".
  • O objetivo é gastar o mínimo de energia possível, mas garantir que o prato final saia perfeito. É como montar um quebra-cabeça onde você escolhe as peças mais fáceis para deixar de lado, sem estragar a imagem final.

3. O "Chef que Pula" (Seleção de Tokens)

Dentro de cada etapa, nem todos os "ingredientes" (partes da imagem) são importantes.

  • Se você está desenhando um gato, o focinho é importante, mas o fundo da imagem pode ser apenas um céu azul estático.
  • O DiffSparse identifica quais partes da imagem já estão "prontas" e diz: "Não precisamos redesenhar o céu azul agora, vamos apenas reutilizar a versão de ontem".
  • Isso economiza muito tempo, pois o computador só processa as partes que realmente mudaram.

O Treinamento em Duas Etapas

Para ensinar esse Gerente a ser tão bom, eles usam uma estratégia de duas etapas:

  1. Fase de Aprendizado: Primeiro, eles deixam o sistema funcionar normalmente (cozinhando tudo do zero) para aprender onde os erros acontecem.
  2. Fase de Refinamento: Depois, eles ensinam o sistema a começar a "pular" etapas com segurança, ajustando o mapa de economia para que a qualidade não caia.

O Resultado: Mais Rápido, Melhor e Mais Barato

Os testes mostraram que o DiffSparse é um vencedor:

  • Velocidade: Eles conseguiram acelerar a geração de imagens em 1,9 vezes (quase o dobro da velocidade).
  • Qualidade: Surpreendentemente, as imagens geradas eram até melhores do que as do modelo original em alguns casos! Isso porque o sistema aprendeu a focar a energia computacional exatamente onde era mais necessário, evitando desperdício.
  • Versatilidade: Funciona bem em modelos de texto para imagem (como criar fotos de gatos) e até em modelos de vídeo.

Resumo em uma Frase

O DiffSparse é como um maestro genial que orquestra a criação de imagens por IA, dizendo exatamente quando cada músico pode tocar suavemente e quando deve tocar com força, resultando em uma sinfonia (imagem) perfeita, mas tocada em metade do tempo e com metade da energia.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →