← Últimos artigos
💻 computer science

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

Este artigo apresenta a Alocação de Passos Heterogênea (HSA), um algoritmo de inferência sem treinamento que acelera os Transformers de Difusão para geração de vídeo ao atribuir dinamicamente menos passos de remoção de ruído a tokens de baixa velocidade, mantendo o contexto global e a qualidade por meio de um novo mecanismo de sincronização de KV-cache e atualizações de Euler em cache.

Autores originais: Ernie Chu, Vishal M. Patel

Publicado 2026-05-12
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ernie Chu, Vishal M. Patel

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está dirigindo uma produção cinematográfica massiva e de alto orçamento. Neste filme, cada personagem, cada árvore de fundo e cada partícula de poeira no chão é um ator. Em um Transformer de Difusão padrão (o modelo de IA que cria o vídeo), o diretor trata cada um desses "atores" exatamente da mesma maneira.

Se o roteiro exigir 40 rodadas de ensaio (etapas de remoção de ruído) para deixar a cena perfeita, o diretor força a parede de fundo a ensaiar 40 vezes, a árvore estática a ensaiar 40 vezes e o herói correndo pela tela a ensaiar 40 vezes.

O problema? A parede e a árvore mal se movem. Elas não precisam de 40 ensaios; poderiam se contentar com 5. Mas a IA desperdiça quantidades massivas de tempo e energia fazendo-as ensaiar de qualquer forma, enquanto o herói (que se move rapidamente e muda de forma) também recebe as mesmas 40 rodadas. É como pagar a um ator superestrela e a um recorte de papelão exatamente o mesmo salário por hora pelo exatamente mesmo volume de trabalho.

A Solução: Alocação Heterogênea de Etapas (HSA)

Os autores deste artigo, Ernie Chu e Vishal Patel, propõem uma maneira mais inteligente de gerenciar o set de filmagem chamada Alocação Heterogênea de Etapas (HSA).

Pense na HSA como um diretor inteligente que observa os atores e diz:

  • "Você, a parede de fundo? Você é chata e estática. Você só precisa de 5 ensaios."
  • "Você, o herói correndo? Você é dinâmico e complexo. Você precisa de todos os 40 ensaios."
  • "Você, a árvore balançando? Você precisa de 20 ensaios."

Isso economiza uma enorme quantidade de tempo porque a IA para de desperdiçar energia nas partes chatas.

Os Dois Problemas Difíceis Que Eles Resolveram

Você pode pensar: "Ok, mas se a parede parar de ensaiar após 5 rodadas, como ela sabe o que o herói está fazendo na rodada 40? Eles precisam se ver para permanecer na mesma cena."

O artigo apresenta dois truques inteligentes para resolver isso:

1. O Truque da "Memória Fantasma" (Sincronização de KV-Cache)
Na IA, os atores precisam "ver" uns aos outros para permanecerem sincronizados (isso é chamado de atenção). Geralmente, se um ator para de ensaiar, ele desaparece da sala e os outros não conseguem vê-lo.

  • A Correção: A IA mantém uma "memória fantasma" (um cache) da parede e da árvore. Mesmo que elas não estejam ensaiando ativamente, seus "fantasmas" permanecem na sala. Os atores ativos (o herói) ainda podem olhar para os fantasmas dos atores inativos para saber onde eles estão.
  • O Resultado: O herói pode ensaiar intensamente enquanto ainda sabe exatamente onde a parede está, sem que a parede precise realmente realizar qualquer trabalho.

2. O Truque da "Viagem no Tempo" (Atualização Euler em Cache)
O que acontece com a posição da parede enquanto ela está de folga? Ela simplesmente congela?

  • A Correção: A IA lembra da última vez que a parede se moveu e da velocidade com que estava indo. Ela usa uma fórmula matemática simples para "avançar rapidamente" a posição da parede através do tempo pulado. É como dizer: "A parede se moveu 1 polegada por segundo da última vez; vou apenas calcular onde ela está agora sem fazê-la realmente se mover."
  • O Resultado: A parede é atualizada em segundo plano instantaneamente, sem que a IA precise executar uma simulação complexa para ela.

Os Resultados: Mais Rápido, Mais Barato, Igualmente Bom

Os pesquisadores testaram isso em poderosos modelos de IA para criação de vídeos (como Wan-2 e LTX-2). Eis o que descobriram:

  • Velocidade: Eles puderam reduzir o tempo necessário para criar um vídeo em 50% ou até 75% (fazendo com que levasse apenas 25% do tempo original).
  • Qualidade: Mesmo com todo esse tempo cortado, os vídeos pareciam quase exatamente os mesmos das versões completas e lentas. O "herói" ainda parecia nítido, e a "parede" ainda parecia sólida.
  • Comparação: Métodos anteriores tentavam acelerar as coisas pulando simplesmente rodadas inteiras de ensaio para todos de uma vez. Esses métodos faziam o vídeo desmoronar (como um prédio colapsando) quando tentavam ir muito rápido. A HSA manteve o vídeo estável porque pulou apenas as partes que não precisavam de trabalho.

Em Resumo

Este artigo trata de não tratar cada pixel da mesma maneira. Ao perceber que algumas partes de um vídeo são chatas e estáticas, enquanto outras são emocionantes e em movimento, a IA pode parar de desperdiçar tempo nas partes chatas. Ela usa "memórias fantasma" e "atalhos matemáticos" para manter tudo sincronizado, permitindo que geremos vídeos de alta qualidade em uma fração do tempo.

É a diferença entre uma fábrica que usina cada parafuso de um carro com a mesma precisão e uma fábrica que gasta 90% do seu tempo no motor e apenas 10% nos parafusos que seguram as capas dos assentos no lugar. O carro ainda funciona perfeitamente, mas é construído muito mais rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →