← Últimos artigos
🤖 machine learning

Sparse Forcing: Native Trainable Sparse Attention for Real-time Autoregressive Diffusion Video Generation

O artigo apresenta o "Sparse Forcing", um paradigma treinável que utiliza atenção esparsa nativa e um mecanismo eficiente de kernel GPU (PBSA) para melhorar a qualidade visual e reduzir a latência e o uso de memória em modelos de geração de vídeo difusivo autoregressivo, especialmente em sequências de longa duração.

Autores originais: Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

Publicado 2026-04-24
📖 4 min de leitura☕ Leitura rápida

Autores originais: Boxun Xu, Yuming Du, Zichang Liu, Siyu Yang, Ziyang Jiang, Siqi Yan, Rajasi Saha, Albert Pumarola, Wenchen Wang, Peng Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando escrever um livro de aventuras muito longo, capítulo por capítulo, sem nunca olhar para trás para revisar o que já escreveu.

O problema é que, à medida que a história fica mais longa, você começa a esquecer detalhes importantes: a cor do cavalo do herói muda, o nome da cidade se altera e a lógica da trama começa a fazer pouco sentido. Além disso, tentar lembrar de tudo o que aconteceu desde a primeira página exige uma memória tão grande que seu cérebro (ou computador) fica lento e cansado.

É exatamente esse o problema que o Sparse Forcing resolve para a criação de vídeos por Inteligência Artificial.

Aqui está uma explicação simples do que os pesquisadores descobriram e criaram:

1. O Problema: A Memória que "Enlouquece"

Atualmente, para criar vídeos longos, as IAs usam um método chamado "difusão autoregressiva". Elas criam um quadro, depois o próximo baseado no anterior, e assim por diante.

  • O erro: Com o tempo, pequenos erros se acumulam. Se a IA erra um pouco a cor do céu no quadro 10, no quadro 100 o céu pode ficar roxo ou o sol sumir.
  • O custo: Para evitar isso, a IA tenta guardar toda a história na memória (chamada de KV Cache). Para um vídeo de 1 minuto, essa memória é gigantesca, deixando a geração lenta e cara.

2. A Descoberta: O que a IA realmente lembra?

Os pesquisadores observaram algo curioso: mesmo que a IA tente olhar para tudo, ela naturalmente foca a atenção em apenas alguns momentos-chave da história.

  • Analogia: Pense em um filme. Você não lembra de cada segundo de cada cena, mas lembra das "cenas marcantes" (o momento em que o herói entra, o vilão aparece, a explosão). O resto é apenas "cenário" ou movimento contínuo.
  • A IA também percebeu que, no momento atual, ela só precisa olhar para os vizinhos imediatos, não para o filme inteiro de novo.

3. A Solução: O "Sparse Forcing" (Forçamento Esparsos)

O Sparse Forcing é como dar um "filtro de memória inteligente" para a IA. Em vez de tentar lembrar de tudo, ela aprende a fazer três coisas:

  1. Guardar os "Momentos Ícones" (Memória Persistente): A IA identifica e guarda apenas os blocos de vídeo mais importantes que definem a história (quem são os personagens, qual é o cenário). Ela mantém esses "âncoras" vivas na memória o tempo todo, como se fossem fotos fixas na parede para não esquecer a identidade da cena.
  2. Esquecer o Resto (Memória Local Esparsa): Para o que está acontecendo agora, ela não olha para todos os quadros anteriores. Ela olha apenas para uma pequena janela de vizinhança e escolhe, de forma dinâmica, apenas os detalhes mais importantes dentro dessa janela. É como ler apenas os parágrafos essenciais de um capítulo, ignorando as repetições.
  3. Aprender a Fazer Sozinha: Diferente de métodos antigos que usavam regras fixas, esse sistema é "treinável". A IA aprende, durante o treino, quais momentos guardar e quais ignorar, ajustando-se sozinha para não errar a história.

4. O Resultado: Vídeos Melhores e Mais Rápidos

Graças a essa técnica (e a um "motor" especial de computador chamado PBSA que faz os cálculos rapidíssimos), os resultados são impressionantes:

  • Qualidade: Os vídeos longos (de 1 minuto) mantêm a coerência. O cavalo continua sendo o mesmo cavalo, e a cor do céu não muda aleatoriamente. A IA não "alucina" tanto.
  • Velocidade: Como a IA não precisa processar toda a memória antiga a cada novo quadro, ela gera o vídeo muito mais rápido (cerca de 1,2x a 1,3x mais rápido em vídeos longos).
  • Memória: O computador precisa de muito menos memória RAM para rodar o vídeo, permitindo criar filmes longos em máquinas mais comuns.

Resumo em uma Metáfora Final

Imagine que você está dirigindo um carro por uma estrada longa:

  • O método antigo (Self-Forcing): Você tenta olhar para o retrovisor o tempo todo, tentando lembrar de cada curva que fez desde o início da viagem. Isso cansa, você se distrai e acaba saindo da pista.
  • O método novo (Sparse Forcing): Você olha para o retrovisor apenas para lembrar de onde você começou e quem está no banco do passageiro (os momentos ícones). Para o resto da estrada, você foca apenas no asfalto à frente e nas curvas imediatas. Você dirige mais rápido, com mais segurança e chega ao destino com a história intacta.

Em suma, o Sparse Forcing ensina a IA a ter uma memória seletiva e inteligente, permitindo criar filmes longos e bonitos sem que o computador fique sobrecarregado ou a história perca o sentido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →