← Últimos artigos
🤖 AI

Fast Autoregressive Video Diffusion and World Models with Temporal Cache Compression and Sparse Attention

Este artigo apresenta o FAST-AR, um framework livre de treinamento que acelera a difusão de vídeo autorregressiva e modelos de mundo ao comprimir caches temporais e esparsificar a atenção por meio de correspondência de vizinho mais próximo aproximada, alcançando acelerações de 5 a 10 vezes com uso constante de memória enquanto preserva a qualidade visual.

Autores originais: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

Publicado 2026-06-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Dvir Samuel, Issar Tzachor, Matan Levy, Michael Green, Gal Chechik, Rami Ben-Ari

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando escrever uma história muito longa, uma frase de cada vez. Toda vez que você escreve uma nova frase, você tem que ler cada uma das frases que escreveu anteriormente para garantir que a nova se encaixe perfeitamente.

No mundo da geração de vídeo por IA, é exatamente isso que acontece. Conforme a IA cria um vídeo quadro a quadro, ela mantém um "banco de memória" (chamado KV Cache) de tudo o que gerou até agora. Para criar o próximo quadro, a IA tem que ler todo esse banco de memória crescente.

O problema? À medida que o vídeo fica mais longo, esse banco de memória fica enorme. A IA tem que ler cada vez mais texto para escrever a próxima frase. Isso torna o processo:

  1. Cada vez mais lento (como tentar encontrar uma palavra específica em uma biblioteca que continua adicionando novos livros a cada segundo).
  2. Mais caro (ela fica sem memória de computador, como uma mochila que fica pesada demais para carregar).

O artigo apresenta um novo método chamado FAST-AR para corrigir isso. Pense nisso como dar à IA um conjunto de atalhos superinteligentes para que ela possa escrever histórias longas sem se cansar ou perder a memória.

Aqui estão os três "truques de mágica" que o FAST-AR utiliza:

1. O "Localizador de Duplicatas" (TempCache)

O Problema: Em um vídeo, muitas coisas permanecem iguais por um longo tempo. Se um gato está caminhando em um jardim, as árvores ao fundo e o pelo do gato parecem quase idênticos no quadro 100 e no quadro 101. A IA estava perdendo tempo lembrando da mesma coisa duas vezes.
A Solução: O FAST-AR age como um bibliotecário inteligente que percebe: "Ei, eu já tenho uma cópia perfeita desta árvore na minha memória. Não preciso escrevê-la novamente."
Ele comprime a memória ao fundir esses momentos "quase duplicados". Em vez de lembrar de cada quadro individualmente, ele lembra da essência da cena. Isso mantém o tamanho da memória pequeno e constante, não importa o quão longo o vídeo se torne.

2. O "Leitor Relevante" (AnnCA)

O Problema: Imagine que você está escrevendo uma história baseada em um comando (prompt) muito longo (uma descrição detalhada). O comando pode dizer: "Um gato caminha, uma van passa, depois um cachorro aparece". Quando a IA está desenhando o "gato", ela não precisa olhar para as palavras "van" ou "cachorro" no comando. Mas os modelos antigos de IA leem o comando inteiro todas as vezes, desperdiçando energia.
A Solução: O FAST-AR usa uma ferramenta de "busca rápida" (chamada de Vizinho Mais Próximo Aproximado) para descobrir instantaneamente: "Quais palavras no comando realmente importam para este quadro específico?"
Ele ignora as palavras irrelevantes. Se o gato está na tela, ele presta atenção apenas na palavra "gato". Isso economiza uma quantidade massiva de poder computacional.

3. O "Filtro de Foco" (AnnSA)

O Problema: Dentro do próprio vídeo, a IA olha para cada pixel em relação a todos os outros pixels. É como tentar falar com todo mundo em um estádio ao mesmo tempo, embora você só precise falar com a pessoa parada ao seu lado.
A Solução: O FAST-AR agrupa coisas semelhantes. Se um pixel faz parte de um "gato", ele só fala com outros pixels que também fazem parte do "gato". Ele ignora o fundo ou outros objetos que não estão relacionados. É como colocar as pessoas em pequenos círculos de conversa focados, em vez de uma multidão gigante e barulhenta.

O Resultado: Um Maratonista, Não um Velocista

O artigo mostra que, com esses três truques, a IA pode gerar vídeos de 5 a 10 vezes mais rápido do que antes.

  • Jeito Antigo: Conforme o vídeo fica mais longo, a IA fica cada vez mais lenta, eventualmente ficando sem memória (como um corredor ficando cansado e parando).
  • Jeito FAST-AR: A IA corre em um ritmo constante e rápido para sempre. A velocidade e o uso de memória permanecem os mesmos, quer o vídeo tenha 10 segundos ou 2 minutos.

Em resumo: O FAST-AR ensina a IA a parar de reler as mesmas notas antigas, ignorar as palavras de que não precisa e focar apenas nas pessoas com quem está falando. Isso permite que ela crie vídeos longos e de alta qualidade sem ficar sobrecarregada por sua própria memória.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →