← Últimos artigos
💻 computer science

In-Context Forcing: Uncovering Context Effects in Autoregressive Video Diffusion

Este artigo introduz o In-Context Forcing, um paradigma autorregressivo progressivo para difusão de vídeo que utiliza contextos com níveis decrescentes de ruído para equilibrar a consistência temporal e a dinâmica entre quadros, ao mesmo tempo em que possibilita a denoização paralela entre quadros para uma aceleração significativa da inferência.

Autores originais: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

Publicado 2026-08-07
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Lingxiao Yang, Liu Liu, Moran Li, Han Feng, Wenjian Cao, Jiangning Zhang, Ye Shi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um mundo onde computadores podem sonhar com filmes, quadro a quadro, apenas lendo um comando de texto. Esta é a magia da geração de vídeo, um campo onde a inteligência artificial aprende a pintar imagens em movimento. Para fazer isso, muitos modelos modernos de IA usam uma técnica chamada difusão. Pense na difusão como um escultor começando com um bloco de argila barulhenta e cheia de estática e, lentamente, removendo o ruído para revelar uma estátua clara e suave. No vídeo, isso acontece quadro a quadro. No entanto, criar um filme inteiro de uma vez é lento e computacionalmente pesado. Por isso, os cientistas frequentemente usam uma abordagem de "transmissão" chamada autoregressão, onde a IA gera um quadro, usa-o como guia e, em seguida, faz o próximo, como uma corrida de revezamento onde cada corredor passa o bastão para o próximo. O grande desafio sempre foi equilibrar velocidade com qualidade: se a IA olhar muito de perto para o quadro anterior, ela dependerá excessivamente dele (fazendo o vídeo parecer congelado); se olhar muito longe, os personagens podem sofrer falhas ou desaparecer.

Este artigo aborda um problema específico nesta corrida de revezamento: o "bastão" que a IA está segurando está limpo demais. Os métodos atuais passam um quadro perfeitamente claro e livre de ruídos para a próxima etapa, o que acidentalmente vaza detalhes minúsculos. Isso faz com que a IA pegue um atalho, simplesmente copiando a imagem anterior em vez de imaginar como ela deve se mover, resultando em vídeos rígidos e monótonos. Os autores, Lingxiao Yang e sua equipe, propõem uma nova estratégia inteligente chamada In-Context Forcing (Forçamento em Contexto). Em vez de entregar uma foto cristalina, eles entregam uma versão "ruidosa" do quadro anterior. Ao ajustar quanto ruído há no guia — mantendo o passado imediato borrado (para forçar a IA a imaginar o movimento) e o passado distante mais claro (para manter a consistência da história) — eles criam um vídeo que flui naturalmente. Eles também descobriram uma maneira de permitir que a IA gere múltiplos quadros ao mesmo tempo, em vez de esperar um terminar antes de começar o próximo, o que torna todo o processo significativamente mais rápido.

O Problema do "Limpo Demais"

Imagine que você está tentando aprender a dançar observando um amigo. Se seu amigo estiver parado perfeitamente imóvel e você olhar para ele muito de perto, poderá apenas copiar sua pose exata sem realmente aprender o ritmo da dança. É isso que acontece nos modelos atuais de IA de vídeo. Eles olham para o quadro anterior, que está "totalmente denoisado" (perfeitamente limpo) e, por ter tantos detalhes nítidos, a IA depende excessivamente do quadro anterior. Ela pensa: "Oh, vejo exatamente como era o último quadro, vou apenas copiar isso", em vez de descobrir como a cena deve evoluir. Isso resulta em vídeos onde os personagens parecem estar presos em um loop ou movendo-se com solavancos rígidos e não naturais. O artigo argumenta que esse "atalho" estraga a dinâmica temporal — a sensação de passagem do tempo e de coisas se movendo suavemente.

A Solução do "Guia Ruidoso"

Para corrigir isso, os autores introduzem o In-Context Forcing. Eles mudam as regras da corrida de revezamento. Em vez de passar uma foto perfeita e limpa para a próxima etapa, eles passam uma versão que ainda está um pouco nebulosa.

  • A Analogia: Pense na IA como um artista pintando uma história em quadrinhos. Se o painel anterior estiver perfeitamente finalizado, o artista pode apenas traçar por cima dele. Mas se o painel anterior for um esboço bruto com alguns borrões (ruído), o artista terá que usar o cérebr para descobrir como o personagem deve se mover para o próximo painel.
  • Como funciona: O sistema aplica diferentes níveis de "ruído" aos quadros de guia. O quadro imediatamente anterior ao atual é mantido bastante ruidoso (borrado), forçando a IA a gerar novo movimento em vez de copiar detalhes. Quadros mais distantes no passado são mantidos mais limpos, para que a IA se lembre da história geral e das formas dos personagens. Isso cria um guia "progressivo" que diz à IA exatamente quanto detalhe ela precisa inventar em cada etapa.

O "Power-Up" Paralelo

Normalmente, modelos autoregressivos são como uma estrada de pista única: o Quadro 1 deve terminar, então o Quadro 2 começa, depois o Quadro 3. Isso é lento. O artigo mostra que, como seu novo método não depende de um quadro anterior perfeitamente limpo, ele desbloqueia uma pista secreta. Eles introduzem a atenção causal entre quadros (cross-frame causal attention), que permite que a IA trabalhe em múltiplos quadros simultaneamente.

  • A Analogia: Imagine uma equipe de pintores. No modo antigo, eles tinham que esperar o primeiro pintor terminar uma parede para que o segundo pudesse começar. Com o In-Context Forcing, a equipe pode pintar o quarto inteiro de uma vez, porque eles têm um plano mestre compartilhado e levemente nebuloso sobre o qual todos podem concordar sem precisar esperar que a parede anterior esteja perfeita.
  • O Resultado: Este processamento paralelo acelera significativamente a geração de vídeo. O artigo relata que, em testes padrão, este método reduziu o tempo total necessário para gerar um vídeo em 45,1% em comparação com os métodos anteriores de última geração, tornando também os vídeos melhores.

O Que os Testes Mostram

Os autores testaram seu método em uma variedade de tarefas de geração de vídeo, desde clipes curtos até sequências longas de 30 segundos. Eles compararam seus resultados com outros modelos de ponta usando uma ferramenta chamada VBench, que pontua vídeos em aspectos como qualidade visual, quão bem eles correspondem à descrição de texto e quão dinâmicos são os movimentos.

  • As Descobertas: O In-Context Forcing obteve pontuações mais altas do que todos os outros modelos nesses testes. Especificamente, alcançou uma pontuação de "Grau Dinâmico" de 72 em vídeos curtos (comparado a 63 do segundo melhor) e 86,40 em vídeos longos, superando vastamente um método chamado Rolling Forcing, que obteve apenas 40,63.
  • Por que isso importa para vídeos longos: O artigo sugere que os métodos antigos pioram à medida que o vídeo fica mais longo porque o seu "gap de treino-teste" (a diferença entre como aprendem e como performam) faz com que os erros se acumulem. O In-Context Forcing mantém o movimento diverso e natural mesmo em sequências longas porque nunca deixa a IA ficar confortável demais copiando o passado.

A Conclusão

O artigo não afirma ter resolvido todos os problemas da IA de vídeo, mas sugere que, ao tratar o "ruído" como uma ferramenta útil em vez de apenas algo a ser removido, podemos ensinar a IA a ser mais criativa e menos dependente de atalhos. Ao forçar o modelo a trabalhar com contextos "ruidosos", eles evitam que ele tome atalhos, resultando em vídeos que se movem de forma mais natural e são gerados muito mais rápido. Os autores demonstram que essa abordagem funciona não apenas na teoria, mas na prática, ofereando uma nova maneira de construir geradores de vídeo mais rápidos, inteligentes e que parecem mais vivos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →