← Últimos artigos
💻 computer science

EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration

EverAnimate é um método eficiente de pós-treinamento que permite animação humana em escala de minutos, combinando propagação latente persistente e correspondência de fluxo restauradora para ancorar a geração em uma memória de contexto latente, eliminando assim o desvio visual e semântico acumulado, ao mesmo tempo que preserva a identidade do personagem e a qualidade do fundo.

Autores originais: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

Publicado 2026-05-15
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Wuyang Li, Yang Gao, Mariam Hassan, Lan Feng, Wentao Pan, Po-Chien Luan, Alexandre Alahi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando filmar um longa-metragem contínuo de um dançarino executando uma rotina complexa. Você tem uma foto do dançarino (a referência) e um roteiro de seus movimentos (as poses). Seu objetivo é gerar um vídeo que siga o roteiro perfeitamente, mantendo o dançarino com a aparência exata da pessoa na foto, mesmo após 90 segundos de dança.

O artigo EverAnimate aborda um problema específico: quando a IA tenta criar esses vídeos longos, eles tendem a "desviar", assim como uma cópia de uma cópia de uma cópia acaba ficando borrada e irreconhecível.

Veja como o artigo explica o problema e sua solução, usando analogias simples:

O Problema: O "Bug Copiar e Colar"

Os métodos atuais tentam criar vídeos longos costurando juntos clipes curtos (fatias). Imagine que você está copiando um parágrafo de texto, depois copiando essa cópia para fazer o próximo parágrafo, e assim por diante.

  • O Desvio do Fundo (Baixo Nível): O fundo (como uma parede ou uma árvore) deveria permanecer estático. Mas, como a IA continua re-copiando a imagem para iniciar o próximo clipe, a parede começa a parecer desfocada, as cores mudam e, eventualmente, ela parece uma fotocópia ruim.
  • O Desvio da Identidade (Alto Nível): O dançarino deveria manter a mesma aparência. Mas, conforme o vídeo fica mais longo, o rosto do dançarino pode mudar lentamente de forma, suas roupas podem mudar de cor ou seu cabelo pode parecer diferente. Eles perdem sua "identidade".

O artigo argumenta que os métodos existentes tentam corrigir isso mostrando à IA a foto original repetidamente (como um "sumidouro" ou âncora), mas isso não é suficiente. A IA ainda fica confusa com o processo de cópia repetida.

A Solução: EverAnimate

Os autores propõem uma nova maneira de gerar esses vídeos que ocorre inteiramente dentro do "cérebro" da IA (seu espaço latente), em vez de re-fotografar o vídeo. Eles usam dois truques principais:

1. A "Mochila Persistente" (Propagação Latente Persistente)

Em vez de pegar a saída do vídeo, transformá-la de volta em uma imagem e, em seguida, alimentar essa imagem de volta na IA para o próximo clipe (o que causa os erros de "copiar e colar"), o EverAnimate mantém uma mochila de memória dentro da IA.

  • Como funciona: Quando a IA termina uma fatia do vídeo, ela não olha para a imagem final. Em vez disso, ela passa uma "mochila" de dados brutos (códigos latentes) para a próxima fatia.
  • O que há na mochila?
    • Memória de curto prazo: Os últimos segundos de movimento para manter a dança suave.
    • Memória de longo prazo: Uma coleção de "cartões de identificação" (imagens multiview) do rosto e das roupas do dançarino para garantir que eles nunca mudem de aparência.
  • A Analogia: Imagine uma corrida de revezamento. Em vez de o corredor entregar a você uma foto borrada do corredor anterior para copiar, ele entrega a você um chip de dados direto e de alta qualidade que diz exatamente como continuar a corrida sem perder as características do corredor original.

2. A "Bússola de Autocorreção" (Correspondência de Fluxo Restauradora)

Mesmo com uma boa mochila, a IA pode ocasionalmente dar uma guinada errada durante a geração de um único clipe.

  • O Problema: Se a IA começar a desviar ligeiramente do curso (por exemplo, o braço do dançarino parecer um pouco estranho), os métodos padrão continuam apenas seguindo em frente, piorando o erro.
  • A Correção: O EverAnimate treina a IA com uma "bússola" especial. Durante o treinamento, a IA recebe intencionalmente um caminho ligeiramente "quebrado" ou distorcido para seguir. Ela aprende a reconhecer que está fora de rota e ativaamente se redireciona para o caminho correto e limpo.
  • A Analogia: Pense em um caminhante andando na neblina. Um caminhante normal pode se desviar de um penhasco porque não consegue ver o caminho. O EverAnimate é como um caminhante com um GPS que vibra sempre que ele dá um passo fora da trilha, empurrando-o gentilmente de volta para o caminho seguro antes que ele se perca.

Os Resultados

O artigo afirma que, ao usar esses dois métodos (a mochila de memória e a bússola de autocorreção), o EverAnimate pode gerar vídeos que duram minutos (até 90 segundos em seus testes) sem que o fundo fique borrado ou o personagem mude de rosto.

  • Vídeos curtos (10 segundos): Já é melhor do que os melhores métodos existentes.
  • Vídeos longos (90 segundos): A melhoria é massiva. O vídeo permanece nítido, o fundo permanece estável e o personagem mantém exatamente a mesma aparência do início ao fim.

Resumo

Em resumo, o EverAnimate impede que a IA faça "cópias de cópias" de um vídeo. Em vez disso, ele mantém uma memória digital de alta qualidade do personagem e da cena, e treina a IA para corrigir seus próprios erros à medida que avança, permitindo animações suaves, de alta qualidade e com duração de minutos que não se desfazem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →