← Últimos artigos
💻 computer science

LiveAnimate: Stable Long-Form Streaming Human Animation in Real-Time

O LiveAnimate é um sistema de geração de vídeo em tempo real de escala bilionária, construído sobre um Diffusion Transformer de 14 bilhões de parâmetros, que alcança animação humana de fluxo contínuo e longa duração com latência constante e alta qualidade perceptual por meio de um pipeline de treinamento de dois estágios e um mecanismo especializado de Pose-Retrieval Sink Attention.

Autores originais: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

Publicado 2026-08-13
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Yuxuan Zhang, Haozhong Xiong, Yubo Huang, Jiayi Song, Jinpeng Yu, Haofan Wang, Jiaming Liu, Ruihua Huang, Liwei Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a dançar. Você fornece a ele uma foto de uma pessoa e um fluxo de movimentos de dança, e quer que o robô gere instantaneamente um vídeo dessa pessoa realizando a dança. Este é o mundo da "animação humana impulsionada por pose". Por muito tempo, os melhores robôs só consegravam fazer isso em "modo offline". Pense nisso como assar um bolo complexo: você mistura os ingredientes, espera horas para que ele cresça, assa e, finalmente, serve. Se você quisesse mudar o passo de dança, teria que recomeçar todo o processo de cozimento. Isso é ótimo para fazer filmes, mas terrível para transmissões ao vivo ou videogames, onde você precisa que o robô reaja agora mesmo. O grande desafio tem sido criar um robô que seja ao mesmo tempo incrivelmente inteligente (para parecer real e manter a consistência) e incrivelmente rápido (para acompanhar uma transmissão ao vivo) sem que o vídeo se desfaça após alguns minutos.

Apresentamos o LiveAnimate, um novo sistema que finalmente preenche essa lacuna. Os pesquisadores construíram um "dançarino digital" que pode gerar um vídeo de uma pessoa dançando em tempo real, bloco por bloco, mantendo o rosto e as roupas da pessoa exatamente iguais durante toda a duração da transmissão. É como ter um marionetista ao vivo que nunca se cansa, nunca esquece a aparência do fantoche e consegue manter o show por horas sem que o rosto do fantoche derreta ou suas roupas mudem de cor. O artigo mostra que este sistema pode rodar a cerca de 20 quadros por segundo (o que parece movimento em tempo real) em computadores potentes, mantendo alta qualidade por pelo menos três minutos seguidos, um feito que métodos anteriores não conseguiam fazer em tempo real ou levariam horas para computar.

O Truque de Mágica: Como Funciona

Para entender como o LiveAnimate realiza esse truque, temos que olhar para os três principais ingredientes que ele mistura: um cérebro superinteligente, uma rotina de treinamento especial e um truque de memória inteligente.

1. O Cérebro: Um Gigante Transformer de Vídeo
No coração do sistema está um modelo de IA massivo chamado "Diffusion Transformer" (ou DiT) com 14 bilhões de parâmetros. Imagine isso como uma biblioteca gigante de todas as formas possíveis de um corpo humano se mover e parecer. Normalmente, essas bibliotecas são "bidirecionais", o que significa que podem olhar para o futuro e para o passado para entender uma cena. Mas para uma transmissão ao vivo, você não pode olhar para o futuro; você só pode reagir ao que está acontecendo agora. Os pesquisadores tiveram que treinar esse céreico cérebro gigante para ser "causal", o que significa que ele só olha para o passado e para o presente, exatamente como um humano assistindo a uma dança em tempo real.

2. O Treinamento: Duas Etapas de Aprendizado
Você não pode simplesmente dizer a um cérebro de 14 bilhões de parâmetros para "ir ao vivo" e esperar que funcione. O artigo descreve um processo de treinamento de duas etapas para prepará-lo:

  • Etapa 1 (O Professor): Primeiro, eles ensinam o modelo usando "Reference-Anchored Teacher-Forcing" (Forçamento do Professor Ancorado na Referência). Imagine um professor segurando um roteiro perfeito (a verdade fundamental/ground truth) e guiando o aluno (a IA) através da dança, bloco por bloco. O aluno aprende a copiar os movimentos perfeitamente enquanto sempre mantém a foto de referência em mente para que o dançarino pareça a pessoa certa.
  • Etapa 2 (A Corrida Contra o Tempo): A primeira etapa ainda é muito lenta para o tempo real. Por isso, na segunda etapa, eles usam uma técnica chamada "Block-wise Self-Forcing Distillation" (Destilação de Forçamento Próprio por Blocos). Isso é como pegar o aluno, deixá-lo praticar a dança sozinho sem o professor e, em seguida, corrigir apenas o movimento atual que ele está fazendo agora. Isso permite que o modelo apreça com seus próprios erros sem precisar lembrar de todo o histórico da dança em sua memória de uma só vez. O resultado? O modelo aprende a gerar vídeo de alta qualidade em apenas 3 passos em vez dos 50 habituais, tornando-o rápido o suficiente para rodar em tempo real.

3. O Truque de Memória: O Pose-Retrieval Sink
Aqui está a parte mais criativa. Se você pedir a um computador para lembrar de um vídeo de 3 minutos, ele geralmente fica sem memória ou começa a ficar confuso. Se o dançarino fizer uma pose que ele fez há 2 minutos, um sistema normal pode ter esquecido como ele era naquela pose exata, levando a glitches estranhos ou a um rosto que parece ligeiramente diferente.

O LiveAnimate resolve isso com um sistema de memória inteligente chamado Pose-Retrieval Sink Attention (PR-Sink). Imagine que a IA tem um bloco de notas adesivas (Rolling Window) que contém apenas os últimos segundos da dança. Mas ela também tem uma "Biblioteca de Poses" (Memory Bank) onde armazena instantâneos de poses específicas que já viu antes.

  • O Sink Estático: Este é um âncora permanente. Ele mantém o primeiro quadro do vídeo travado na memória para sempre, garantindo que a identidade do dançarino nunca se desvie.
  • O Sink Dinâmico: Este é o segredo. Quando o dançarino faz uma pose que corresponde a uma na "Biblioteca de Poses", o sistema instantaneamente pega a "nota adesiva" daquele momento passado e a cola na visualização atual. É como se o dançarino subitamente lembrasse: "Oh, eu fiz esse movimento há 2 minutos, e eu estava ótimo então!" e copiasse instantaneamente aquele visual exato. Isso acontece sem que o sistema precise lembrar de todo o vídeo de 3 minutos, mantendo o uso de memória constante, não importa o quão longa seja a transmissão.

Os Resultados: Rápido, Estável e Real

Os pesquisadores testaram o LiveAnimate em uma sequência de dança de três minutos. Os resultados foram impressionantes. Enquanto outros sistemas levaram de 2 a 5 horas para gerar o mesmo clipe ou começaram a degradar (o rosto ficava borrado, as roupas mudavam de cor ou a identidade mudava) após um minuto, o LiveAnime manteve a qualidade constante do primeiro ao último segundo.

  • Velocidade: Ele roda a aproximadamente 19,63 quadros por segundo em duas GPUs NVIDIA H100 de alto desempenho. Isso é rápido o suficiente para parecer uma interação ao vivo.
  • Consistência: O sistema manteve uma pontuação quase perfeita para qualidade visual e consistência de identidade durante todos os três minutos. Em contraste, outros métodos viram sua qualidade cair significativamente conforme o vídeo ficava mais longo.
  • Eficiência: O uso de memória permanece o mesmo, seja o vídeo de 10 segundos ou de 10 minutos, graças ao truque inteligente da "Biblioteca de Poses".

O Que Ele Não É (Ainda)

O artigo é cuidadoso ao notar o que este sistema não faz. Atualmente, ele gera vídeo em uma resolução de 480×480 pixels, o que é bom para uma tela, mas não para qualidade de cinema de Hollywood. Ele também foca em cenas de uma única pessoa e ainda não lida com várias pessoas dançando juntas ou movimentos de câmera complexos. Os autores sugerem que levar esses limites para resoluções mais altas e cenas mais complexas é o próximo passo para trabalhos futuros.

Por Que Isso Importa

O LiveAnimate representa um novo ponto de operação para a IA. Ele prova que não precisamos escolher entre "alta qualidade" e "velocidade em tempo real". Ao combinar um cérebro de IA massivo com um sistema de memória inteligente e limitado, os pesquisadores criaram uma ferramenta que pode impulsionar a próxima geração de avatares interativos, concertos virtuais ao vivo e sistemas de telepresença onde um humano digital pode dançar, falar e interagir com você instantaneamente, sem nunca esquecer quem é.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →