← Últimos artigos
💻 computer science

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length

Este artigo apresenta o Live Avatar, uma estrutura de algoritmo-sistema co-projetada que possibilita a primeira geração de streaming prática, em tempo real e de comprimento infinito de avatares de 14 bilhões de parâmetros, combinando um pipeline de difusão causal destilado com Paralelismo de Pipeline de Forçamento de Passo de Tempo para alcançar 45 FPS enquanto elimina o desvio de identidade de longo horizonte.

Autores originais: Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi

Publicado 2026-08-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yubo Huang, Hailong Guo, Fangtai Wu, Weiqiang Wang, Shifeng Zhang, Shijie Huang, Qijun Gan, Lin Liu, Sirui Zhao, Enhong Chen, Jiaming Liu, Steven Hoi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a contar uma história. Você quer que ele fale, mova os lábios e mude suas expressões faciais em perfeita sincronia com sua voz, tudo enquanto parece um humano real. Este é o mundo da geração de avatares guiados por áudio. Por muito tempo, cientistas têm construído "atores digitais" usando um tipo de IA chamado modelo de difusão. Pense em um modelo de difusão como um escultor que começa com um bloco de estática ruidosa e vai, aos poucos, removendo o ruído para revelar uma estátua perfeita. Geralmente, este escultor trabalha em uma ordem muito rigorosa: ele deve terminar a cabeça antes de poder começar o corpo, e precisa fazer isso passo a passo, o que leva muito tempo.

O grande problema é que, se você pedir a este robô para contar uma história por uma hora, ele tende a ficar confuso. Ele pode esquecer como o rosto do personagem era cinco minutos atrás, ou sua voz pode começar a parecer a de uma pessoa totalmente diferente. Isso é chamado de "drift" (deriva). Além disso, como o escultor trabalha de forma lenta, você não pode ter uma conversa em tempo real com ele; quando ele termina de dizer uma frase, você já esqueceu o que disse. O objetivo dos pesquisadores tem sido construir um ator digital que seja rápido o suficiente para falar com você ao vivo, inteligente o suficiente para manter sua identidade por horas e detalhado o suficiente para ser fotorealista.

Apresentamos o Live Avatar, um novo projeto que atua como um maestro para uma enorme orquestra de chips de computador. Os pesquisadores por trás deste trabalho, liderados por equipes da Universidade de Ciência e Tecnologia da China e da Alibaba, descobriram como fazer um modelo de IA gigante de 14 bilhões de parâmetros (um modelo "14B", que é enorme no mundo da IA) falar, mover-se e transmitir vídeo em tempo real sem perder a sanidade.

Normalmente, tornar um vídeo tão longo e rápido assim é uma contradição. Você pode ter velocidade ou qualidade, mas não ambos. O Live Avatar resolve isso mudando a forma como a IA "pensa" sobre tempo e memória. Em vez de tentar lembrar cada detalhe perfeito do passado (o que faz a IA se confundir e sofrer deriva), o sistema armazena uma memória "ruidosa". Imagine tentar lembrar de uma música cantarolando a melodia grosseiramente, em vez de tentar recordar cada nota perfeitamente. Essa memória "grosseira" atua como um filtro, mantendo o rosto do personagem estável enquanto permite que a boca se mova naturalmente.

A equipe também inventou uma maneira inteligente de acelerar as coisas chamada Paralelismo de Pipeline de Forçamento de Passo de Tempo (Timestep-forcing Pipeline Parallelism). Imagine uma linha de montagem de uma fábrica onde, em vez de um único trabalhador fazer todas as etapas da construção de um carro, você tem uma equipe de trabalhadores. Em uma IA de vídeo normal, cada trabalhador espera o anterior terminar antes de começar. O Live Avatar muda as regras: cada trabalhador na linha (ou cada chip de computador, conhecido como GPU) recebe uma etapa específica. Enquanto o Trabalhador A está polindo as rodas, o Trabalhador B está pintando a porta e o Trabalhador C está instalando o motor, todos ao mesmo tempo. Isso transforma um processo sequencial lento em um processo paralelo rápido.

Os resultados são impressionantes. Em uma configuração com 5 poderosas placas gráficas H100, o Live Avatar pode gerar vídeo a 45 quadros por segundo (FPS), o que é mais rápido que a velocidade da visão humana. Leva apenas 1,21 segundo para começar a gerar o primeiro quadro após você falar. O mais importante é que ele pode continuar para sempre. Os pesquisadores testaram o sistema fazendo o avatar falar por mais de 10.000 segundos (quase três horas seguidas), e o personagem não sofreu deriva, não apresentou falhas e não perdeu sua identidade.

Isso não é apenas uma vitória teórica; a equipe construiu um novo campo de testes chamado GenBench para provar que outros métodos falham em durações longas enquanto o deles tem sucesso. Eles descobriram que, embora outros sistemas possam parecer bons por alguns segundos, eles começam a degradar, mudar de cor ou perder o rosto da pessoa após alguns minutos. O Live Avatar, no entanto, mantém a consistência. Isso sugere que, ao combinar uma estratégia de memória "ruidosa" com um sistema de linha de montagem inteligente, podemos finalmente ter humanos digitais prontos para conversas infinitas em tempo real.

O artigo descarta explicitamente a ideia de que você precisa treinar a IA em horas de vídeo para fazê-la funcionar por horas. Em vez disso, eles mostraram que treinar em clipes curtos (cerca de 3 segundos) é suficiente, desde que você use esse truque especial de "histórico ruidoso". Eles também argumentam contra a crença antiga de que você tem que escolher entre um modelo rápido e de baixa qualidade ou um modelo lento e de alta qualidade. Com o método deles, você pode ter um modelo gigante e de alta qualidade que roda em tempo real.

Embora o sistema seja incrivelmente rápido, os autores observam que ainda existe um pequeno atraso. O tempo entre o momento em que você fala e o vídeo aparece na tela é de cerca de 3 segundos, incluindo o tempo de tráfego de rede. Isso é rápido o suficiente para muitas interações, mas pode não ser totalmente rápido o suficiente para uma conversa fluida, face a face, onde cada milissegundo conta. No entanto, para streaming, assistentes virtuais e contação de histórias digitais, este é um salto enorme, sugerindo que a era dos avatares digitais infinitos e em tempo real não é mais apenas um sonho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →