← Últimos artigos
💻 computer science

Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation

O artigo apresenta o Hallo-Live, um framework de streaming em tempo real para geração conjunta de avatares de áudio e vídeo que alcança desempenho de alta velocidade e baixa latência por meio de difusão assíncrona de duplo fluxo com Atenção de Expansão Futura e DMD Guiado por Preferências Centradas no Humano, superando significativamente os modelos existentes tanto em eficiência quanto em qualidade de geração.

Autores originais: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Publicado 2026-04-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Chunyu Li, Jiaye Li, Ruiqiao Mei, Haoyuan Xia, Hao Zhu, Jingdong Wang, Siyu Zhu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você quer criar um personagem digital (um avatar) que possa falar e mover os lábios em perfeita sincronia com tudo o que você digita. Geralmente, criar esses personagens é como tentar assar um bolo complexo: leva muito tempo, e se você tentar acelerar o processo, o bolo frequentemente fica achatado ou torto.

O artigo apresenta Hallo-Live, um novo sistema que torna a criação desses avatares falantes tão rápida quanto enviar uma mensagem de texto, sem comprometer a qualidade. Veja como funciona, usando analogias simples:

1. O Problema: O Ator "Cego"

Nos sistemas anteriores, o computador atua como um ator estritamente proibido de olhar para o roteiro até o momento exato em que precisa falar.

  • O Problema: Na vida real, quando falamos, nossos lábios começam a se mover antes que o som saia realmente da nossa boca. Preparamo-nos para o próximo som.
  • O Jeito Antigo: Como os antigos modelos de computador não podiam "espiar" as próximas palavras, os lábios do avatar ficavam atrasados em relação à voz, parecendo robóticos e dessincronizados.
  • O Problema da Velocidade: Para fazer o avatar parecer bom, o computador geralmente precisava realizar uma quantidade massiva de cálculos para cada segundo de vídeo. Isso levava muito tempo para um bate-papo em tempo real.

2. A Solução: O Ator "Leitor do Futuro"

O Hallo-Live resolve o problema do atraso com um truque chamado Atenção de Expansão Futura.

  • A Analogia: Imagine que o avatar é um ator que tem permissão para espiar a próxima frase no roteiro enquanto fala a frase atual.
  • Como funciona: O sistema dá à parte de vídeo do cérebro uma pequena janela de "olhar à frente". Ele vê o áudio atual e os próximos sons que estão por vir. Isso permite que o avatar comece a mover os lábios em antecipação ao próximo som, assim como um humano faz. Isso faz com que a sincronia labial pareça natural e imediata, mesmo que o sistema ainda esteja operando em "tempo real".

3. O Impulso de Velocidade: O Aluno "Destilado"

Para tornar o sistema rápido o suficiente para funcionar instantaneamente, os pesquisadores usaram uma técnica chamada Destilação.

  • A Analogia: Pense no modelo original de alta qualidade como um Chef Mestre que leva 2 horas para preparar uma refeição perfeita. O novo modelo é um Chef Estagiário.
  • O Problema: Geralmente, quando você ensina um estagiário a cozinhar tão rápido quanto o mestre, ele se apressa e comete erros (a comida fica sem graça ou parece desorganizada).
  • A Correção (Preferência Centrada no Humano): Em vez de apenas dizer ao estagiário para "copiar o mestre", os pesquisadores deram ao estagiário um Painel de Degustação.
    • Eles não disseram apenas: "Faça parecer com o mestre".
    • Eles disseram: "Certifique-se de que o rosto pareça real (Fidelidade Visual)", "Certifique-se de que a voz soe natural (Naturalidade da Fala)" e "Certifique-se de que os lábios correspondam às palavras (Sincronia)".
    • Se a "cozinha" do estagiário obtiver pontuação alta nessas preferências humanas específicas, ele recebe uma "recompensa". Se parecer robótico ou dessincronizado, recebe uma pontuação menor.
    • Isso ensina o estagiário a ser rápido sem sacrificar as coisas que os humanos mais valorizam.

Os Resultados: Um Truque de Mágica

O artigo afirma que, em chips de computador potentes (GPUs NVIDIA H200), este novo sistema alcança:

  • Velocidade: Gera vídeo a 20,38 quadros por segundo. Isso é rápido o suficiente para uma conversa ao vivo.
  • Atraso: Leva apenas 0,94 segundos para começar. Isso é menos de um segundo de espera.
  • Comparação: É 16 vezes mais rápido e 99 vezes menos atrasado do que o anterior "Chef Mestre" (o modelo Ovi), mas ainda produz vídeo de alta qualidade onde os lábios se movem perfeitamente com a voz.

O Que Ele Pode Fazer

O artigo mostra que este sistema funciona bem em vários cenários:

  • Pessoas Realistas: Criando retratos fotorealistas de pessoas falando.
  • Desenhos Animados: Criando personagens estilizados e animados.
  • Grupos: Lidando com cenas com duas pessoas conversando entre si.
  • Diferentes Ângulos: Funcionando para close-ups de rostos ou planos gerais do corpo inteiro.

Em resumo, o Hallo-Live é como dar a um ator digital um roteiro no qual ele pode espiar adiante e um conjunto de degustadores rigorosos para garantir que ele não apresse sua atuação, resultando em um avatar falante que parece vivo e responde instantaneamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →