← Últimos artigos
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

O OmniMate é um framework unificado que possibilita a geração de avatares audiovisual em tempo real, de alta qualidade, baixa latência e de código aberto, ao introduzir um Controlador de Progresso de Geração para progressão de resposta adaptativa e um Módulo de Condicionamento de Múltiplas Referências para garantir a consistência de identidade intermodal de longo prazo.

Autores originais: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Publicado 2026-07-29
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está conversando com um amigo que vive dentro de uma tela de computador. Você quer que ele não apenas fale, mas que mova as mãos, pisque e reaja à sua voz em tempo real, exatamente como uma pessoa real. Este é o sonho dos "avatares interativos". Por muito tempo, criar esses personagens digitais era como filmar um filme: você tinha que planejar cada fala e cada gesto antes de poder apertar o "play". Mas recentemente, cientistas construíram "modelos de difusão", que são como pincéis mágicos que podem criar instantaneamente vídeos e sons de alta qualidade a partir de texto. Essa tecnologia tornou-se tão boa que agora consegue fazer um personagem falar e se mover em sincronia com o áudio. No entanto, há um problema: esses modelos geralmente funcionam melhor quando sabem exatamente quão longa será a conversa. Se você tentar ter um chat fluido onde o computador tem que adivinhar quando parar de falar e começar a ouvir novamente, o personagem pode ficar confuso, continuar falando por tempo demais ou começar a parecer uma pessoa diferente após alguns minutos. Este artigo aborda exatamente esse problema: como criar um amigo digital que possa conversar com você para sempre, sem perder seu rosto ou sua voz, e sem atrasar em relação às suas palavras.

Os pesquisadores por trás deste projeto, uma equipe da Universidade Xi'an Jiaotong e da China Telecom, construíram um novo sistema chamado OmniMate. Pense no OmniMate como um marionetista digital superinteligente que pode lidar com uma conversa interminável em tempo real. Ao contrário de sistemas anteriores que poderiam tropeçar quando a conversa se tornava longa ou quando o usuário interrompia, o OmniMate é projetado para fluir naturalmente, alternando instantaneamente entre os modos de "falar" e "ouvir", mantendo o personagem com a mesma aparência e voz.

O segredo do sucesso do OmniMate reside em dois truques inteligentes que utiliza para se manter atento. Primeiro, ele utiliza algo chamado Controlador de Progresso de Geração (GPC). Imagine que você está lendo um livro de histórias, mas não sabe quantas páginas restam. Normalmente, você poderia continuar lendo além do fim ou parar cedo demais. O GPC é como um contador de páginas integrado que diz ao avatar exatamente quanto resta de sua resposta para ser gerada. Ele fornece ao sistema uma "barra de progresso" para cada pequeno fragmento de vídeo e áudio que cria. Isso permite que o avatar saiba precisamente quando terminar uma frase e alternar suavemente de volta para uma pose de "escuta", esperando pela sua próxima entrada. Sem isso, o avatar poderia continuar falando após terminar, ou congelar de forma estranha.

O segundo truque é o Módulo de Condicionamento de Múltiplas Referências (MRCM). Você já notou que, se olhar para uma foto de uma pessoa de um ângulo estranho, ela pode parecer um pouco diferente? Em vídeos longos, os avatares digitais frequentemente sofrem de "deriva de identidade", onde o rosto deles muda lentamente para o de outra pessoa, ou a voz muda de tom. O OmniMate resolve isso lembrando constantemente a si mesmo quem é o personagem. Em vez de apenas olhar para o primeiro quadro do vídeo, ele mantém um "banco de memória" de várias fotos de referência e uma amostra da voz do personagem. Enquanto o vídeo é reproduzido, ele verifica constantemente essas referências, como um pintor olhando de volta para um retrato para garantir que o nariz e os olhos permaneçam corretos, garantindo que o personagem pareça e soe o mesmo, esteja falando por 10 segundos ou 10 minutos.

A equipe testou o OmniMate em um benchmark chamado VerseBench, que simula conversas reais. Os resultados foram impressionantes: o sistema pode gerar vídeo e áudio a uma velocidade de 27,64 quadros por segundo (FPS), com um "tempo para o primeiro quadro" (quanto tempo leva para começar a mostrar o vídeo) de apenas 3,49 segundos. Isso é rápido o suficiente para parecer uma conversa real e ao vivo. Nos testes, o OmniMate superou outros modelos de ponta em manter a consistência do rosto e da voz do personagem durante períodos longos. Enquanto outros sistemas poderiam começar a parecer borrados ou mudar a voz após um minuto, o OmniMate permaneceu estável mesmo em testes que duraram até 240 segundos.

No entanto, os autores observam cautelosamente que o sistema ainda não é perfeito. Se o sistema adivinhar o tempo errado para uma resposta, o avatar pode cortar uma palavra ou repetir a si mesmo. Além disso, se o personagem precisar fazer algo que mude drasticamente sua aparência, como uma grande troca de figurino, o sistema pode ter dificuldades para manter a consistência da identidade. Mas, no geral, o OmniMate sugere um grande passo à frente: uma maneira de ter amigos digitais que possam conversar conosco em tempo real, lembrar quem são e reagir a nós sem os erros estranhos do passado. Ele transforma os vídeos estáticos e pré-planejados de hoje em conversas dinâmicas e vivas para o amanhã.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →