← Últimos artigos
🤖 AI

Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models

O Wan-Streamer é um modelo de fundação interativo, nativo de streaming e ponta a ponta que unifica o processamento de linguagem, áudio e vídeo dentro de um único Transformer para alcançar comunicação multimodal full-duplex de sub-segundo com aproximadamente 200 ms de latência do lado do modelo, eliminando o acúmulo de erros e os atrasos inerentes aos sistemas em cascata tradicionais.

Autores originais: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu
Publicado 2026-06-25
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Lianghua Huang, Zhifan Wu, Wei Wang, Yupeng Shi, Mengyang Feng, Junjie He, Chenwei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chen Liang, Cheng Yu, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Zoubin Bi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tendo uma conversa com um amigo. Você não espera que ele termine a frase inteira, para para pensar e só então começa a falar. Em vez disso, você ouve enquanto ele fala, você acena com a cabeça, mantém contato visual, talvez o interrompa com um "Espera, sério?" ou uma risada, e começa a formar sua resposta enquanto ele ainda está falando. Isso é uma interação full-duplex: tudo acontece ao mesmo tempo, sobrepondo-se e fluindo naturalmente.

Por muito tempo, os computadores foram péssimos nisso. Eles geralmente trabalham como uma corrida de revezamento com corredores separados:

  1. O Corredor A ouve sua voz e a transforma em texto (Speech-to-Text).
  2. O Corredor B lê o texto e pensa em uma resposta (O Cérebro).
  3. O Corredor C transforma essa resposta de volta em fala (Text-to-Speech).
  4. O Corredor D pega essa fala e anima um rosto para corresponder às palavras (Geração de Vídeo).

Quando a resposta chega aos seus ouvidos, há muito atraso (lag), e o computador muitas vezes perde suas expressões faciais ou interrompe você de forma estranha porque os "corredores" não conseguem conversar entre si rápido o suficiente.

Wan-Streamer é um novo tipo de IA que tenta ser um único humano superveloz em vez de uma equipe de revezamento. Veja como funciona, usando analogias simples:

1. O "Músico Solo" vs. A "Orquestra"

A maioria dos sistemas atuais é como uma orquestra onde o violinista, o baterista e o cantor estão em salas diferentes. Eles têm que esperar um sinal para começar a tocar sua parte. Se o baterista estiver lento, a música inteira arrasta.

Wan-Streamer é como um músico solo que toca violão, canta e mantém o ritmo, tudo ao mesmo tempo. Ele não possui módulos separados para ouvir, pensar, falar ou mover o rosto. É um único "cérebro" (um modelo Transformer) que vê seu vídeo, ouve sua voz e lê seu texto ao mesmo tempo, e então decide imediatamente o que dizer, como soar e como mover o rosto simultaneamente.

2. O "Pensador" e o "Performer"

Para tornar isso incrivelmente rápido, os criadores dividiram o trabalho em dois papéis que trabalham em perfeita sincronia, como um maestro e um músico:

  • O Pensador: Esta parte ouve você, entende o que você está dizendo e planeja a resposta. É como o maestro decidindo a próxima nota.
  • O Performer: Esta parte pega o plano e realmente cria o som e o vídeo. É como o músico tocando o instrumento.

Aqui está o truque de mágica: Enquanto o Performer está ocupado criando o vídeo e o áudio para a sua resposta atual, o Pensador já está ouvindo a sua próxima frase e planejando a próxima resposta. Eles passam o bastão de volta e para frente tão rápido que não há tempo de espera. Isso permite que o sistema acompanhe uma conversa em tempo real sem travar.

3. A "Transmissão ao Vivo" vs. O "Filme Editado"

Sistemas de vídeo de IA mais antigos são como editar um filme: eles esperam até que toda a cena seja filmada, depois a editam. Se você quiser mudar uma linha, eles têm que reeditar o filme inteiro.

Wan-Streamer é como uma transmissão de notícias ao vivo. Ele gera o vídeo quadro a quadro conforme acontece.

  • Se você parar de falar, a IA não trava; ela continua "respirando", piscando e olhando para você, exatamente como uma pessoa real esperando que você continue.
  • Se você interromper a IA, ela para imediatamente e ouve você, em vez de terminar a frase porque está "travada na tarefa".
  • Ela reage às suas expressões faciais instantaneamente. Se você parecer confuso, ela pode diminuir o ritmo ou se explicar, tudo dentro do mesmo milésimo de segundo.

4. Quão Rápido é Isso?

O artigo afirma que este sistema é incrivelmente rápido:

  • O "Tempo do Cérebro" da IA: Leva cerca de 200 milissegundos (0,2 segundos) para a IA ouvir você, pensar e começar a gerar uma resposta. Isso é mais rápido que um piscar de olhos humano.
  • O Tempo Total de Conversa: Quando você adiciona o tempo que a internet leva para enviar o sinal de ida e volta (cerca de 350 ms), o atraso total é de cerca de 550 milissegundos (0,55 segundos).

Para colocar em perspectiva: Se você estivesse conversando com um amigo em uma chamada de vídeo com um atraso de 0,5 segundo, você mal notaria. Você poderia interrompê-lo, e ele reagiria naturalmente.

O Que o Torna Especial?

O artigo enfatiza que o Wan-Streamer não apenas "cola" diferentes ferramentas. Ele aprendeu a ouvir, falar e mover o rosto ao mesmo tempo desde o início.

  • Sem "Intermediário de Texto": Ele não precisa transformar sua voz em texto e depois de volta em voz. Ele entende som e vídeo diretamente.
  • Ritmo Natural: Como aprende com conversas reais onde as pessoas falam umas sobre as outras, ele sabe quando pausar, quando acenar com a cabeça e quando intervir. Não soa robótico ou travado.

O Resumo Final

Wan-Streamer é um protótipo de um humano digital que pode manter uma conversa real, face a face, com você. Ele não apenas responde perguntas; ele observa você, ouve você e reage a você com um rosto e uma voz que parecem vivos, mantendo a conversa fluindo sem pausas estranhas. É um passo em direção a uma IA que parece menos um programa de computador e mais uma pessoa sentada à sua frente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →