← Últimos artigos
💻 computer science

Video = World + Event Stream

O artigo apresenta o Wan-Streamer v0.3, um modelo de interação audiovisual em tempo real que estrutura o vídeo como uma combinação de um "mundo" persistente e um "fluxo de eventos" dinâmico para permitir a predição de baixa latência e de propósito geral de mudanças ambientais e comportamentos de agentes.

Autores originais: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zh
Publicado 2026-07-20
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu, Chen Liang, Junjie He, Chen-Wei Xie, Yu Liu, Jingren Zhou, Ang Wang, Bang Zhang, Baole Ai, Chongyang Zhong, Jinwei Qi, Kai Zhu, Pandeng Li, Peng Zhang, Wenyuan Zhang, Xinhua Cheng, Yitong Huang, Yun Zheng, Yuxiang Bao, Yuzheng Wang, Zhiwei Lin, Zoubin Bi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um filme, mas em vez de apenas sentar e assistir, você está dentro da cena, conversando com os personagens, e eles respondem a você instantaneamente. Este é o emocionante mundo da inteligência artificial em tempo real, onde os computadores tentam nos entender e responder tão rápido quanto um amigo humano faria. Para fazer isso, a IA precisa equilibrar três coisas ao mesmo tempo: o que ela vê (vídeo), o que ela ouve (áudio) e o que ela diz ou faz (texto e ações). Por muito tempo, fazer a IA realizar tudo isso sem atrasos era como tentar correr uma maratona carregando uma mochila pesada; era lento e desajeitado. A grande questão que os pesquisadores têm feito é: Como podemos ensinar uma IA a entender o "palco" em que está e a "ação" que ocorre nele, para que ela possa reagir de forma natural e instantânea?

Conheça o Wan-Streamer v0.3, uma nova criação da Equipe Wan, do Alibaba Group. Pense neste artigo como uma receita inteligente para um ator digital superveloz e superinteligente. Os autores perceberam que, em vez de tratar um vídeo como uma massa gigante e confusa de pixels mudando, podemos decompô-lo em duas partes simples: um Mundo e um Fluxo de Eventos. O "Mundo" é a parte estável — o quarto em que você está, os móveis, o rosto da pessoa e o ruído de fundo. Isso não muda muito. O "Fluxo de Eventos" é tudo o que muda — a pessoa andando, falando, acenando ou o carro passando. Ao ensinar a IA que um vídeo é apenas um "Mundo" mais um "fluxo de eventos", eles descobriram uma maneira de tornar a IA muito mais inteligente e rápida ao prever o que acontece a seguir.

A Grande Ideia: O Palco e a Peça

O artigo propõe uma nova forma de olhar para o vídeo. Imagine um teatro. O Mundo é o cenário: o pano de fundo pintado, a iluminação, os adereços e o figurino do ator. Uma vez que a peça começa, essas coisas permanecem quase as mesmas. O Fluxo de Eventos é a própria peça: o ator atravessando o palco, gritando uma fala, deixando cair um objeto ou virando-se.

No passado, os modelos de IA tentavam aprender toda a peça e todo o cenário de uma só vez, o que era difícil. O Wan-Streamer v0.3 sugere um truque mais simples: ensine a IA o cenário uma vez e depois foque apenas na peça.

Os pesquisadores treinaram seu modelo em uma quantidade massiva de vídeos do mundo real. Eles não pediram apenas para a IA adivinhar o próximo quadro; eles a ensinaram a observar um "Mundo" (como uma rua suburbana ensolarada ou um galinheiro) e então prever o "Fluxo de Eventos" (como um robô correndo pela rua ou uma mulher alimentando galinhas). O modelo aprendeu que, se um robô está em uma calçada, ele pode correr em direção a um carro, abrir a porta e ir embora. Se uma mulher está em um galinheiro, ela pode caminhar até um balde e pegar a ração. Ao aprender esses padrões, a IA constrói um "conhecimento de mundo" sobre como as coisas se movem e mudam de forma plausível.

O Truque de Mágica: Falando e Agindo ao Mesmo Tempo

Então, o que isso realmente faz? A equipe testou essa ideia em uma interação audiovisual de tempo real e full-duplex. "Full-duplex" é uma maneira sofisticada de dizer que a IA pode falar e ouvir ao mesmo tempo, exatamente como uma conversa real, sem esperar que você termine.

Nesta nova versão (v0.3), o agente de IA não é apenas uma "cabeça falante". Ele agora pode realizar comportamentos de forma livre.

  • Jeito antigo: A IA poderia apenas acenar com a cabeça ou olhar para você enquanto fala.
  • Jeito novo: A IA pode dizer: "(pega uma caneca de café e toma um gole) Obrigado pelo lembrete," ou "(franze levemente a testa) O que você quis dizer com isso?"

O artigo explica que a IA escreve sua resposta em um formato especial de "role-play" (encenação). Ela mistura palavras faladas com ações escritas entre parênteses. Como a IA aprendeu o "Mundo" (o cenário e o personagem), ela sabe que, se disser "(pega uma caneca)", o gerador de vídeo realmente mostrará o personagem pegando uma caneca que combine com a cena. Isso acontece em tempo real, e a fala, a ação e o vídeo permanecem perfeitamente sincronizados.

A Velocidade: Rápida o Suficiente para Parecer Real

Uma das partes mais impressionantes deste artigo é que eles não sacrificaram a velocidade por essa nova inteligência. Os autores mostram que o Wan-Streamer v0.3 mantém o desempenho ultrarrápido de sua versão anterior (v0.2).

  • Qualidade do Vídeo: Ele ainda produz vídeo em resolução 640×368.
  • Fluidez: Ele roda a 25 FPS (quadros por segundo), o que é fluido o suficiente para parecer natural.
  • Velocidade: A IA leva cerca de 200 milissegundos para pensar e gerar uma resposta por conta própria. Quando você adiciona o tempo que a internet leva para enviar e receber os dados (um orçamento de 350 milissegundos), o tempo total de espera por uma resposta é de cerca de 550 milissegundos.

Para colocar em perspectiva, 550 milissegundos é menos de um segundo. É rápido o suficiente para que a conversa pareça um chat real com um amigo, não um robô esperando uma barra de carregamento.

O Que Isso Significa (e o Que Não Significa)

O artigo sugere que, ao separar o "Mundo" dos "Eventos", podemos criar IAs que são mais flexíveis. Elas podem ser treinadas em qualquer tipo de vídeo e depois especializadas para diferentes tarefas, como um robô navegando em uma sala ou um personagem em um videogame. Os autores mostram que essa abordagem funciona para o caso de teste específico deles: um personagem digital que fala e age em tempo real.

No entanto, o artigo é cuidadoso ao notar que esta é uma demonstração específica. Eles mostraram que o modelo pode fazer isso, e mediram a velocidade e a qualidade. Eles não alegaram ter resolvido todos os problemas da IA, nem listaram todos os possíveis usos futuros. Eles simplesmente apresentam uma nova forma de pensar sobre a geração de vídeo que torna a IA mais inteligente sobre como o mundo funciona, mantendo-a rápida o suficiente para conversar com você agora mesmo.

Em resumo, o Wan-Streamer v0.3 é como dar a um ator digital um roteiro que diz: "Aqui está o palco, aqui está o seu figurino e aqui está a história. Agora, vá atuar, falar e se mover, e faça tudo isso antes que eu consiga sequer piscar." E, graças a esse novo truque de "Mundo + Evento", parece que ele está fazendo exatamente isso.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →