← Últimos artigos
🤖 AI

MOSS-Video-Preview: Toward Real-Time Video Understanding via Cross-Attention

O artigo introduz o MOSS-Video-Preview, um framework de compreensão de vídeo em tempo real que emprega uma arquitetura de atenção cruzada de dois canais para desacoplar a percepção da geração, permitindo percepção contínua, revisão de respostas e silêncio oportuno, ao mesmo tempo em que alcança acelerações significativas em relação aos baselines offline com degradação mínima de desempenho.

Autores originais: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shan
Publicado 2026-06-09
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Pengyu Wang, Chenkun Tan, Shaojun Zhou, Wei Huang, Qirui Zhou, Zhan Huang, Zhen Ye, Jijun Cheng, Xiaomeng Qian, Yanxin Chen, Xingyang He, Huazheng Zeng, Chenghao Wang, Pengfei Wang, Hongkai Wang, Shanqing Gao, Yixian Tian, Chenghao Liu, Xinghao Wang, Botian Jiang, Xipeng Qiu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um jogo de esportes ao vivo na TV.

O Jeito Antigo (Offline): Você espera o jogo terminar completamente para só então se virar para o seu amigo e dizer: "Ok, aqui está o que aconteceu". Você perdeu a ação enquanto estava falando.
O Jeito Atual ("Streaming"): Você fala enquanto o jogo acontece, mas no momento em que abre a boca para falar, você para de olhar para a tela. Se um gol é marcado enquanto você está no meio de uma frase, você não sabe sobre isso até terminar sua sentença. Você tem que esperar, e então recomeçar para se corrigir.
O Novo Jeito (MOSS-Video-Preview): Você está assistindo à tela e falando exatamente ao mesmo tempo. Se um gol é marcado enquanto você diz "O time está jogando bem", você interrompe a si mesmo imediatamente, diz "Espera, eles acabaram de marcar!", e atualiza sua história. Se nada de interessante está acontecendo, você permanece em silêncio e apenas continua assistindo.

Este artigo apresenta o MOSS-Video-Preview, um novo modelo de IA projetado para fazer exatamente isso: assistir e falar simultaneamente sem que um interrompa o outro.

Veja como eles fizeram isso, usando analogias simples:

1. O Problema: O "Engarrafamento"

A maioria dos modelos de IA hoje é como uma estrada de pista única. Para entender um vídeo, o modelo tem que ler cada quadro, depois parar de ler para escrever sua resposta, e então parar de escrever para ler mais quadros. Isso cria um engarrafamento. O modelo não consegue "ver" coisas novas enquanto está "falando".

2. A Solução: Uma "Rodovia de Duas Faixas"

Os autores construíram uma arquitetura de dois canais. Imagine uma rodovia com duas faixas separadas:

  • Faixa A (Os Olhos): Esta faixa é dedicada puramente a assistir ao vídeo. Ela continua recebendo novos quadros (carros) constantemente.
  • Faixa B (A Boca): Esta faixa é dedicada puramente a falar (gerar texto).

Em modelos antigos, os "olhos" e a "boca" compartilhavam a mesma faixa, então eles tinham que se revezar. Neste novo modelo, os "olhos" fornecem informações para a "boca" pela lateral, como uma equipe de pit stop entregando um pneu novo para um piloto enquanto o carro ainda está em movimento. O carro (a IA) nunca precisa parar de dirigir para obter a nova informação.

3. O Ingrediente Secreto: "Cross-Attention" (Atenção Cruzada)

Para fazer esse sistema de duas faixas funcionar, eles usaram uma técnica específica chamada Cross-Attention.

  • Jeito Antigo: Imagine tentar ler um livro enquanto alguém grita a próxima página do livro no seu ouvido. Você tem que parar de ler para ouvir, e parar de ouvir para ler.
  • Novo Jeito: Imagine que você está lendo um livro e um amigo está parado ao seu lado. Quando você precisa saber o que está na próxima página, basta dar uma olhada rápida na cópia do seu amigo. Você não precisa parar de ler o seu próprio livro para fazer isso. O amigo (o vídeo) está sempre lá, pronto para ser consultado, sem interromper o seu fluxo de leitura.

4. Ensinando a IA a "Calar a Boca"

Um grande desafio é que, se uma IA assiste a um vídeo, ela pode se sentir compelida a descrever tudo o que vê, mesmo que nada esteja acontecendo.

  • A Correção: A equipe criou um método de treinamento especial. Eles ensinaram à IA uma nova regra: "Se nada de interessante acontecer, não diga nada."
  • Eles usaram um token especial chamado <|silence|>. A IA aprende a dizer este token quando vê uma cena estática. É como um segurança que só fala quando vê um ladrão; caso contrário, ele apenas fica parado observando.

5. Os Resultados: Mais Rápido e Mais Inteligente

Os autores testaram este modelo (que eles chamam de "preview" ou "prova de conceito") e descobriram:

  • Velocidade: Como os "olhos" e a "boca" não se bloqueiam, o modelo é muito mais rápido. Em um computador potente, ele foi 5 vezes mais rápido para começar a falar e 2,7 vezes mais rápido para falar continuamente em comparação com um modelo existente de ponta, mesmo sendo o modelo deles, na verdade, maior.
  • Precisão: É muito bom em entender quando as coisas acontecem e onde elas acontecem (raciocínio espacial e temporal), o que é crucial para a interação em tempo real.
  • A Troca (Trade-off): É ligeiramente menos bom em curiosidades gerais ou leitura de texto de imagens comparado aos maiores e mais famosos modelos de hoje. Os autores admitem que isso ocorre porque focaram na nova arquitetura e no comportamento em tempo real, em vez de apenas tornar o modelo maior ou alimentá-lo com mais dados.

Resumo

MOSS-Video-Preview é um protótipo de uma IA que age como um observador em tempo real. Ela não espera o vídeo terminar, e não para de assistir para falar. Ela assiste, fala, corrige a si mesma instantaneamente quando as coisas mudam e permanece em silêncio quando não há nada a dizer.

O artigo afirma que isso prova que o entendimento de vídeo em tempo real é possível com a arquitetura certa, mesmo que o modelo ainda não seja o mais inteligente do mundo. É uma "prova de conceito" que abre as portas para futuros assistentes de IA que podem realmente interagir com o mundo conforme as coisas acontecem.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →