← Últimos artigos
🤖 AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

O artigo apresenta o video-SALMONN S, um LLM de áudio-visual de streaming com memória aprimorada que utiliza treinamento em tempo de teste para converter continuamente representações de curto prazo em memória de longo prazo, permitindo que processe vídeos de mais de 3 horas e supere significativamente modelos existentes em benchmarks de longa duração e aprendizado episódico.

Autores originais: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

Publicado 2026-02-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar um robô a entender um filme que tem três horas de duração, mas você só pode mostrar a ele um quadro por segundo (uma visão muito lenta e travada) e a imagem é um pouco embaçada (resolução 360p). Além disso, o robô tem um "cérebro" muito pequeno (memória) que só consegue guardar uma quantidade minúscula de informação de cada vez.

A maioria dos robôs de IA atuais esquece o início do filme quando chega ao fim. Este artigo apresenta um novo robô chamado video-SALMONN S que resolve esse problema. Veja como ele funciona, usando analogias simples:

1. O Problema: O "Balde Furado"

Imagine tentar encher um balde com água (informação de vídeo) enquanto o balde tem um furo no fundo.

  • Os modelos de IA antigos são como baldes com furos grandes. Se você despejar um vídeo de 3 horas, a água (informação) vaza antes de você chegar ao fim. Eles precisam jogar fora a maior parte do vídeo para caber na memória, então esquecem detalhes importantes.
  • Os modelos de streaming (os melhores atuais) são melhores, mas ainda perdem informação ao longo do tempo porque precisam deletar constantemente dados antigos para abrir espaço para novos dados.

2. A Solução: O "Caderno de Autoedição" (TTT)

O ingrediente secreto do video-SALMONN S é uma técnica chamada Treinamento em Tempo de Teste (TTT - Test-Time Training).

  • A Analogia: Imagine que você está lendo um livro muito longo. Em vez de apenas ler e esquecer, você tem um caderno mágico. Toda vez que você lê uma nova página, você não apenas a anota; você reescreve seu próprio cérebro com base no que acabou de ler. Você atualiza sua compreensão da história enquanto está lendo.
  • Como funciona: Conforme o vídeo é reproduzido, o modelo ajusta constantemente suas próprias configurações internas (seus "pesos") para armazenar os detalhes da história. Ele transforma memórias de curto prazo (o que acabou de acontecer) em memórias de longo prazo (a história toda) ao mudar sua própria estrutura. É como se o robô estivesse "aprendendo" o vídeo em tempo real, em vez de apenas assisti-lo.

3. O Truque da "Previsão de Longo Alcance"

Para garantir que o robô não esqueça o início do filme, os autores adicionaram uma regra especial chamada Previsão de Longo Intervalo (Long-Span Prediction).

  • A Analogia: Imagine que você está jogando "Telefone Sem Fio" com um amigo, mas o jogo dura 3 horas. Normalmente, a mensagem fica distorcida. Este modelo tem uma regra: "Toda vez que você passar uma mensagem, você também deve verificar se ainda consegue se lembrar do que foi dito 30 minutos atrás".
  • O Resultado: Isso força o robô a manter as partes iniciais do vídeo claras em sua mente, mesmo enquanto está processando os quadros mais recentes.

4. O "Bibliotecário Inteligente" (Leitor de Memória)

Mesmo com um caderno mágico, você não consegue ler todas as páginas de um livro de 3 horas quando alguém faz uma pergunta específica. Isso levaria muito tempo.

  • A Analogia: Quando um usuário pergunta "O que acontece a seguir?", o robô age como um bibliotecário inteligente. Em vez de buscar em todo o arquivo de 3 horas, ele escaneia rapidamente sua memória, encontra as poucas páginas exatas relevantes para a pergunta e ignora o resto.
  • O Benefício: Isso mantém o robô rápido e eficiente, mesmo tendo assistido a horas de vídeo.

5. O Novo Teste: "ELViM" (O Desafio da Memória)

Os autores perceberam que os testes existentes eram fáceis demais; eles só perguntavam sobre vídeos que o robô estava assistindo naquele momento. Eles criaram um novo teste chamado ELViM (Aprendizado Episódico de Memória de Vídeo).

  • O Cenário: O robô assiste a um vídeo de alguém assando um bolo. Depois, ele assiste a 30 minutos de outros vídeos (como documentários sobre a natureza). Por fim, o vídeo do bolo volta, pausado exatamente antes de o padeiro quebrar um ovo.
  • A Pergunta: "Qual é o próximo passo?"
  • O Objetivo: O robô deve se lembrar da etapa do bolo de 30 minutos atrás, ignorar os documentários de natureza no meio e responder corretamente.
  • O Resultado: O video-SALMONN S esmagou este teste, sendo 15% melhor que os melhores modelos anteriores. Ele provou que o robô pode realmente "lembrar" de habilidades que aprendeu horas antes.

Resumo das Conquistas

  • Ele assiste a vídeos longos: Pode lidar com mais de 3 horas de vídeo a uma baixa taxa de quadros sem ficar sem memória.
  • Ele lembra melhor: Supera tanto os modelos de "streaming" (que assistem ao vivo) quanto os modelos "offline" (que veem o vídeo inteiro de uma vez) por uma margem significativa (3-7% melhor em testes padrão, 15% melhor no teste de memória).
  • É eficiente: Não precisa de um supercomputador para fazer isso; ele se ajusta a um orçamento de memória padrão.

Em resumo, o video-SALMONN S é a primeira IA que consegue assistir a um filme longo, aprender com ele e lembrar dos detalhes horas depois, tudo isso mantendo o uso de memória pequeno e constante.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →