← Últimos artigos
⚡ electrical engineering

Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

O artigo apresenta o Audio-Visual Flamingo (AV-Flamingo), um modelo de linguagem de grande escala totalmente aberto e de última geração, projetado para a compreensão e o raciocínio conjuntos sobre vídeos complexos e longos do mundo real ao aproveitar um novo e massivo conjunto de dados, um currículo de treinamento progressivo de três estágios e uma nova estrutura de cadeia de pensamento temporal intercalada.

Autores originais: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon K
Publicado 2026-07-20
📖 4 min de leitura☕ Leitura rápida

Autores originais: Sreyan Ghosh, Arushi Goel, Kaousheik Jayakumar, Lasha Koroshinadze, Nishit Anand, Siddharth Gururani, Hanrong Ye, Pritam Biswas, Yuanhang Su, Ehsan Hosseini-Asl, Sang-gil Lee, Zhifeng Kong, Jaehyeon Kim, Sungwon Kim, S Sakshi, Ramani Duraiswami, Dinesh Manocha, Andrew Tao, Mohammad Shoeybi, Bryan Catanzaro, Ming-Yu Liu, Wei Ping

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está assistindo a um filme. Você vê os rostos dos atores, o cenário e a ação, mas também ouve o diálogo, a música de fundo, o som de passos e o farfalhar das folhas. Por muito tempo, os computadores foram como pessoas que assistiam a um filme com os olhos colados de olhos fechados, apenas ouvindo a trilha sonora, ou vice-versa. Eles eram ótimos em reconhecer um gato em uma foto ou transcrever um discurso, mas tinham dificuldade em entender a cena inteira onde um gato mia enquanto corre pela tela. Este campo de estudo é chamado de inteligência "multimodal", onde as máquinas tentam combinar diferentes sentidos — como visão e audição — para entender o mundo como os humanos fazem. A grande questão que os pesquisadores têm feito é: Podemos construir uma IA que não apenas olhe para um vídeo ou ouça um podcast, mas que realmente pense sobre como o som e a imagem trabalham juntos, especialmente quando a história é longa e complicada?

Apresentamos o Nemotron-Labs-Audio-Visual Flamingo (ou AV-Flamingo, para encurtar), um novo tipo de cérebro de IA projetado por pesquisadores da NVIDIA e da Universidade de Maryland. Pense nas IAs de vídeo anteriores como estudantes que conseguem apenas ler uma única página de um livro didático e responder a uma pergunta rápida sobre ela. Se você pedisse para elas resumirem um filme inteiro ou explicassem uma cena complexa que muda ao longo de 15 minutos, elas se perderiam, esqueceriam o início ou confundiriam os personagens. O AV-Flamingo é diferente. É como um estudante super atento que consegue assistir a um filme inteiro, ouvir a trilha sonora e depois sentar-se para escrever um ensaio detalhado sobre como a música mudou o clima, por que um personagem reagiu de determinada maneira ou exatamente quando um som específico aconteceu em relação a um evento visual.

Os pesquisadores descobriram que, para fazer isso acontecer, não podiam apenas alimentar a IA com mais dos mesmos dados antigos. Eles tiveram que ensinar três novos truques. Primeiro, criaram uma biblioteca massiva de cerca de 7 milhões de exemplos de vídeos do mundo real (incluindo 4,8 milhões de pares de perguntas e respostas) especificamente projetados para testar a habilidade da IA de conectar som e visão ao longo do tempo. Eles chamaram isso de Audio-Visual-Skills. Segundo, eles não jogaram a IA de cabeça no fundo do poço; eles usaram um "currículo" que começava com clipes curtos para ensinar habilidades básicas e, depois, passava lentamente para vídeos mais longos e complexos para ensinar como acompanhar uma história ao longo do tempo. Terceiro, e talvez de forma mais engenhosa, ensinaram a IA a usar um "processo de pensamento" chamado Temporal Audio-Visual Interleaved Chain-of-Thought. Imagine a IA assistindo a um vídeo e fazendo uma pausa a cada poucos segundos para dizer: "Ok, neste segundo exato, o tambor bateu e, então, o personagem pulou". Isso ajuda a manter os pensamentos da IA fundamentados no tempo, para que ela não se confunda sobre o que aconteceu primeiro ou por último.

Os resultados são bastante impressionantes. Quando testado em mais de 15 desafios diferentes — que variam desde a compreensão de música e fala até a análise de vídeos longos e respostas a perguntas complexas — o AV-Flamingo superou outros modelos de código aberto de tamanho semelhante por uma margem clara. De fato, ele até conseguiu competir com, e às vezes vencer, modelos "fechados" muito maiores e mais caros (aqueles cujo código você não pode ver) que são atualmente os melhores do mundo. O artigo sugere que este modelo é particularmente bom em lidar com vídeos longos e complexos do mundo real, onde as pistas estão espalhadas pelo tempo, provando que, com os dados e métodos de treinamento corretos, a IA de código aberto pode alcançar os gigantes. É um grande passo em direção a dar aos computadores a capacidade de realmente "assistir e ouvir" o mundo, em vez de apenas encará-lo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →