← Últimos artigos
💻 computer science

InternVideo-Next: Towards General Video Foundation Models without Video-Text Supervision

O artigo apresenta o InternVideo-Next, um modelo de fundação para vídeo que supera as limitações da supervisão texto-vídeo e dos problemas de arquitetura tradicionais ao introduzir um novo framework Encoder-Predictor-Decoder e um esquema de pré-treinamento em duas etapas baseado em difusão condicional, alcançando resultados state-of-the-art em tarefas gerais sem depender de legendas.

Autores originais: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Publicado 2026-03-31
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Chenting Wang, Yuhan Zhu, Yicheng Xu, Jiange Yang, Lang Lin, Ziang Yan, Yali Wang, Yi Wang, Limin Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando ensinar uma criança a entender o mundo apenas mostrando a ela vídeos, sem usar palavras, legendas ou explicações. O objetivo é que essa criança (o modelo de IA) não apenas reconheça "um cachorro", mas entenda que o cachorro está correndo, que ele tem peso, que se ele pular, a gravidade vai puxá-lo para baixo, e que se ele bater em uma parede, vai parar.

O papel "InternVideo-Next" apresenta uma nova maneira de ensinar essa "criança" a ver o mundo de verdade, sem precisar de legendas barulhentas e cheias de erros que costumam poluir os dados da internet.

Aqui está a explicação do que eles fizeram, usando analogias do dia a dia:

1. O Problema: O "Tradutor Ruim"

Até agora, as IAs de vídeo aprendiam de duas formas principais:

  • Método A (Legendas): Eles assistiam a vídeos com legendas geradas por máquinas. O problema é que essas legendas são muitas vezes ruins, confusas e não explicam coisas como "como o objeto se move" ou "como a luz reflete". É como tentar aprender física lendo um livro de contos de fadas traduzido por um robô.
  • Método B (Adivinhação de Pixels): Eles tentavam cobrir partes do vídeo e pedir para a IA "desenhar" o que estava escondido, pixel por pixel. O problema aqui é que a IA ficava preguiçosa. Ela aprendia a adivinhar apenas cores e texturas básicas, mas não entendia a lógica do movimento ou a física por trás das coisas. Era como um aluno que decora a resposta da prova, mas não entende a matéria.

2. A Solução: O "Sistema de Três Etapas" (EPD)

Os autores criaram uma nova arquitetura chamada EPD (Encoder-Predictor-Decoder). Pense nisso como uma equipe de três especialistas trabalhando juntos:

  1. O Observador (Encoder): Ele assiste ao vídeo e tira notas sobre o que está acontecendo.
  2. O Sonhador (Predictor): Esta é a parte nova e genial. Ele é um "modelo de mundo latente". Em vez de tentar desenhar o pixel exato, ele tenta imaginar o que deveria estar acontecendo no espaço escondido, usando a lógica do mundo real (física, movimento, 3D).
  3. O Pintor (Decoder): Ele pega a "imaginação" do Sonhador e a transforma em uma imagem real para ver se estava certa.

3. O Truque Mágico: Duas Fases de Aprendizado

O grande segredo do InternVideo-Next é que eles não fazem tudo de uma vez. Eles usam um treinamento em duas etapas, como se fosse a escola primária e o ensino médio:

Fase 1: A Base Sólida (O "Pintor" com Ajuda)

Nesta fase, o objetivo é garantir que a IA entenda tanto os detalhes finos (como a textura de uma folha) quanto o significado geral (que é uma árvore).

  • O Problema anterior: O "Pintor" (Decoder) era muito simples (uma linha reta), o que forçava o "Sonhador" a ser simples também.
  • A Solução: Eles trocaram o "Pintor" simples por um Pintor Difusivo (baseado em tecnologia de difusão, como o DALL-E ou Midjourney). Imagine que, em vez de pedir para a IA desenhar uma linha reta, você pede para ela "sonhar" a imagem a partir de um borrão, usando a imaginação do Sonhador como guia.
  • O Segredo Extra: Eles também deram a essa IA um "livro de receitas" de imagens (conhecimento de modelos de imagem já treinados) para garantir que ela não perca o significado das coisas enquanto tenta desenhar os detalhes.

Fase 2: O Mestre da Lógica (O "Sonhador" Sozinho)

Agora que a IA já tem uma base sólida e entende detalhes e significados, eles congelam o "Pintor" e focam apenas no "Sonhador".

  • O Desafio: Eles cobrem grandes pedaços do vídeo (como esconder uma cena inteira de um carro batendo) e pedem para a IA prever o que acontece nos quadros seguintes, não em pixels, mas em "ideias" (representações latentes).
  • Por que funciona: Como a IA já aprendeu na Fase 1 que o mundo tem regras (física, movimento), ela é forçada a usar essas regras para adivinhar o futuro, em vez de apenas chutar cores aleatórias. É como pedir para um jogador de xadrez prever o próximo movimento do oponente, sabendo as regras do jogo, em vez de apenas adivinhar onde a peça vai cair.

4. Os Resultados: O "Super-Entendedor"

O resultado é um modelo que:

  • Entende o Mundo Real: Ele é excelente em tarefas que exigem noção de 3D, profundidade e física (como estimar a distância de um objeto ou prever para onde ele vai cair).
  • Não Precisa de Legendas: Ele aprendeu tudo assistindo a vídeos brutos, sem depender de textos ruins da internet.
  • É Versátil: Ele funciona tão bem quanto modelos que foram treinados com milhões de legendas, mas de uma forma mais pura e eficiente.

Resumo em uma Frase

O InternVideo-Next é como ensinar uma criança a entender o mundo não lendo um livro de instruções falho, mas fazendo-a "sonhar" e "prever" o que acontece em um vídeo, forçando-a a aprender as leis da física e do movimento por conta própria, resultando em uma inteligência artificial que realmente "vê" e "entende" o que está acontecendo na tela.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →