← Últimos artigos
💻 computer science

LLaVA-OneVision-2: Towards Next-Generation Perceptual Intelligence

O artigo apresenta o LLaVA-OneVision-2, um modelo de linguagem e visão de próxima geração que alcança desempenho state-of-the-art em tarefas de fundamentação espacial, temporal e em vídeo, aproveitando uma estratégia de tokenização de fluxo de codec inovadora, um sistema de coordenadas 3D RoPE unificado e supervisão em larga escala aberta.

Autores originais: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhan
Publicado 2026-05-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui Chen, Xiuwei Zhao, Bin Qin, Kaicheng Yang, Yifei Shen, Yuanhan Zhang, Kaichen Zhang, Wenkang Zhang, Zheng Cheng, Nansen Zhang, Chunsheng Wu, Chunjiang Ge, Zimin Ran, Dehua Song, Chunyuan Li, Shikun Feng, Ming Hu, Zhangquan Chen, Junbo Niu, Bo Li, Ziyong Feng, Ziwei Liu, Zongyuan Ge, Jiankang Deng

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando descrever um filme de 30 minutos para um amigo, mas só tem tempo suficiente para mostrar a ele 30 fotos.

A maioria dos modelos de IA atuais (como os anteriores a este novo) joga pelo seguro: escolhem 30 fotos distribuídas uniformemente. Uma foto a cada minuto. Se algo emocionante acontecer entre o minuto 10 e o minuto 11, a IA perde completamente porque não estava olhando naquele segundo exato. É como tentar entender um jogo de futebol de ritmo acelerado olhando apenas para o placar a cada minuto; você perderia o gol.

LLaVA-OneVision-2 é um novo tipo de "superobservador" que muda as regras. Em vez de olhar para o filme como uma série de instantâneos estáticos, ele trata o vídeo como um arquivo digital comprimido (o tipo que seu telefone usa para economizar espaço).

Veja como funciona, usando analogias simples:

1. A Bússola de "Custo de Bits"

Quando você comprime um vídeo (como transformar um filme bruto em um MP4), o computador precisa trabalhar mais para descrever partes do vídeo onde as coisas se movem rápido ou mudam drasticamente (como um acidente de carro ou um dançarino girando). Ele gasta mais "energia digital" (bits) nessas partes. Gasta muito pouca energia em partes chatas onde nada acontece (como uma parede estática).

LLaVA-OneVision-2 lê esse "mapa de energia".

  • O Jeito Antigo: "Vou olhar para o vídeo por 1 segundo, depois pular 1 segundo, depois olhar novamente."
  • O Novo Jeito: "Vejo que o arquivo de vídeo está usando muita energia agora porque a ação é intensa! Vou focar minha atenção ali. Vejo que a energia está baixa aqui; vou pular esta parte."

Ele concentra sua "capacidade cerebral" (tokens) exatamente onde a ação está acontecendo, em vez de espalhá-la uniformemente.

2. O "Detetive de Movimento"

O modelo também procura por "resíduos". Imagine que você está assistindo a um vídeo de uma pessoa caminhando. O fundo (o quarto) permanece o mesmo. O modelo percebe: "Não preciso reexplicar o quarto em cada quadro individual". Ele só presta atenção nas partes que mudaram (a pessoa em movimento).

Ele cria uma "tela visual" que é uma colagem das partes em movimento mais importantes, costuradas de forma eficiente. Isso permite que ele assista a um vídeo de 15 minutos sem ficar sobrecarregado, porque ignora as partes chatas e repetitivas e dá zoom nos "momentos da história".

3. O Teste da "Pular Corda"

Para provar que isso funciona, os pesquisadores criaram um novo teste chamado JumpScore. Imagine um vídeo de alguém pulando corda. Eles pulam para cima e para baixo centenas de vezes. Para uma IA normal, cada pulo parece exatamente o mesmo. É difícil dizer qual pulo específico o usuário está perguntando.

  • A IA Antiga ficou confusa e chutou aleatoriamente, pontuando cerca de 30 em 100.
  • LLaVA-OneVision-2 identificou os pequenos momentos de fração de segundo em que a corda batia no chão ou os pés da pessoa mudavam de posição. Pontuou 75 em 100.

Ela não viu apenas "pulando"; viu o momento exato em que o pulo aconteceu.

4. O "Navegador Espacial"

O modelo também ficou muito bom em entender espaço. Se você perguntar: "Aponte para o espaço vazio entre a xícara de café e o laptop", ele pode fazer isso com alta precisão. Ele pode até rastrear objetos se movendo através de um vídeo (como um gato correndo através de um quarto) e manter os olhos neles sem perdê-los de vista, mesmo que o gato fique parcialmente escondido.

O Quadro Geral

Os pesquisadores não construíram apenas um cérebro maior; construíram uma maneira mais inteligente de olhar.

  • Antes: A IA era como um turista tirando uma foto a cada minuto de uma trilha, esperando não perder a vista.
  • Agora: A IA é como um guia que sabe exatamente onde está a vista, então para apenas para tirar uma foto quando a paisagem realmente muda.

O resultado é um modelo que entende vídeos longos, encontra momentos específicos em ação rápida e raciocina sobre espaço muito melhor do que modelos anteriores, tudo isso usando a mesma quantidade de poder de computação. Eles disponibilizaram todo o seu código, dados e o próprio modelo para que qualquer pessoa possa usar gratuitamente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →