Adaptive Two-Stage Visual Token Pruning for Efficient Inference in Video-Language Models
Este artigo propõe uma estratégia de poda de tokens adaptativa de dois estágios, pós-hoc e livre de treinamento, que primeiro elimina quadros redundantes e depois ajusta dinamicamente a retenção de tokens com base em correlações entre quadros, alcançando uma redução de 95% na computação enquanto melhora a precisão da legenda de vídeo em 7% com 10% de retenção de tokens.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está tentando ensinar um robô superinteligente a entender o mundo. Você dá a ele uma câmera e um cérebro, e pede que ele olhe para um vídeo e diga o que está acontecendo. Este é o mundo dos "Modelos de Visão-Linguagem" (VLMs). Pense nesses modelos como uma equipe: uma parte são os "olhos" (um codificador de visão) que observa imagens e as decompõe em minúsculas peças de quebra-cabeça chamadas "tokens". A outra parte é o "cérebro" (um grande modelo de linguagem) que lê esses tokens e escreve uma história ou responde a uma pergunta.
O problema é que vídeos são enormes. Uma única imagem pode ser decomposta em centenas de peças de quebra-cabeça, e um vídeo é apenas uma pilha de muitas imagens. Se você tentar alimentar o cérebro do robô com um vídeo inteiro, ele ficará sobrecarregado. É como tentar ler um livro de mil páginas em um segundo; o robô desacelera, cansa e não consegue trabalhar em dispositivos pequenos como celulares ou câmeras de segurança. Os cientistas tentaram resolver isso jogando fora algumas peças do quebra-cabeça, mas a maioria de seus métodos é como usar um cortador de biscoitos: eles cortam a mesma quantidade de peças de cada vídeo, seja um vídeo parado e entediante de uma parede ou uma perseguição de carros cheia de ação. Este artigo faz uma pergunta melhor: E se pudéssemos ser mais espertos sobre o que jogamos fora, cortando mais quando as coisas são repetitivas e menos quando são emocionantes?
A História do Cortador de Vídeo Inteligente
Os autores deste artigo, uma equipe da Amazon, perceberam que os métodos atuais para acelerar a IA de vídeo são um pouco desajeitados. Eles tratam cada vídeo da mesma forma, cortando um número fixo de peças do quebra-cabeça (tokens), independentemente do que realmente está acontecendo na tela. Mas os vídeos são especiais; eles têm "redundância temporal", que é uma maneira sofisticada de dizer que, se você tem um vídeo de um gato dormindo, o quadro 10 é quase idêntico ao quadro 11, que é idêntico ao quadro 12. Desperdiçar o poder de processamento do robô com todos esses quadros idênticos é bobagem.
Para resolver isso, a equipe inventou uma estratégia de "Poda de Tokens Visuais Adaptativa em Dois Estágios". Pense nisso como uma equipe de limpeza de dois passos para um quarto bagunçado.
Estágio 1: O Filtro de Quadros
Primeiro, o método olha para o vídeo inteiro e pergunta: "Quais quadros são realmente novos?". Se você tem um vídeo de uma pessoa caminhando, os primeiros quadros podem ser idênticos. O algoritmo age como um editor seletivo, descartando inteiramente os quadros entediantes e repetitivos. Ele mantém apenas os momentos mais interessantes, como um vídeo de melhores momentos. Este é o nível de poda de "quadro" (frame-level).
Estágio 2: O Domador de Tokens
Agora, o robô tem um vídeo mais curto, mas cada quadro restante ainda é feito de milhares de pequenos tokens. É aqui que a mágica acontece. Em vez de cortar um número fixo de tokens (como "sempre manter 5 de cada 10"), o método olha para o conteúdo do vídeo para decidir quanto cortar.
Imagine que os tokens em um quadro são um grupo de pessoas conversando. Se todos estão dizendo exatamente a mesma coisa (alta redundância), você só precisa ouvir uma pessoa para entender o grupo. Mas se todos estão dizendo algo totalmente diferente (alta diversidade), você precisa ouvir a todos. O método do artigo faz exatamente isso: ele analisa a "correlação" entre os tokens. Ele usa um truque matemático chamado "decomposição em autovalores" para medir o quanto os tokens estão se repetindo.
Se o vídeo é estático e repetitivo (como uma pessoa rolando uma bola por uma rampa), a matemática mostra um "decaimento acentuado", o que significa que os tokens são muito semelhantes. O sistema então diz: "Ok, podemos jogar fora muitos desses!" e mantém apenas uma fração minúscula. Mas se o vídeo é caótico e dinâmico (como uma perseguição de carros com muito movimento de câmera), a matemática mostra um "decaimento lento", o que significa que os tokens são todos únicos. O sistema diz: "Espere, precisamos manter quase todos estes!" e corta muito pouco.
Os Resultados: Velocidade sem Tropeços
A equipe testou isso em vários modelos de IA populares, incluindo LLaVA-Video, InternVL3 e Qwen2.5VL. Eles compararam seu método adaptativo inteligente contra outros métodos "sem treinamento" (métodos que não exigem o retreinamento da IA do zero).
Os resultados foram impressionantes. Ao usar sua abordagem de dois estágios, eles conseguiram reduzir a quantidade de matemática que o computador precisava fazer em uma quantidade massiva — até 95% — mantendo a IA inteligente. Na verdade, em um benchmark de legenda de vídeo (onde a IA descreve o que vê), o método deles na verdade melhorou a precisão em 7% quando eles mantiveram apenas 10% dos tokens.
Para colocar em perspectiva: se você tem um vídeo que normalmente levaria uma hora para ser processado por um supercomputador, este método poderia fazê-lo rodar em minutos, e o robô pode até entendê-lo melhor porque está focando nas partes importantes em vez de se perder no ruído.
Por que Isso Importa
O artigo argumenta explicitamente contra a abordagem de "tamanho único" usada pelos métodos anteriores. Eles mostram que usar uma proporção fixa (como sempre manter 30% dos dados) é subótimo porque diferentes vídeos precisam de quantidades diferentes de dados. O método deles é "post-hoc", o que significa que funciona em modelos existentes sem a necessidade de retreiná-los, tornando-o uma atualização "plug-and-play" para a tecnologia atual.
Os autores descobriram que essa estratégia adaptativa funciona consistentemente em diferentes tamanhos de modelos e tipos de vídeos. Eles até testaram diferentes maneiras matemáticas de medir o "decaimento" da informação e descobriram que uma curva exponencial se ajustava melhor aos dados, confirmando que sua maneira de medir a redundância é a mais precisa.
Em resumo, este artigo sugere que não precisamos construir cérebros maiores e mais lentos para entender vídeos. Em vez disso, só precisamos ser mais espertos sobre o que alimentamos a eles. Ao agir como um editor astuto que sabe exatamente quando cortar as partes chatas e quando manter as emocionantes, podemos tornar a IA de vídeo rápida o suficiente para rodar em dispositivos comuns sem perder sua capacidade de ver o mundo claramente.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.