← Últimos artigos
🤖 AI

TOPS: First-Principles Visual Token Pruning via Constructing Token Optimal Preservation Sets for Efficient MLLM Inference

Este artigo introduz o TOPS, um método de poda de tokens visuais livre de treinamento e agnóstico ao modelo que constrói conjuntos de preservação ótimos baseados em relevância da tarefa, cobertura de informação e diversidade semântica para melhorar significativamente a eficiência de inferência de MLLMs enquanto mantém ou até mesmo melhora o desempenho.

Autores originais: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Publicado 2026-06-26
📖 4 min de leitura☕ Leitura rápida

Autores originais: Tinghao Wang, Yichen Guo, Rui Huang, Zheng Lu, Qizhe Zhang, Chenxi Li, Yuan Zhang, Jiajun Cao, Zhirong Shen, Yaosong Du, Guangyan Gan, Wenya Wang, Lin William Cong, Shanghang Zhang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca gigante de livros (os tokens visuais) que um robô superinteligente (o Modelo de Linguagem de Grande Escala Multimodal) precisa ler para responder a uma pergunta. O problema é que a biblioteca é tão enorme que o robô fica sobrecarregado, leva uma eternidade para ler e gasta toda a sua energia apenas folheando as páginas.

Por muito tempo, as pessoas tentaram ajudar o robô dizendo: "Apenas pule as páginas chatas!". Mas os métodos antigos eram um pouco desajeitados:

  • O método da "Atenção" era como um robô que só olhava para páginas com as fontes maiores e mais negritadas. Ele frequentemente ignorava detalhes importantes só porque estavam escritos em texto pequeno, ou continuava lendo o mesmo parágrafo cinco vezes porque parecia semelhante.
  • O método da "Diversidade" era como um robô tentando escolher páginas que parecessem diferentes umas das outras. Ele poderia escolher uma página sobre um gato e uma página sobre um carro, mas poderia acidentalmente jogar fora a página que realmente respondia à pergunta específica do usuário.

Apresentando o TOPS: O Bibliotecário Inteligente

O artigo apresenta um novo método chamado TOPS (Conjuntos de Preservação de Tokens Ótimos). Em vez de apenas adivinhar quais páginas manter, o TOPS atua como um bibliotecário altamente organizado, baseado em princípios fundamentais, que faz três perguntas específicas antes de decidir o que fica na prateleira:

  1. "Esta página é relevante para a pergunta?" (Relevância para a Tarefa)
    • Analogia: Se o usuário pergunta "Qual é a cor do carro?", o bibliotecário sabe imediatamente que deve manter a página com o carro e jogar fora a página sobre o céu.
  2. "Esta página cobre novos terrenos?" (Cobertura de Informação)
    • Analogia: Se já temos uma página descrevendo a tinta vermelha do carro, não precisamos de uma segunda página que diga exatamente a mesma coisa. Precisamos de uma página que nos diga algo novo, como o número da placa do carro.
  3. "Esta página é única em relação às outras que escolhemos?" (Diversidade Semântica)
    • Analogia: Não queremos uma pilha de cinco páginas que dizem todas "O carro é vermelho". Queremos uma página que diga "Vermelho", uma que diga "Rápido" e outra que diga "Velho". Isso garante que tenhamos um quadro completo sem repetição.

Como Funciona na Vida Real

O artigo mostra que o TOPS não precisa ser ensinado (ele é "livre de treinamento"). Ele pode ser conectado a diferentes cérebros de robôs (como LLaVA, Qwen ou InternVL) e funciona instantaneamente.

  • A "Limpeza de Dois Estágios": Imagine o robô lendo um vídeo longo.
    • Estágio 1: O TOPS faz uma varredura rápida, jogando fora o lixo óbvio (como quadros vazios ou imagens borradas) antes mesmo de o robô começar a pensar profundamente.
    • Estágio 2: Enquanto o robô lê, o TOPS mantém um olho atento na conversa. Se o robô começar a falar sobre um detalhe específico, o TOPS garante que as páginas visuais mais relevantes ainda estejam lá, refinando a seleção para que seja perfeita para aquela pergunta específica.

Os Resultados: Menos é Mais

O artigo afirma que, ao usar essa abordagem inteligente de três perguntas, o TOPS consegue descartar até 90% das páginas visuais (tokens) e o robô ainda responde às perguntas tão bem quanto se tivesse lido tudo.

  • A Estatística Mágica: Em um modelo específico (LLaVA-NeXT), o TOPS removeu 77,8% dos dados visuais, mas na verdade melhorou o desempenho do robô ligeiramente (100,6%).
  • Por quê? O artigo sugere que, ao forçar o robô a ignorar o "enchimento" e as páginas redundantes, ele na verdade impede que o robô fique confuso ou invente fatos (alucinações). É como limpar uma mesa bagunçada; às vezes, ter menos papéis ajuda você a encontrar o certo mais rápido e a pensar com mais clareza.

Em Resumo

O TOPS é uma nova maneira de tornar os modelos de IA mais rápidos e inteligentes ao ser um editor mais rigoroso e inteligente. Em vez de apenas escolher as pistas visuais mais "barulhentas" ou "diferentes", ele constrói um conjunto compacto e perfeito de pistas que são relevantes para a pergunta, cobrem toda a informação necessária e não se repetem. O resultado é um robô que pensa mais rápido, usa menos memória e dá melhores respostas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →