← Últimos artigos
🤖 AI

Not All Visual Tokens Are Equally Safe to Remove:Consequence-Sensitive Visual Token Compression

Este artigo introduz um método de compressão de tokens visuais sensível às consequências para modelos de visão-linguagem que aloca dinamicamente recursos computacionais com base no custo potencial de erros, reduzindo significativamente erros de alto risco e as taxas de erro ponderadas pelo custo em comparação com estratégias tradicionais baseadas em conteúdo ou de alocação uniforme.

Autores originais: Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

Publicado 2026-08-11
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jingbo Wen, Liang He, Mingyu Cao, Haoyu Wang, Minxuan Hu, Kangning Cui, Xilu Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é o chef de um restaurante movimentado, mas tem uma regra rigorosa: você só pode usar uma quantidade fixa de ingredientes para cada prato que cozinha, não importa o que seja. Normalmente, os chefs tentam fazer com que a refeição "média" tenha o melhor sabor possível, distribuindo esses ingredientes de forma equilibrada. Mas e se um prato for uma simples porção de batatas fritas, enquanto outro for um remédio vital para um paciente? Se você errar as batatas fritas, é irritante. Se você errar o remédio, é um desastre. A maioria dos programas de computador que analisam imagens e respondem perguntas (chamados de Modelos de Visão-Linguagem) age como esse chef da velha guarda. Eles tentam economizar poder de processamento ignorando partes "tediosas" de uma imagem, assumindo que cada erro que cometem custa a mesma quantidade de energia. Mas, no mundo real, um erro não é apenas um erro; ele tem um preço. Este artigo faz uma pergunta simples e revolucionária: E se parássemos de tentar tornar a refeição média perfeita e, em vez disso, focássemos nossos ingredientes limitados nos pratos onde um erro seria o mais caro?

Os pesquisadores por trás deste estudo, liderados por Jingbo Wen e Liang He, propõem uma nova maneira de lidar com esses modelos de computador chamada "compressão de tokens visuais sensível às consequências". Para entender o truque deles, pense em uma imagem não como uma única foto, mas como um mosaico feito de milhares de pequenos azulejos chamados "tokens". Quando um computador olha para uma foto, ele processa todos esses azulejos. Para economizar tempo e dinheiro, os métodos atuais tentam descartar os azulejos que parecem menos importantes, como o céu azul em uma foto de um carro. Eles fazem isso olhando para a própria imagem para decidir o que manter. Os autores argumentam que isso é como julgar um livro pela capa; às vezes, os azulejos de fundo "tediosos" são, na verdade, cruciais para a pergunta específica que está sendo feita.

Em vez de apenas olhar para a imagem, os autores sugerem olhar primeiro para a pergunta ou para a tarefa. Eles perceberam que algumas perguntas são de "alto risco" (como "Qual é o valor total nesta fatura?") e outras são de "baixo risco" (como "Qual é a cor do fundo?"). O método deles funciona em duas etapas. Primeiro, eles executam uma fase de "calibração" offline, onde testam o modelo para ver exatamente quantos azulejos (tokens) ele precisa para acertar perguntas de alto risco versus perguntas de baixo risco. Então, quando um usuário real faz uma pergunta, o sistema verifica a "consequência" de errá-la. Se a pergunta for de alto risco, o sistema aloca um enorme orçamento de azulejos para aquela imagem, garantindo que o computador veja cada detalhe. Se a pergunta for de baixo risco, ela recebe um orçamento muito menor, poupando recursos para o que é importante.

A equipe testou isso em uma configuração complicada onde perguntas de alto risco e baixo risco eram feitas sobre as exatas mesmas imagens. Isso foi crucial porque provou que a melhoria não veio do fato de as imagens serem diferentes, mas puramente de como o computador decidiu gastar sua energia. Eles descobriram que, ao deslocar o orçamento, conseguiram reduzir os erros caros de alto risco em mais da metade (caindo de 0,300 para 0,133) sem usar nenhum poder de processamento total a mais do que antes. Na verdade, como gastaram menos tempo nas perguntas fáceis, todo o sistema rodou cerca de 21% mais rápido.

O artigo também descobriu um "ponto de virada". Quando o custo de cometer um erro é o mesmo para cada pergunta, a melhor estratégia ainda é tratar todos igualmente. Mas assim que o custo de um erro começa a variar (por exemplo, se uma resposta errada em um relatório médico é 5 vezes pior do que uma resposta errada em um relatório meteorológico), o sistema deve começar a deslocar seus recursos pesadamente para as perguntas perigosas. Os pesquisadores mostraram que isso funciona em diferentes tipos de documentos, gráficos e até em diferentes modelos de computador. Eles concluíram que não devemos apenas medir o quão "preciso" um modelo é em média; devemos medir o quão bem ele evita os erros específicos e caros que mais importam no mundo real.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →