← Últimos artigos
💻 computer science

A Survey of Token Compression for Efficient Multimodal Large Language Models

Este artigo apresenta o primeiro levantamento sistemático de técnicas de compressão de tokens para modelos de linguagem de grande escala multimodais eficientes, categorizando os métodos existentes tanto por suas modalidades alvo (imagem, vídeo e áudio) quanto por seus mecanismos subjacentes para consolidar o progresso atual e orientar pesquisas futuras.

Autores originais: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Publicado 2026-02-03
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Kele Shao, Keda Tao, Kejia Zhang, Sicheng Feng, Mu Cai, Yuzhang Shang, Haoxuan You, Can Qin, Yang Sui, Huan Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente superinteligente (um Modelo de Linguagem Grande Multimodal, ou MLLM) que consegue ler texto, olhar fotos, assistir a vídeos e ouvir áudio. Este assistente é incrivelmente talentoso, mas tem um grande problema: ele fica sobrecarregado quando você lhe dá informação demais de uma só vez.

Pense na informação que o assistente recebe como um fluxo de "tokens" (pequenos pedaços de dados).

  • Um comando de texto é como uma carta curta.
  • Uma foto de alta resolução é como uma carta que foi ampliada para um mural gigante e detalhado.
  • Um vídeo é como uma biblioteca de milhares desses murais, mudando a cada segundo.
  • O áudio é como um fluxo contínuo de ondas sonoras em alta velocidade.

Quando você alimenta o assistente com um filme de 90 minutos, ele não vê apenas "um filme". Ele vê 54 milhões de tokens. Isso é como tentar ler uma biblioteca de livros em um único fôlego. O cérebro do assistente (seu mecanismo de "autoatenção") tem que comparar cada token com todos os outros tokens. A matemática para isso fica muito pesada, muito rápido, de modo que o computador fica sem memória ou leva uma eternidade para responder.

A Solução: Compressão de Tokens
Este artigo é um guia massivo (um levantamento/survey) sobre como ensinar este assistente a ser mais eficiente sem perder sua inteligência. Os autores chamam isso de Compressão de Tokens.

Pense na compressão de tokens como arrumar uma mala para uma viagem.

  • O Problema: Você tem uma mala cheia de roupas, mas 80% delas são duplicatas (como 50 camisetas brancas idênticas) ou coisas de que você não precisa (como um casaco de inverno pesado para uma viagem à praia).
  • O Objetivo: Você quer colocar tudo o que é importante em uma bolsa menor para que possa viajar mais rápido, sem deixar para trás as coisas de que realmente precisa.

O artigo organiza todos os métodos atuais de "empacotamento" desses dados em duas formas principais de olhar para o problema: Que tipo de dado é este? e Como nós o empacotamos?

1. Empacotamento por Tipo de Dado (O "O quê")

Diferentes tipos de dados têm diferentes tipos de "bagunça" (redundância).

  • Imagens (A Foto Estática):
    • A Bagunça: Uma foto de um céu azul tem milhões de pixels azuis que são todos exatamente iguais.
    • A Correção: Em vez de enviar cada um dos milhões de pixels azuis, o computador os agrupa. Ele diz: "Toda esta área é apenas um céu azul", e envia um único token para representar todo esse bloco.
  • Vídeo (A Imagem em Movimento):
    • A Bagunça: Em um vídeo de uma pessoa falando, o fundo (uma parede ou uma árvore) permanece exatamente o mesmo por 10 segundos enquanto a pessoa se move levemente.
    • A Correção: O computador percebe: "Não precisamos enviar o fundo 30 vezes por segundo". Ele mantém o fundo uma vez e envia apenas as atualizações das partes que se movem. É como enviar um "registro de alterações" em vez de reenviar toda a cena a cada quadro.
  • Áudio (A Onda Sonora):
    • A Bagunça: Uma gravação de uma voz frequentemente possui pausas longas, silêncio ou um ruído de fundo que não adiciona significado.
    • A Correção: O computador corta o silêncio e mescla sons semelhantes, mantendo apenas as partes onde a voz está realmente falando ou a música está mudando.

2. Empacotamento por Método (O "Como")

O artigo agrupa as técnicas usadas para fazer esse empacotamento em quatro estratégias principais:

  • O "Raio Encolhedor" (Baseado em Transformação):
    Imagine pegar uma foto de alta resolução e simplesmente encolhê-la. Você perde algum detalhe, mas mantém a forma e as cores gerais. Isso é feito esmagando matematicamente os dados (como pooling ou média) para tornar a lista de tokens mais curta.
  • O "Jogo de Agrupamento" (Baseado em Similaridade):
    Imagine que você tem uma pilha de 1.000 peças de LEGO vermelhas. Em vez de listar todas as 1.000, você diz: "Aqui está uma peça vermelha, e há outras 999 exatamente iguais a ela". O computador encontra tokens que parecem ou soam muito semelhantes e os funde em um único token "representativo".
  • O "Holofote" (Baseado em Atenção):
    Imagine um professor olhando para uma sala de aula. O professor só se importa com os alunos que estão levantando a mão (os tokens importantes) e ignora os que estão dormindo no fundo. O computador olha para suas próprias "pontuações de atenção" (o quanto ele se importa com cada pedaço de dado) e descarta os tokens que ele já estaria ignorando de qualquer maneira.
  • O "Guia de Perguntas" (Baseado em Consulta/Query):
    Imagine que você está procurando uma agulha específica em um palheiro. Em vez de olhar para cada pedaço de feno, você pergunta: "Onde está a agulha?". O computador usa sua pergunta (a consulta/query) para filtrar tudo o que não corresponde ao que você está perguntando, mantendo apenas os tokens relevantes.

Por que Isso Importa

Os autores explicam que isso não é apenas sobre tornar os computadores mais rápidos. É sobre torná-los utilizáveis.

  • Sem compressão, um filme de 90 minutos é impossível de ser processado pelos modelos atuais em tempo real.
  • Com compressão, o modelo pode "assistir" ao filme, entender o enredo e responder perguntas sobre ele, tudo isso usando uma fração da memória.

O Problema (Desafios)

O artigo também avisa que isso não é mágica. Se você empacotar a mala apertada demais:

  • Você pode perder detalhes: Se você comprimir uma foto demais, pode perder uma placa pequena, mas importante, no fundo.
  • Isso quebra o fluxo: Em um vídeo, se você fundir muitos quadros, o movimento pode parecer travado ou confuso.
  • É difícil de encaixar: Alguns desses truques de "empacotamento" são difíceis de usar com os chips de computador mais rápidos disponíveis hoje porque exigem que o computador pare e calcule as coisas de forma diferente.

Em Resumo:
Este artigo é um mapa para pesquisadores. Ele diz: "Temos um problema: nossa IA está se afogando em excesso de dados. Aqui estão todas as diferentes maneiras pelas quais estamos tentando ensinar ela a filtrar, agrupar e encolher esses dados para que ela possa realmente funcionar no mundo real". Ele organiza esses métodos pelo fato de estarem olhando para imagens, vídeos ou sons, e pelas técnicas matemáticas específicas que utilizam para realizar o trabalho.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →