← Últimos artigos
💻 computer science

OmniSelect: Dynamic Modality-Aware Token Compression for Efficient Omni-modal Large Language Models

OmniSelect é um framework de poda de tokens adaptativo a modalidades e livre de treinamento que seleciona e aplica dinamicamente estratégias de compressão com base na relevância cross-modal para reduzir eficientemente sequências de tokens multimodais em OmniLLMs, preservando o desempenho.

Autores originais: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Morunliu Yang, Ruotao Xu, Le Li, Yue Wang, Jianxin Zhang, Juntao Li, Yihang Lou, Siwei Feng, Peifeng Li

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O Engarrafamento de "Excesso de Informações"

Imagine que você tem um assistente robótico superinteligente (um Omni-LLM) que pode assistir a vídeos e ouvir áudios ao mesmo tempo. Para entender um vídeo, esse robô não vê apenas "um carro"; ele divide o vídeo em milhares de pequenas peças de quebra-cabeça digitais chamadas tokens. Ele faz o mesmo com o som.

Se você alimentar o robô com um vídeo longo com som, ele fica sobrecarregado. É como tentar ler um livro de 1.000 páginas enquanto ouve um podcast de 10 horas simultaneamente. O robô fica preso em um "engarrafamento" de dados, usando toda a sua memória e levando uma eternidade para responder a uma pergunta simples como: "De que cor era o caminhão?"

Para resolver isso, os pesquisadores geralmente tentam descartar algumas das peças do quebra-cabeça (tokens) para tornar o trabalho mais rápido. Mas aqui está a pegadinha: A maioria dos métodos existentes é como um zelador desajeitado. Eles jogam as peças fora aleatoriamente ou usam uma regra "tamanho único". Eles podem descartar o quadro mais importante de um acidente de carro apenas porque aconteceu ao mesmo tempo que um som chato, ou podem manter um quarto silencioso e vazio apenas porque a música de fundo estava alta.

A Solução: OmniSelect (O Editor Inteligente)

Os autores propõem um novo método chamado OmniSelect. Pense no OmniSelect não como um zelador, mas como um editor de filmes inteligente e adaptativo que sabe exatamente o que o espectador está perguntando antes mesmo de começar a cortar.

O OmniSelect é "livre de treinamento", o que significa que ele não precisa voltar à escola para aprender a fazer isso; ele usa um conjunto inteligente de regras para descobrir o que manter e o que cortar na hora.

Como Funciona: O Processo de Três Etapas

1. A "Verificação de Relevância" (Quem é a Estrela?)

Antes de cortar qualquer coisa, o OmniSelect faz uma pergunta simples: "Para esta pergunta específica, a resposta está escondida no vídeo ou no áudio?"

Ele usa uma ferramenta leve (chamada AudioCLIP) para escanear a pergunta e o vídeo/áudio.

  • Cenário A: Você pergunta: "Como está o tempo?" A ferramenta vê que o vídeo é a estrela. O OmniSelect decide ser Centrado no Vídeo. Ele mantém os quadros visuais e corta o áudio.
  • Cenário B: Você pergunta: "Que música está tocando?" A ferramenta vê que o áudio é a estrela. O OmniSelect torna-se Centrado no Áudio. Ele mantém o som e corta o vídeo.
  • Cenário C: Você pergunta: "Descreva a cena inteira." Ambos são importantes. O OmniSelect escolhe Poda Uniforme, cortando ambos igualmente.

Analogia: Imagine que você está arrumando uma mala para uma viagem. Se você vai para uma praia, você arruma biquínis e óculos de sol (Centrado no Vídeo). Se você vai para um show, você arruma ingressos e protetores auriculares (Centrado no Áudio). O OmniSelect descobre o destino antes de você começar a arrumar, para que você não desperdice espaço com os itens errados.

2. O "Orçamento Dinâmico" (Alocando o Espaço)

Uma vez que ele sabe qual "estrela" (vídeo ou áudio) é mais importante, ele não corta aleatoriamente. Ele cria um orçamento dinâmico.

Se o vídeo é a estrela, ele diz: "Ok, temos um orçamento apertado. Vamos manter 90% dos quadros do vídeo, mas apenas 30% do áudio." Se o áudio é a estrela, ele inverte o roteiro. Ele garante que as partes mais informativas do vídeo ou do áudio recebam mais "espaço" na memória do robô.

3. O "Corte Detalhado" (A Estratégia Bottom-K)

Dentro de cada pedaço de tempo (como um clipe de 5 segundos), o OmniSelect precisa decidir quais peças específicas do quebra-cabeça jogar fora.

  • O Jeito Antigo (Top-K): Alguns métodos mantêm as peças "mais altas" ou "mais ativas". Isso é como manter os pixels mais coloridos em uma foto, mesmo que sejam apenas ruído.
  • O Jeito do OmniSelect (Bottom-K): Esta é a reviravolta inteligente do artigo. Em vez de manter as peças "mais altas", ele mantém as peças que são menos semelhantes entre si.
    • Analogia: Imagine uma sala cheia de pessoas falando. Se todos estão dizendo exatamente a mesma coisa, você só precisa ouvir uma pessoa. O OmniSelect identifica os "ecos" (tokens redundantes) e os silencia, mantendo apenas as vozes únicas que adicionam novas informações. Isso garante que o robô veja a imagem completa, não apenas a parte mais alta dela.

Os Resultados: Rápido, Leve e Inteligente

O artigo testou isso em dois robôs de tamanhos diferentes (3B e 7B parâmetros) usando benchmarks reais de vídeo e áudio.

  • Velocidade: O OmniSelect tornou o robô 1,19x a 1,33x mais rápido. É como fazer uma atualização de bicicleta para scooter.
  • Memória: Ele economizou cerca de 2,6GB a 2,8GB de memória. É como limpar um armário inteiro de lixo para que o robô possa caber coisas mais importantes.
  • Precisão: Apesar de descartar 70% dos dados, o robô ainda acertou 94% a 99% das respostas em comparação com a leitura de todo o vídeo. Em alguns casos, ao remover o "ruído" (dados redundantes), o robô na verdade ficou melhor em responder perguntas do que quando tinha todos os dados.

Resumo

O OmniSelect é um sistema inteligente que para de tratar todos os dados de vídeo e áudio como iguais. Em vez disso, ele age como um detetive:

  1. Ele descobre se a resposta está nos olhos (vídeo) ou nos ouvidos (áudio).
  2. Ele aloca seu orçamento de memória de acordo.
  3. Ele corta implacavelmente as partes chatas e repetitivas, mantendo os detalhes únicos e importantes.

O resultado é uma IA supereficiente que pode entender vídeos longos e sons complexos sem ficar sobrecarregada, tudo isso sem precisar ser re treinada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →