← Últimos artigos
💻 computer science

OmniDrop: Layer-wise Token Pruning for Omni-modal LLMs via Query-Guidance

OmniDrop é um framework de poda de tokens, livre de treinamento e por camada, para LLMs omni-modais que utiliza consultas textuais e uma pontuação de diversidade temporal para remover progressivamente tokens audiovisuais redundantes dentro das camadas decodificadoras, alcançando reduções significativas na latência e no uso de memória enquanto supera as linhas de base existentes em desempenho.

Autores originais: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

Publicado 2026-05-15
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yeo Jeong Park, Hyemi Jang, Minseo Choi, Jongsun Lee, Jooyoung Choi, Yongkweon Jeon

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem um assistente robótico superinteligente (um "Omni-LLM") que pode assistir a vídeos e ouvir áudios ao mesmo tempo. Você faz uma pergunta a ele, como "Quem está cantando ao fundo?" ou "De que cor é o carro?".

O problema é que vídeos e áudios de alta qualidade são como uma enxurrada massiva de dados. Apenas um minuto de vídeo exige que o robô processe mais de 10.000 pequenos pedaços de informação (chamados "tokens"). Tentar pensar em todos eles de uma só vez é como tentar beber de uma mangueira de incêndio: é lento, consome muita energia e deixa o robô lento.

Para resolver isso, os cientistas geralmente tentam descartar as partes "chatas" do vídeo e do áudio antes mesmo de o robô começar a pensar. Eles assumem que, se um som e uma imagem acontecem ao mesmo tempo, eles devem estar relacionados.

A Grande Ideia do Artigo: "OmniDrop"
Os autores deste artigo dizem: "Espere um minuto, essa suposição está errada". Apenas porque um som e uma imagem acontecem juntos não significa que são importantes para a sua pergunta específica.

Em vez de descartar coisas imediatamente, eles construíram um novo sistema chamado OmniDrop. Eis como ele funciona, usando algumas analogias simples:

1. A Estratégia de "Início Lento" (Poda por Camadas)

Imagine que o cérebro do robô é um prédio de vários andares.

  • Método Antigo: Você fica na porta da frente (a entrada) e imediatamente chuta 50% das pessoas (dados) para fora, com base em quem parece com quem. Isso é arriscado, porque você pode expulsar a única pessoa que realmente sabe a resposta.
  • Método OmniDrop: Você deixa todos entrarem no prédio. Nos primeiros andares (camadas iniciais), todos se misturam e conversam entre si. Isso permite que o áudio e o vídeo se misturem e entendam a cena juntos.
  • O Twist: À medida que o grupo sobe para os andares superiores (camadas mais profundas), o robô começa a perceber: "Ah, eu só preciso conversar com essas pessoas específicas para responder à pergunta". Então, ele começa a pedir gentilmente, e depois de forma agressiva, que as pessoas menos importantes saiam. Isso garante que o robô não perca a "visão geral" antes de saber o que está procurando.

2. A "Pergunta como Lanterna" (Orientação por Consulta)

Como o robô sabe quem manter?

  • Método Antigo: Ele olha para o áudio e o vídeo e tenta adivinhar quais combinam entre si.
  • Método OmniDrop: Ele acende uma lanterna baseada na sua pergunta em texto.
    • Se você perguntar: "Que som é esse?", a lanterna destaca os tokens de áudio e apaga os de vídeo.
    • Se você perguntar: "De que cor é a camisa?", a lanterna destaca os tokens de vídeo.
    • O robô mantém os tokens que a "lanterna" ilumina e descarta os que estão no escuro. Isso torna a poda inteligente e específica para a sua tarefa.

3. A Regra "Não Pule o Meio" (Diversidade Temporal)

Existe um perigo: se o robô mantiver apenas os tokens que a lanterna atinge, ele pode esquecer tudo o mais, criando uma "lacuna" na história.

  • A Solução: O OmniDrop adiciona uma regra chamada Diversidade Temporal. Mesmo que um momento específico não seja o mais importante, se estiver distante no tempo do evento principal, o robô dá a ele uma pequena "pontuação bônus" para permanecer.
  • Analogia: Imagine ler um livro. Se você mantiver apenas as frases onde o herói fala, você perde o cenário. O OmniDrop diz: "Mantenha as falas do herói, mas também mantenha algumas frases das partes silenciosas no meio, para que a história não pareça quebrada".

Os Resultados

Os autores testaram isso no Qwen2.5-Omni (um modelo popular) usando vários testes de vídeo e áudio.

  • Velocidade: Tornou o robô 40% mais rápido para pensar (menos tempo de espera).
  • Memória: Usou 14,7% menos memória.
  • Inteligência: Surpreendentemente, ao ser mais inteligente sobre o que descartar, o robô ficou melhor em responder perguntas (até 3,58 pontos mais alto nos testes) em comparação com outros métodos que apenas descartavam pedaços aleatórios de dados.

Em Resumo:
O OmniDrop é como um editor inteligente para um filme. Em vez de cortar o filme pela metade antes mesmo de você assisti-lo, ele permite que você assista a tudo, descobre exatamente quais cenas importam para a sua pergunta específica e, em seguida, corta o resto enquanto você assiste, garantindo que você obtenha a resposta rapidamente sem perder o enredo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →