← Últimos artigos
💻 computer science

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

O SepPrune é um framework livre de treinamento e plug-and-play que reduz eficientemente os custos computacionais em modelos de linguagem de grande escala multimodais ao usar tokens separadores de modalidade como consultas unificadas para podar 80,2% dos tokens de visão, mantendo 96,3% da precisão original.

Autores originais: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Publicado 2026-07-29
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você esteja tentando ensinar um robô superinteligente a ver e falar ao mesmo tempo. Este é o mundo dos Modelos de Linguagem de Grande Escala Multimodais (MLLMs), as estrelas da IA que podem olhar para a foto de um pôr do sol e escrever um poema sobre ele, ou analisar um gráfico complexo e responder perguntas sobre ele. Para fazer isso, o robô não apenas "olha" para a imagem; ele a decompõe em milhares de minúsculas peças de quebra-cabeça digitais chamadas "tokens de visão". Pense nesses tokens como pixels individuais, mas muito mais inteligentes — eles carregam todos os detalhes da imagem.

No entanto, há um problema. Quando você alimenta o robô com uma foto de alta definição ou um vídeo longo, ele gera tantos desses tokens que o robô fica sobrecarregado. É como tentar ler uma biblioteca de livros de uma só vez; o processo torna-se lento, caro e ineficiente. Cientistas têm tentado corrigir isso tentando descobrir quais peças do quebra-cabeça são realmente importantes e quais são apenas excesso de informação. Alguns métodos tentam adivinhar a importância observando como o robô presta atenção às palavras, enquanto outros tentam encontrar peças duplicadas. Mas essas abordagens frequentemente ficam presas em sua própria complexidade, tornando o robô ainda mais lento enquanto tentam acelerá-lo. A grande questão permanece: como cortamos o excesso sem perder a imagem?

Apresentamos o SepPrune, um novo método que atua como um editor astuto para esses modelos de IA. Os pesquisadores por trás deste trabalho notaram algo fascinante enquanto observavam como esses modelos pensam. Eles descobriram que, nos estágios iniciais do processamento, o modelo presta uma enorme atenção a tokens "separadores" especiais — pequenos marcadores que ficam entre os dados da imagem e os dados do texto, atuando como uma ponte entre esses dois mundos. Acontece que esses separadores são a chave para entender a imagem.

Em vez de tentar calcular a importância de cada único token de visão comparando-os entre si (o que é lento e confuso), o SepPrune usa o token separador como uma consulta mestre. Imagine o separador como um guia turístico parado na entrada de um museu. Em vez de perguntar a cada pintura, "Você é importante?", o guia olha para toda a sala e aponta: "Você, você e você são as obras-primas; o resto pode esperar". Ao usar o separador para pontuar rapidamente os tokens de visão, o SepPrune pode identificar instantaneamente as peças mais informativas da imagem e descartar o restante.

Os resultados são impressionantes. Quando testado em modelos poderosos como o Qwen2.5-VL-7B, o SepPrune conseguiu descartar mais de 80% dos tokens de visão, mantendo ainda 96,3% da precisão original do modelo. Mesmo quando a poda foi levada ao extremo de uma redução de 90,2%, o modelo reteve 87,2% de seu desempenho. Este é um salto significativo em comparação com outros métodos, que frequentemente lutam para manter uma precisão tão alta ao realizar cortes tão profundos. Além disso, como este método não exige cálculos complexos entre cada token, ele é muito mais rápido e funciona perfeitamente com tecnologias de aceleração existentes.

Os pesquisadores também provaram que suas escolhas específicas importam. Eles mostraram que usar o token separador como o "guia" funciona melhor do que usar outras partes do texto, e que ignorar a "posição" dos tokens (onde eles se situam na imagem) durante o processo de seleção evita que o modelo mantenha acidentalmente apenas a metade inferior de uma imagem. Em suma, o SepPrune sugere que, ao ouvir a ponte entre a imagem e o texto, podemos tornar esses visionários de IA mais rápidos e eficientes sem cegá-los para os detalhes que realmente importam.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →