← Últimos artigos
🤖 machine learning

CAPA: Contribution-Aware Pruning and FFN Approximation for Efficient Large Vision-Language Models

Este artigo apresenta o CAPA, um framework eficiente para Grandes Modelos de Visão-Linguagem que melhora a velocidade de inferência ao podar tokens visuais de baixa contribuição identificados via métricas de contribuição de atenção e ao aproximar computações redundantes de Redes de Alimentação Direta em camadas intermediárias.

Autores originais: Samyak Jha, Junho Kim

Publicado 2026-02-03
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Samyak Jha, Junho Kim

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). ✨ Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem-Visão de Grande Escala (LVLM) como um crítico de arte altamente inteligente, mas incrivelmente ocupado. Quando você mostra uma imagem e faz uma pergunta, ele não apenas "olha" para a imagem; ele a decompõe em milhares de pequenas peças de quebra-cabeça (chamadas de tokens visuais). Ele então lê essas peças junto com o seu texto, tentando descobrir o que é importante.

O problema é que este crítico está sobrecarregado. Ele tenta processar cada uma das peças do quebra-cabeça com a mesma intensidade de foco, até mesmo as partes chatas e vazias do fundo. Isso torna o processo lento e caro, como tentar ler uma enciclopédia inteira apenas para encontrar um fato específico.

O artigo introduz um novo método chamado CAPA (Pruning de Consciência de Contribuição e Aproximação de FFN) para ajudar este crítico a trabalhar mais rápido sem se confundir. Pense no CAPA como um assistente inteligente que ensina ao crítico dois novos truques:

Truque 1: O Filtro de "Impacto Real" (Pruning de Consciência de Contribuição)

O Jeito Antigo (A Intuição Falha):
Anteriormente, o crítico decidia quais peças do quebra-cabeça ignorar com base em quanta "atenção" elas recebiam. Se uma peça da imagem (como um pedaço de céu azul) recebia muita atenção do texto, o crítico a mantinha. Se recebesse pouca atenção, o crítico a descartava.

  • O Problema: Isso é como julgar uma cena de um filme apenas pelo volume dos aplausos da plateia. Às vezes, um personagem pode receber muito ruído (atenção), mas na verdade não dizer nada de importante. Em termos do artigo, esses são chamados de "Dumps de Probabilidade" (Probability Dumps). Eles são barulhentos, mas inúteis. Por outro lado, algumas peças silenciosas podem estar fazendo todo o trabalho pesado, mas são ignoradas porque não foram "barulhentas" o suficiente.

O Jeito CAPA (O Filtro Inteligente):
O CAPA muda a regra. Em vez de apenas ouvir o "ruído" (pontuação de atenção), ele verifica o "Impacto Real" (Contribuição de Atenção).

  • A Analogia: Imagine um canteiro de obras. O "ruído" é o quanto as pessoas estão gritando com um tijolo específico. O "impacto" é quanto peso esse tijolo realmente suporta.
    • Tipo A (Dumps de Probabilidade): Um tijolo sobre o qual todos estão gritando, mas que é feito de isopor. Ele não carrega peso nenhum. O CAPA diz: "Jogue isso fora; é apenas ruído".
    • Tipo B (Âncoras Estruturais): Um tijolo sobre o qual ninguém está gritando, mas que está segurando todo o telhado. O CAPA diz: "Mantenha este! Ele está fazendo o trabalho real".
  • O Resultado: O CAPA mantém os tijolos que fazem o trabalho pesado e joga fora os tijolos de isopor, garantindo que o crítico não perca os detalhes importantes enquanto ignora o espaço vazio.

Truque 2: O "Atalho" para Tarefas Chatas (Aproximação de FFN)

O Jeito Antigo (O Trabalho Pesado):
Depois de olhar para as peças do quebra-cabeça, o modelo precisa processá-las através de um circuito cerebral complexo chamado Rede de Alimentação Direta (FFN - Feed-Forward Network). Pense nisso como uma calculadora de alta potência e muito cara que realiza cálculos matemáticos complexos em cada peça de dado.

  • O Problema: O artigo descobriu que, para peças de imagem (tokens visuais), essa calculadora complexa é muitas vezes exagerada. No meio das camadas do modelo, a matemática que a calculadora realiza é quase uma linha reta (linear). É como usar um supercomputador para multiplicar 2 por 2. É um desperdício de energia.

O Jeito CAPA (O Atalho):
O CAPA identifica essas camadas "chatas" onde a matemática complexa não é realmente necessária.

  • A Analogia: Imagine que você tem um chef que usa um liquidificador industrial de US$ 10.000 para picar uma única folha de alface. Funciona, mas é ineficiente. O CAPA diz: "Nesta etapa específica, use apenas uma faca simples".
  • A Execução: Em vez de executar a matemática complexa e cara, o CAPA a substitui por um "produto de Hadamard" simples e leve (um termo técnico para uma multiplicação elemento a elemento simples). É como trocar o liquidificador industrial por um corte rápido à mão.
  • O Resultado: O modelo economiza uma quantidade massiva de energia (computação) porque para de usar o maquinário pesado quando uma ferramenta simples fará o trabalho tão bem quanto.

O Grande Final: Como o CAPA Vence

Ao combinar esses dois truques, o CAPA cria um sistema super eficiente:

  1. Ele poda o lixo: Ele remove os "tijolos de isopor" (tokens visuais inúteis) que estavam desperdiçando tempo.
  2. Ele simplifica a matemática: Ele troca o "liquidificador industrial" (cálculos caros) pela "faca simples" (matemática leve) onde é seguro fazê-lo.

O Resultado:
O artigo testou isso em vários modelos populares (como LLaVA e Qwen). Os resultados mostraram que o CAPA é como um maratonista que descarta o peso desnecessário e muda para uma passada mais eficiente.

  • Ele corre muito mais rápido (até 78% menos trabalho computacional).
  • Ele não tropeça na linha de chegada (ele mantém a precisão alta).
  • Ele lida com tarefas complexas (como ler texto em uma imagem ou resolver quebra-cabeças) melhor do que outros métodos que apenas adivinham quais peças jogar fora.

Em resumo, o CAPA ensina a IA a parar de gritar com o espaço vazio e a parar de usar uma marreta para quebrar uma noz, tornando-a mais rápida e inteligente sem perder sua capacidade.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →