← Últimos artigos
💬 NLP

From Layers to Submodules: Rethinking Granularity in Replacement-Based LLM Compression

O artigo apresenta o SubFit, um método de compressão de LLM pós-treinamento que supera as limitações das abordagens existentes baseadas em camadas ao permitir a seleção de subcomponentes não contíguos, em nível de submódulo, para os componentes de Atenção e FeedForward com bypasses residuais ajustados individualmente, alcançando, assim, relações de compromisso entre precisão-perplexidade e eficiência de inferência superiores em vários modelos e níveis de esparsidade.

Autores originais: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

Publicado 2026-06-02
📖 4 min de leitura☕ Leitura rápida

Autores originais: Elia Cunegatti, Marcus Vukojevic, Erik Nielsen, Giovanni Iacca

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine um Modelo de Linguagem de Grande Escala (LLM) como uma enorme e sofisticada linha de montagem de uma fábrica. Esta fábrica possui centenas de estações de trabalho idênticas (camadas), e cada estação de trabalho tem dois trabalhadores principais: um que se especializa em Atenção (observar o contexto e conectar ideias) e outro que se especializa em FeedForward (processar e transformar essas ideias).

Para fazer esta fábrica funcionar mais rápido e usar menos eletricidade (memória), você quer remover algumas dessas estações de trabalho. Mas aqui está o problema: se você apenas arrancar uma estação de trabalho do meio da linha, o produto (a resposta da IA) desmorona porque o fluxo de informação é interrompido.

O Jeito Antigo: "A Demolição de Bairro"

Métodos anteriores tentavam resolver isso escolhendo um bloco contíguo de estações de trabalho (por exemplo, as camadas 10 a 15) e removendo todas elas de uma vez. Eles então tentavam construir um único "túnel de atalho" pequeno para substituir todo esse bloco.

Os autores deste artigo argumentam que isso é como tentar consertar um bairro inteiro derrubando uma fileira inteira de casas e construindo um pequeno depósito para substituí-las. É muito bruto. Eles perceberam que:

  1. A redundância não é organizada: O trabalho "extra" que pode ser removido nem sempre está em uma fileira consecutiva e organizada. Algumas estações de trabalho no meio da linha estão fazendo muito pouco, enquanto outras próximas estão fazendo muito.
  2. Trabalhadores diferentes precisam de consertos diferentes: O trabalhador de "Atenção" e o trabalhador de "FeedForward" são diferentes. Eles precisam de tipos diferentes de atalhos para serem substituídos de forma eficaz.

O Novo Jeito: "SUBFIT" (O Trabalho de Remendo Personalizado)

O artigo introduz um método chamado SUBFIT. Em vez de derrubar bairros inteiros, o SUBFIT age como um mestre alfaiate ou um cirurgião.

  1. Cortar e Remendar, Não Demolir: Ele observa cada uma das estatões de trabalho individualmente, independentemente de onde estejam na linha. Ele escolhe aquelas específicas que estão realizando a menor quantidade de trabalho único (as "redundantes") e as remove. Estas não precisam estar próximas umas das outras; podem estar espalhadas por toda a fábrica.
  2. Desvios Sob Medida: Para cada estação de trabalho que remove, ele costura um "desvio" (um atalho) pequeno e personalizado.
    • Para os trabalhadores de Atenção: Ele usa um atalho de baixo rank muito simples (como uma trilha estreita).
    • Para os trabalhadores de FeedForward: Ele usa um caminho um pouco mais complexo, mas aqui está o truque inteligente: ele compartilha a "planta" deste caminho entre todos os trabalhadores de FeedForward removidos. Isso economiza uma enorme quantidade de espaço, como usar uma chave mestra para abrir várias portas diferentes.

Os Resultados: Mais Rápido, Menor e Ainda Inteligente

Os autores testaram este método em dez modelos diferentes de IA (tanto modelos básicos quanto treinados para seguir instruções). Eles compararam o SUBFIT com os antigos métodos de "demolição de bairro".

  • A Troca (Trade-off): Geralmente, quando você comprime uma IA, ela fica mais rápida, mas começa a cometer mais erros (maior "perplexidade" e menor "precisão").
  • O Vencedor: O SUBFIT manteve a IA muito mais inteligente do que os métodos antigos. Em um nível de compressão de 25% (removendo um quarto das estações de trabalho), os métodos antigos caíram para cerca de 81% de sua inteligência original. O SUBFIT manteceu-se em 84,6%.
  • O Teste "Agressivo": Quando tentaram comprimir os modelos ainda mais (37,5%), os métodos antigos falharam completamente. O SUBFIT manteve sua posição muito melhor.
  • Velocidade: Como eles realmente removeram o maquinário pesado (os submódulos), a fábrica funciona mais rápido. A IA gera sua primeira palavra mais rapidamente e usa menos memória (cache-KV) para lembrar a conversa.

A Conclusão

O artigo afirma que, ao mudar a "granularidade" (o tamanho das peças que você corta) de camadas inteiras para componentes individuais, e ao tratar esses componentes de forma diferente com base no que eles fazem, você pode encolher modelos de IA significativamente sem perder tanto de seu poder cerebral.

É como perceber que você não precisa substituir um bloco de motor inteiro para reduzir o peso; você só precisa remover cuidadosamente os parafusos pesados específicos que não estão fazendo muito trabalho e substituí-los por espaçadores leves e feitos sob medida. O resultado é um motor mais leve que ainda funciona com a mesma fluidez.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →