← Últimos artigos
💬 NLP

SpenseGPT: Practical One-shot Pruning Enabling Sparse and Dense GEMMs for LLM Inference

O SpenseGPT introduz um método de poda de etapa única prático que utiliza um formato híbrido de pesos esparsos-densos para alcançar até 1,2x de aceleração na decodificação de LLMs de ponta a ponta em GPUs B200, mantendo a precisão do modelo e superando as limitações da esparsidade semiestruturada estrita sem exigir suporte de compilador personalizado.

Autores originais: Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

Publicado 2026-06-10
📖 4 min de leitura☕ Leitura rápida

Autores originais: Jaeseong Lee, Seung-won Hwang, Samyam Rajbhandari

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca massiva e incrivelmente inteligente (um Grande Modelo de Linguagem, ou LLM) que ajuda computadores a escrever código, resolver problemas matemáticos e seguir instruções. Para fazer essa biblioteca rodar rápido em computadores modernos, engenheiros têm tentado "podar" (pruning) esse conteúdo — removendo livros desnecessários para torná-la mais leve e rápida.

No entanto, há um detalhe: a maneira mais rápida de ler esses livros em novos chips de computador (como o B200 da NVIDIA) exige uma regra muito estrita: Para cada quatro livros em uma prateleira, exatamente dois devem estar vazios. Isso é chamado de "escassez 2:4" (2:4 sparsity).

O Problema: A Regra Estrita

O problema com essa regra estrita é que é como tentar arrumar uma mala onde você precisa deixar exatamente metade do espaço vazio. Se você apenas jogar fora metade dos livros aleatoriamente para cumprir a regra, você perde informações importantes e a biblioteca deixa de funcionar bem. O computador se torna rápido, mas as respostas que ele dá tornam-se bobas ou erradas.

Outros pesquisadores tentaram corrigir isso tornando as regras mais flexíveis, mas suas soluções foram como construir um motor personalizado e caro que só funciona com um tipo específico de combustível, ou adicionaram tanto trabalho extra (overhead) que o ganho de velocidade desapareceu.

A Solução: Spense (A Prateleira Híbrida)

Os autores deste artigo propõem um novo método chamado Spense. Em vez de forçar a biblioteca inteira a seguir a regra estrita de "dois vazios, dois cheios", eles dividem as prateleiras em duas zonas:

  1. A Zona Esparsa: Aqui, eles seguem a regra estrita (2 de cada 4 livros são removidos). Esta zona obtém o ganho de velocidade do hardware especial do computador.
  2. A Zona Densa: Aqui, eles mantêm todos os livros. Nenhum livro é removido. Esta zona preserva a informação mais importante.

Pense nisso como um carro híbrido. A "Zona Esparsa" é o motor elétrico (super eficiente para cruzar/deslocar-se), e a "Zona Densa" é o motor a gasolina (potente quando você precisa subir uma colina). Ao combinar os dois, você obtém o melhor de ambos os mundos: velocidade sem perder potência.

O Segredo: Escolhendo o que Manter

A parte difícil é decidir quais livros vão para a "Zona Densa" e quais serão jogados fora. Os autores descobriram que essa escolha é crítica. Se você escolher os livros errados para manter, a biblioteca ainda falhará.

Eles desenvolveram duas estratégias para fazer essa escolha:

  • SpenseGPT (A Estratégia Simples): Imagine que os livros estão organizados em uma linha. Este método diz: "Vamos manter os últimos 25% dos livros na prateleira como estão (Densos) e podar os primeiros 75% (Esparsos)". Acontece que essa abordagem simples de "cortar no final" funciona surpreendentemente bem devido à forma como a matemática da poda é calculada.
  • SpenseGPT+ (A Estratégia Inteligente): Isso é como contratar um bibliotecário que lê cada livro para ver quais são os mais importantes. Ele calcula uma "pontuação" para cada livro com base em quanto ele contribui para a resposta final. Ele mantém os livros de maior pontuação na Zona Densa, garantindo que o conhecimento mais crítico nunca seja perdido.

Os Resultados: Rápido e Preciso

A equipe testou isso em dois modelos muito grandes e inteligentes (Qwen3-32B e Seed-OSS-36B) usando os chips de computador mais rápidos e modernos (GPUs B200).

  • Velocidade: Eles alcançaram um aceleração de 1.2x no uso real. Isso significa que o computador pode gerar respostas visivelmente mais rápido do que antes.
  • Precisão: Ao contrário de outros métodos que tornavam os modelos "bobos", o Spense manteve os modelos inteligentes. Eles tiveram um desempenho tão bom quanto os modelos originais não podados em tarefas difíceis como raciocínio matemático, codificação e seguimento de instruções.
  • Praticidade: Crucialmente, este método não requer a construção de novos softwares de computador personalizados (compiladores). Ele funciona com as ferramentas padrão e altamente otimizadas que já existem nesses chips.

Resumo

Em suma, o artigo apresenta uma maneira de tornar os modelos de IA mais rápidos sem torná-los menos inteligentes. Em vez de forçar todo o modelo a ser "metade vazio" (o que o quebraria), eles criaram um sistema híbrido: parte do modelo é reduzida para velocidade, e a parte mais importante é mantida completa para precisão. Isso permite que computadores modernos executem esses cérebros de IA gigantes mais rápido do que nunca, usando ferramentas que já estão disponíveis.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →