← Últimos artigos
💻 computer science

LEAP: Learnable End-to-End Adaptive Pruning of Large Language Models

O artigo apresenta o LEAP, um método de poda adaptativa aprendível de ponta a ponta que utiliza um relaxamento de Bernoulli por peso via sigmoide de Gumbel para permitir o aprendizado de esparsidade não estruturada tratável em modelos de linguagem grandes, superando significativamente as bases existentes por camada em precisão zero-shot em níveis elevados de esparsidade.

Autores originais: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Mohammad Mozaffari, Younes Hourri, Mohammad Rastegari, Mahyar Najibi

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca massiva e incrivelmente inteligente (um Modelo de Linguagem de Grande Escala) que sabe quase tudo. Mas essa biblioteca é tão enorme que ocupa um armazém inteiro, requer uma usina de energia gigantesca para funcionar e é lenta demais para que qualquer pessoa a utilize realmente em um computador comum.

Para resolver isso, você quer descartar 50% a 60% dos livros (os "pesos" ou conexões no modelo) para torná-la menor e mais rápida. O objetivo é manter a biblioteca tão inteligente quanto antes, mesmo com metade dos livros.

É aqui que o artigo LEAP entra. Aqui está a história de como eles resolveram o problema, explicada de forma simples:

O Problema: A Armadilha das "Muitas Opções"

Por muito tempo, cientistas tentaram eliminar livros usando duas estratégias principais:

  1. A Abordagem "Camada por Camada" (Jeito Antigo): Imagine um bibliotecário olhando uma prateleira de cada vez e decidindo: "Este livro parece inútil, jogue-o fora". Eles fazem isso para cada prateleira sem conversar com as outras prateleiras.

    • O Defeito: Às vezes, um livro parece inútil em sua própria prateleira, mas é crucial para uma história que abrange toda a biblioteca. Ao olhar para as prateleiras de forma isolada, esse método descarta acidentalmente conexões importantes, tornando a biblioteca menos inteligente.
  2. A Abordagem "Padrão" (A Maneira Mais Nova, Mas Quebrada): Recentemente, alguns pesquisadores tentaram olhar para a biblioteca inteira de uma só vez. Eles disseram: "Vamos aprender exatamente quais livros manter". Mas tentaram fazer isso agrupando livros em pequenos conjuntos (como 4 livros de cada vez) e perguntando: "Qual padrão desses 4 devemos manter?"

    • O Defeito: Isso funciona muito bem para pequenos grupos. Mas se você tentar fazer isso para uma fileira inteira de 4.000 livros (que é o que os modelos de IA modernos têm), o número de "padrões" possíveis torna-se um número tão enorme que é impossível escrevê-lo. É como tentar listar todas as combinações possíveis de números da loteria para um bilhão de bilhetes. O computador engasga; a matemática quebra.

A Solução: LEAP (O Sistema de "Voto Individual")

Os autores deste artigo, LEAP, perceberam que precisavam de uma nova maneira de votar sobre quais livros manter sem se sobrecarregar com a matemática.

Em vez de perguntar: "Qual padrão de grupo devemos manter?" (o que é impossível para grupos enormes), eles fizeram uma pergunta muito mais simples para cada livro individual: "Este livro específico deve ficar ou ir?"

  • A Analogia: Imagine uma eleição massiva onde cada eleitor (cada peso no modelo) recebe um pequeno boletim de voto. Em vez de votar em uma "estratégia de equipe" complexa, eles apenas votam "Sim" (manter) ou "Não" (descartar).
  • O Truque Mágico: Para fazer isso funcionar, eles usaram um truque matemático (chamado "Gumbel-sigmoid") que permite ao computador "adivinhar" os votos de forma suave no início e, em seguida, tornar essas suposições progressivamente mais difíceis e nítidas até que cada voto seja um claro "Sim" ou "Não".

Como Eles Fizeram (A Receita)

Eles não começaram do zero. Usaram um ponto de partida inteligente:

  1. O Início Quente: Primeiro, usaram um método rápido e simples (chamado Wanda) para obter uma ideia aproximada de quais livros provavelmente eram inúteis. Usaram isso como uma "vantagem inicial" para que o computador não precisasse adivinhar às cegas.
  2. O Treinamento: Permitiram que o computador "aprendesse" o melhor conjunto de votos lendo uma pequena quantidade de texto (um fluxo de calibração) e ajustando os votos "Sim/Não" para manter a inteligência da biblioteca alta.
  3. Congelando os Livros: Crucialmente, eles não alteraram as palavras dentro dos livros (os pesos do modelo). Eles apenas mudaram a decisão de quais livros manter. Isso mantém a "personalidade" e o conhecimento originais da biblioteca intactos, apenas em um pacote menor.

Os Resultados: Mais Inteligente, Mais Rápido, Mais Leve

Eles testaram isso em cinco modelos de IA famosos diferentes (variando de pequenos a muito grandes) e os reduziram em 50% e 60%.

  • O Placar: Eles compararam o LEAP com os melhores métodos existentes.
  • A Vitória: O LEAP foi consistentemente melhor. Em média, melhorou a precisão do modelo em 2,59 pontos sobre o melhor método anterior. Em alguns casos, a melhoria foi de até 5,40 pontos.
  • A Velocidade: Como eles cortaram o modelo de uma maneira que se encaixa perfeitamente com novos chips de computador rápidos (GPUs) projetados exatamente para essa tarefa, o modelo resultante roda muito mais rápido sem perder sua inteligência.

Por Que Isso Importa

Antes disso, se você quisesse tornar um modelo de IA enorme menor e mais rápido, tinha que escolher entre:

  • Opção A: Manter a precisão, mas ser enorme e lento.
  • Opção B: Torná-lo pequeno e rápido, mas burro.

LEAP mostra que você pode ter o bolo e comê-lo também. Ele fornece uma maneira prática de encolher esses cérebros massivos de IA pela metade, mantendo-os tão inteligentes, para que possam rodar em computadores comuns em vez de precisar de um supercomputador.

Em resumo: LEAP é uma nova e mais inteligente maneira de editar um modelo de IA gigante, permitindo que cada conexão individual vote se deve permanecer, resultando em uma IA menor, mais rápida e ainda muito inteligente.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →