← Últimos artigos
🤖 machine learning

Compressing LLMs with MoP: Mixture of Pruners

O artigo apresenta o MoP (Mixture of Pruners), um framework iterativo que unifica a poda de profundidade e largura para superar os métodos existentes de dimensão única em termos de precisão e redução de latência nos modelos LLaMA e LLaVA.

Autores originais: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jorda
Publicado 2026-07-28
📖 3 min de leitura☕ Leitura rápida

Autores originais: Bruno Lopes Yamamoto, Lucas Lauton de Alcantara, Victor Zacarias, Leandro Giusti Mugnaini, Keith Ando Ogawa, Lucas Pellicer, Rosimeire Pereira Costa, Edson Bollis, Anna Helena Reali Costa, Artur Jordao

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando carregar uma biblioteca enorme e pesada em uma mochila. Esta biblioteca contém a soma do conhecimento humano, escrita em uma linguagem tão complexa que apenas os computadores mais inteligentes conseguem ler. Essas "bibliotecas" são chamadas de Grandes Modelos de Linguagem (LLMs). Elas são incríveis para escrever histórias, resolver problemas matemáticos e até conversar como um amigo. Mas há um porém: elas são tão grandes e pesadas que exigem quantidades enormes de eletricidade e computadores supervelozes apenas para abrir o livro e ler uma única frase. Se você quiser usá-las em um notebook comum ou em um celular, elas costumam ser muito lentas e pesadas para carregar.

Para resolver isso, cientistas têm tentado tornar essas bibliotecas menores sem jogar fora os livros importantes. Uma das maneiras de fazer isso é chamada de "poda" (pruning). Pense na poda como a jardinagem. Você tem um arbusto gigante e crescido demais (o grande modelo de computador) e quer podá-lo para torná-lo um formato menor e mais arrumado. Você pode cortar galhos inteiros (tornando o arbusto mais curto) ou pode podar as folhas dos galhos (tornando o arbusto mais fino). Por muito tempo, os jardineiros tinham que escolher: ou cortavam galhos inteiros ou podavam as folhas, mas não ambos ao mesmo tempo. A questão era, qual maneira torna o arbusto menor mantendo-o saudável e capaz de dar frutos?

Este artigo apresenta uma nova ferramenta de jardinagem chamada MoP, que significa Mixture of Pruners (Mistura de Podadores). Em vez de escolher apenas um método, o MoP é um jardineiro inteligente e iterativo que tenta ambos os métodos em cada etapa. Imagine que você está podando seu arbusto. Em cada corte, o MoP faz duas perguntas: "Se eu cortar este galho inteiro, como o arbusto fica?" e "Se eu podar as folhas deste galho em vez disso, como ele fica?". Ele então escolhe a versão que mantém o arbusto com a aparência mais próxima da planta original e saudável. Ele repete esse processo, alternando entre cortar galhos e podar folhas, até que o arbusto seja pequeno o suficiente para caber na sua mochila.

Os pesquisadores testaram este método em alguns dos cérebros de computador mais inteligentes do mundo, como os modelos LLaMA-2 e LLaMA-3. Eles descobriram que o MoP é muito melhor em encolher esses modelos do que usando apenas um método sozinho. Quando eles reduziram os modelos em 40% (tornando-os 40% menores), o MoP manteve os modelos tão inteligentes quanto a concorrência, mas também os tornou significativamente mais rápidos. Na verdade, os modelos ficaram 39% mais rápidos ao responder perguntas. Mais surpreendente ainda, eles testaram isso em um modelo que consegue ver imagens e ler texto (chamado LLaVA-1.5). Eles descobriram que, embora tenham "ensinado" o modelo podado apenas com texto (sem imagens), o modelo ainda conseguia entender imagens quase tão bem quanto antes. Isso sugere que misturar as duas estratégias de poda cria um cérebro de computador menor, mais rápido e mais inteligente, que não se perde, mesmo quando fica muito pequeno.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →