← Últimos artigos
💬 NLP

Channel-Wise Mixed-Precision Quantization for Large Language Models

Este artigo introduz a Quantização de Precisão Mista por Canal (CMPQ), um método inovador que aloca dinamicamente níveis de precisão arbitrários aos canais de peso com base nas distribuições de ativação e emprega quantização não uniforme com extração de outliers para reduzir significativamente o uso de memória enquanto mantém alto desempenho para Grandes Modelos de Linguagem em dispositivos de borda.

Autores originais: Zihan Chen, Bike Xie, Jundong Li, Cong Shen

Publicado 2026-06-05
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zihan Chen, Bike Xie, Jundong Li, Cong Shen

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca de conhecimento incrivelmente detalhada e massiva (um Modelo de Linguagem de Grande Escala, ou LLM). Esta biblioteca é tão grande que não cabe em uma prateleira normal; ela requer um armazém do tamanho de um campo de futebol para comportar todos os livros. Você quer pegar essa biblioteca e encolhê-la para que caiba em uma pequena prateleira portátil (como um celular ou um notebook), mas não pode jogar fora as histórias importantes, senão a biblioteca perderá o sentido.

Este artigo apresenta uma nova maneira de encolher essas bibliotecas digitais chamada CMPQ (Quantização de Precisão Mista por Canal). Veja como ela funciona, explicada de forma simples:

O Problema: O "Tamanho Único"

Atualmente, a maioria dos métodos tenta encolher a biblioteca colocando cada livro em uma caixa do mesmo tamanho exato.

  • O Jeito Antigo: Se você decidir usar caixas de "3 bits" (um tamanho pequeno específico), todos os livros serão forçados para dentro de uma caixa de 3 bits.
  • O Problema: Alguns livros são grossos e complexos (precisam de uma caixa grande), enquanto outros são finos e simples (cabem em uma caixa minúscula). Se você forçar um livro grosso em uma caixa pequena, as páginas serão amassadas (a IA comete erros). Se você colocar um livro fino em uma caixa enorme, estará desperdiçando espaço.
  • A Limitação: Os métodos existentes são rígidos. Eles só podem usar tamanhos de números inteiros (como 2 bits, 3 bits ou 4 bits). Se o seu dispositivo tiver apenas um pouco mais de espaço do que uma caixa de 2 bits permite, mas não o suficiente para uma caixa completa de 3 bits, os métodos atuais não conseguem usar esse espaço extra de forma eficaz.

A Solução: O "Empacotamento Inteligente" do CMPQ

O CMPQ é como um serviço de embalagem superinteligente que olha para cada livro individualmente e decide o tamanho perfeito da caixa, com base na importância desse livro.

1. O Conceito de "Canal" (As Prateleiras)
Pense no cérebro da IA como tendo milhares de diferentes "canais" ou prateleiras. O artigo descobriu que nem todas as prateleiras são igualmente importantes. Algumas prateleiras guardam as histórias mais críticas (alta ativação), enquanto outras guardam conteúdo de preenchimento.

  • O Movimento do CMPQ: Em vez de tratar toda a biblioteca da mesma forma, ele olha para cada prateleira. Se uma prateleira tem histórias muito importantes, ele dá a esses livros uma caixa maior e de maior qualidade (mais precisão, como 4 bits). Se uma prateleha tem histórias menos importantes, ele dá a elas uma caixa menor e mais apertada (menos precisão, como 2 bits).

2. A Magia "Fracionária" (O Ajuste Personalizado)
Este é o maior truque do papel. Como o CMPQ mistura caixas grandes e pequenas, ele pode criar um tamanho médio que não é um número inteiro.

  • A Analogia: Imagine que você tem um orçamento que comporta exatamente 2,5 caixas.
    • Os métodos antigos dizem: "Só podemos usar 2 caixas ou 3 caixas. Não podemos fazer 2,5."
    • O CMPQ diz: "Sem problemas! Vamos fazer com que 50% dos livros caibam em caixas de 2 e 50% em caixas de 3. A média é 2,5, e usamos cada centímetro do seu espaço perfeitamente."
  • O Resultado: Você consegue espremer a biblioteca em um espaço ligeiramente maior do que antes, e a IA torna-se significativamente mais inteligente porque não precisou esmagar os livros importantes.

3. Protegendo os "Outliers" (As Joias Raras)
Às vezes, um livro tem algumas páginas que são incrivelmente estranhas ou únicas (chamadas de "outliers"). Se você tentar encolher essas páginas, a história inteira se quebra.

  • A Estratégia do CMPQ: Ele possui um sistema especial de "Proteção de Outliers". Ele identifica essas páginas raras e estranhas antes de encolher o restante da biblioteca. Ele mantém essas páginas específicas em seu formato original de tamanho total (como mantê-las em uma vitrine de vidro) enquanto encolhe todo o resto. Isso garante que os detalhes estranhos e críticos não sejam perdidos.

O Que o Artigo Descobriu

Os autores testaram isso em nove diferentes modelos de IA de grande escala (como OPT e LLaMA). Aqui está o que eles descobriram:

  • Melhor Desempenho: O CMPQ tornou a IA mais inteligente do que os métodos anteriores, mesmo usando tamanhos de caixa muito pequenos (como 3 bits).
  • Vitória Fracionária: Quando permitiram que a IA usasse tamanhos "intermediários" (como 2,2 bits ou 3,4 bits), o desempenho da IA saltou significativamente em comparação com os métodos que estavam presos em números inteiros.
  • Eficiência: Não exigiu o retreinamento da IA do zero (o que é caro e lento). Ele apenas reorganizou os livros existentes.
  • Velocidade: Ele roda tão rápido quanto os métodos antigos, portanto, você não perde velocidade para ganhar precisão.

Em Resumo

O CMPQ é uma maneira mais inteligente de comprimir modelos de IA. Em vez de forçar cada parte da IA para o mesmo recipiente pequeno, ele trata diferentes partes da IA de forma diferente. Ele dá às partes importantes mais espaço e às partes menos importantes menos espaço. Isso permite que a IA caiba em dispositivos menores sem perder sua "capacidade cerebral", e pode até usar pequenos fragmentos de espaço extra que outros métodos ignoram.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →