← Últimos artigos
🤖 machine learning

An Empirical Study of OpenPangu Quantization on Ascend NPUs

Este artigo apresenta um estudo empírico avaliando vários métodos de quantização pós-treinamento para os modelos OpenPangu 1B e 7B em NPUs Huawei Ascend 910B1, revelando que a quantização de 8 bits é efetivamente sem perdas, enquanto a de 4 bits permanece prática apenas para o modelo maior, e as configurações de precisão ultra-baixa falham amplamente.

Autores originais: Tong Shi, Jiacheng Wang, Hui Xie, Ying Li, Aishan Liu, Jinyang Guo, Xianglong Liu

Publicado 2026-06-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Tong Shi, Jiacheng Wang, Hui Xie, Ying Li, Aishan Liu, Jinyang Guo, Xianglong Liu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem dois robôs muito inteligentes, um pequeno (o modelo 1B) e um grande (o modelo 7B). Esses robôs são como bibliotecários brilhantes que podem ler, escrever e resolver problemas. No entanto, eles estão atualmente usando casacos pesados e volumosos (o formato original "FP16") que ocupam muito espaço na sua mochila. Você quer encolher esses casacos para que possa carregá-los em um tipo específico de equipamento de trilha chamado Ascend NPU (um chip especial feito pela Huawei), mas está preocupado que, se encolher os casacos demais, os robôs possam esquecer como pensar.

Este artigo é um "teste de estresse" para ver o quanto podemos encolher esses casacos de robôs antes que eles parem de funcionar adequadamente. Os pesquisadores testaram diferentes maneiras de comprimir os dados, variando de um corte leve até uma redução drástica.

Aqui está o que eles descobriram, explicado através de analogias simples:

1. O "Corte Leve" (Quantização de 8 bits)

O Resultado: Se você aparar os casacos apenas um pouco (até 8 bits), os robôs são indistinguíveis de suas versões originais de casaco pesado.

  • A Analogia: É como pegar um casaco de inverno pesado e remover o forro extra. Ele fica mais leve e fácil de carar, mas o robô ainda parece exatamente o mesmo e consegue resolver problemas de matemática, escrever código e contar piadas tão bem quanto antes.
  • Veredito: Esta é a aposta mais segura. Se você quer economizar espaço sem perder inteligência, faça isso.

2. O "Encolhimento Drástico" (Quantização de 4 bits)

O Resultado: É aqui que o tamanho do robô importa.

  • O Robô Grande (7B): Quando você encolhe o casaco do robô grande para 4 bits, ele ainda funciona muito bem. Ele ainda consegue fazer a maioria das coisas, embora possa tropeçar um pouco em quebra-cabeças de matemática ou codificação muito difíceis.
  • O Robô Pequeno (1B): Quando você tenta encolher o casaco do robô pequeno para 4 bits, ele começa a perder o juízo. Ele fica confuso em tarefas de raciocínio, matemática e codificação.
  • A Analogia: Imagine que o robô grande é um adulto forte que ainda consegue correr uma maratona mesmo se você tirar as botas pesadas dele. O robô pequeno é uma criança; se você tirar as botas pesadas dela, ela não consegue nem atravessar a sala sem tropeçar.
  • Veredito: Para o robô grande, 4 bits é aceitável. Para o robô pequeno, 4 bits é arriscado demais para tarefas sérias.

3. A "Compressão Extrema" (2 bits e Binário)

O Resultado: Quando os pesquisadores tentaram encolher os casacos para 2 bits ou até 1 bit (binário), os robôs quebraram completamente.

  • A Analogia: Isso é como tentar encaixar uma enciclopédia completa em um único post-it. Os robôs começaram a dar respostas aleatórias. Suas respostas tornaram-se absurdos, e sua "perplexidade" (uma pontuação de quão confusos eles estão) disparou, tornando-se essencialmente infinita.
  • Veredito: Não faça isso. Os robôs são efetivamente inúteis neste nível de compressão.

4. Os "Plásticos de Encolhimento Especial" (Diferentes Métodos)

Os pesquisadores testaram diferentes "técnicas" para encolher os casacos, como AWQ, GPTQ e SmoothQuant.

  • AWQ foi como um alfaiate que sabia exatamente onde cortar o tecido para manter a forma perfeita. Funcionou melhor, especialmente para o robô grande em 4 bits.
  • SmoothQuant tentou encolher tanto o casaco quanto o sistema nervoso interno do robô (ativações). Embora tenha funcionado bem em 8 bits, quando tentaram encolhê-lo para 4 bits, o sistema nervoso do robô entrou em curto-circuito, causando uma falha (erros não finitos).
  • Veredito: Alguns métodos de encolhimento são mais inteligentes que outros. AWQ é o melhor alfaiate para este trabalho, mas encolher o sistema nervoso interno (ativações) é atualmente muito perigoso.

5. A "Granularidade" (Como você corta o tecido)

O artigo também analisou como eles cortavam o tecido. Eles descobriram que cortar o tecido em pequenos retalhos específicos (per-group) funcionou melhor do que cortar em uma longa tira (per-channel).

  • A Analogia: Imagine remendar uma colcha. Se você remendar a colcha inteira com uma única peça grande de tecido, ela ficará estranha e não se ajustará bem. Se você cortar o tecido em pequenos quadrados que se ajustam a cada remendo específico, a colcha ficará perfeita.
  • Veredito: Sempre use o método de "pequenos retalhos" (per-group) se o seu hardware suportar. Isso mantém o robô mais inteligente.

Resumo para o Trilheiro

Se você estiver preparando seus equipamentos para a Ascend NPU:

  • Escolha Segura: Encolha o casaco para 8 bits. O robô permanece inteligente e você economiza espaço.
  • Escolha Arriscada: Encolha para 4 bits apenas se você tiver o Robô Grande (7B) e usar o método AWQ. Evite isso para o Robô Pequeno (1B) se precisar que ele faça matemática ou codificação.
  • Evite: Não tente encolher para 2 bits ou 1 bit. O robô parará de funcionar.
  • Aviso: Não tente encolher o sistema nervoso interno do robô (ativações) ainda; isso causa falhas.

O artigo conclui que, embora possamos tornar esses robôs menores e mais portáteis, existe um limite rígido. Não podemos simplesmente continuar encolhendo-os para sempre sem quebrar seus cérebros.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →