← Últimos artigos
🤖 machine learning

InfoQuant: Shaping Activation Distributions for Low-Bit LLM Quantization

InfoQuant é um método de quantização pós-treinamento sem necessidade de treinamento que emprega Transformação Ortogonal de Supressão de Picos (PSOT) e seleção adaptativa de tokens outliers para remodelar as distribuições de ativação em uma forma compacta e bem dispersa, reduzindo assim significativamente o erro de quantização e superando as linhas de base existentes para implantação de LLMs de baixo bit.

Autores originais: Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

Publicado 2026-05-27
📖 4 min de leitura☕ Leitura rápida

Autores originais: Ke Li, Dong An, Xiaoling Zang, Can Ye, Liang Xie, Qibo Qiu, Chen Shen, Xiaofei He, Wenxiao Wang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: A Caixa "Muito Alta"

Imagine que você tem uma pilha gigante e caótica de areia (isso representa os dados dentro de um Modelo de Linguagem de Grande Escala, ou LLM). Você quer encaixar essa areia em uma caixa pequena e organizada para economizar espaço e facilitar o transporte (isso é a quantização—encolher o modelo para que ele execute mais rápido e use menos memória).

Geralmente, a maior parte da areia tem uma altura normal e gerenciável. Mas, existem alguns picos gigantes de areia que se estendem muito alto no céu (esses são chamados de outliers).

Por causa desses poucos picos gigantes, você é forçado a usar uma caixa enorme para caber tudo. Uma vez que você coloca a areia nessa caixa enorme, a areia "normal" no fundo fica espremida em uma camada minúscula e plana. Quando você tenta tirar a areia de volta depois, não consegue distinguir as diferentes camadas de areia normal porque todas foram achatadas para o mesmo lugar. O modelo perde sua capacidade de "pensar" claramente.

As Soluções Antigas: Achatar os Picos

Métodos anteriores tentaram consertar isso:

  1. Esmagando os picos: Tentando cortar o topo das pilhas gigantes de areia.
  2. Movendo os picos: Deslocando a areia pesada de um lugar para outro.

O problema é que, mesmo se você cortar os picos, a areia restante ainda pode estar aglomerada de uma forma que não se encaixa bem na caixa pequena. Você pode ter uma caixa menor, mas a areia ainda está agrupada de uma maneira que torna difícil distinguir entre os diferentes grãos.

A Nova Ideia: INFOQUANT

Os autores deste artigo, INFOQUANT, perceberam que o objetivo não é apenas fazer a areia "menor". O objetivo é fazer a areia parecer que foi projetada para a caixa.

Eles fazem uma nova pergunta: "Como é uma pilha de areia que se encaixa perfeitamente em uma caixa pequena?"

Sua resposta: Ela precisa ser baixa (para caber na caixa), mas também distribuída uniformemente (para que você possa ver cada grão de areia).

Como o INFOQUANT Funciona (A Receita de 3 Passos)

1. O "Giro e Espalhar" (Transformação Ortogonal de Supressão de Picos)
Imagine que a areia está em um pião. Os autores usam um truque matemático especial (uma rotação ortogonal) para girar a areia.

  • O que faz: Ele pega esses picos gigantes e espalha sua energia por toda a pilha.
  • O Resultado: Os picos gigantes desaparecem e a areia se torna uma colina lisa e larga. Crucialmente, a colina agora está mais baixa (cabe na caixa), mas mais larga (a areia está espalhada para que você possa distinguir as camadas).

2. O "Escoteiro Inteligente" (Seleção Adaptativa de Tokens Outlier)
Às vezes, a pilha de areia tem alguns lugares estranhos e ruidosos que parecem picos, mas não são realmente importantes. Se você tentar consertar esses, pode estragar as partes boas.

  • O que faz: O INFOQUANT tem um "escoteiro" que olha para a areia e diz: "Ok, aquele pico ali é real e perigoso, vamos consertar isso. Mas aquele pequeno inchaço ali? Ignore."
  • O Resultado: O modelo concentra sua energia em consertar os problemas reais, tornando o processo mais robusto e menos propenso a se confundir com ruído.

3. O "Ajuste Fino do Clipe" (Clipping de Ativação Aprendível)
Depois de girar e espalhar a areia, os autores fazem uma última verificação. Eles ajustam o tamanho exato da caixa para garantir que a areia caiba perfeitamente, sem lacunas ou esmagamento.

  • O Resultado: O pacote final é otimizado para o tamanho específico da caixa, garantindo que nenhuma informação seja perdida nos cantos.

Por Que Isso Importa

O artigo testou isso em modelos de IA famosos (como LLaMA-2 e LLaMA-3).

  • O Resultado: Quando encolheram os modelos para 4 bits (um tamanho muito pequeno, como encolher um livro de 100 páginas para um cartão postal), o INFOQUANT manteve 97% da inteligência original.
  • A Comparação: Métodos anteriores perderam muito mais inteligência ao encolher para esse tamanho. O INFOQUANT conseguiu manter o "cartão postal" legível e útil, enquanto outros o transformaram em um rabisco borrado.

A Conclusão

Pense no INFOQUANT como um empacotador mestre. Em vez de apenas tentar forçar uma pilha bagunçada e com picos de areia em uma caixa pequena (o que esmaga os detalhes), eles primeiro reformulam a pilha para que ela se encaixe naturalmente na caixa perfeitamente. Eles tornam a pilha baixa o suficiente para caber, mas espalhada o suficiente para manter todos os detalhes visíveis.

Isso nos permite executar modelos de IA enormes e poderosos em computadores menores e mais baratos, sem perder seu "poder cerebral".

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →