← Últimos artigos
🤖 machine learning

RDQ: Residual Distribution Quantization for Large Language Models

Este artigo introduz o RDQ, um framework de quantização pós-treinamento que mitiga a acumulação superlinear de ruído de quantização em grandes modelos de linguagem ao empregar Compensação de Erro em Cascata para ajustar escalas por canal contra distribuições residuais desviadas, alcançando assim a perplexidade de estado da arte em precisão de 3 e 4 bits com zero overhead de inferência.

Autores originais: Prateek Singh

Publicado 2026-07-14
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Prateek Singh

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando enviar uma mensagem secreta por um longo túnel sinuoso composto por 32 salas conectadas. Na versão original de alta qualidade deste túnel (chamada FP16), a mensagem viaja perfeitamente clara do início ao fim. Mas quando tentamos encolher a mensagem para caber em um formato comprimido e minúsculo (quantização) para economizar espaço no seu telefone ou dispositivo de borda, as coisas começam a dar errado.

Por muito tempo, os cientistas pensaram que o problema era apenas que cada sala estava um pouco bagunçada por si só. Eles pensavam: "Se apenas limparmos a Sala 1, depois a Sala 2, depois a Sala 3, tudo ficará bem". Mas este novo artigo, RDQ (Quantização de Distribuição Residual), descobriu que essa abordagem de "limpar cada sala separadamente" é, na verdade, a maneira errada de pensar sobre isso.

O Verdadeiro Culpado: O Efeito "Bola de Neve"

Os autores descobriram que o verdadeiro problema é um efeito de bola de neve. Toda vez que uma mensagem passa por uma sala, um pouco de "ruído" ou estática é adicionado a ela. Em um túnel normal, isso não importa. Mas em um túnel comprimido, esse pequeno ruído não desaparece; ele é carregado para a próxima sala, onde se mistura com o novo ruído daquela sala.

Quando a mensagem chega à 32ª sala, essa pequena estática se transformou em um estrondo massivo. Os autores mediram esse "acúmulo de ruído" (que eles chamam de deriva do fluxo residual) e descobriram algo incrível: a quantidade de ruído prevê perfeitamente o quão ruim a mensagem soará. Na verdade, eles encontraram uma correlação tão forte (Pearson r=0,999) que, se você souber o quanto o sinal derivou, pode prever exatamente o quão confuso o computador ficará.

A Grande Descoberta: O Túnel Não é Suave

Antes deste artigo, a maioria dos especialistas assumia que o ruído nesses túneis parecia uma colina suave e previsível (uma distribuição "Gaussiana"). Eles construíram suas ferramentas de limpeza baseadas nessa colina suave.

Mas os autores entraram e deram uma olhada. Eles descobriram que 84% das salas no modelo LLaMA-3-8B não possuem colinas suaves! Em vez disso, o ruído é irregular, estranho e, às vezes, possui dois picos (bimodal). É como esperar um lago calmo e encontrar um oceano agitado com ondas repentinas. Como o ruído é tão estranho, as antigas ferramentas de limpeza de "colina suave" estavam falhando miseravelmente, especialmente quando tentavam encolher a mensagem para apenas 3 bits (um tamanho muito pequeno).

A Solução: "Compensação de Erro Cascata" (CEC)

Então, como consertar um túnel onde o ruído muda conforme você avança? Os autores propõem um novo método chamado Compensação de Erro Cascata (CEC).

Em vez de limpar cada sala fingindo que a mensagem ainda está fresca e limpa (que é o que os métodos antigos faziam), o CEC diz: "Vamos percorrer o túnel primeiro, ver exatamente como a mensagem está quando chega a cada sala e, então, limpá-la."

Veja como funciona:

  1. O Percurso: O computador executa uma mensagem de teste pelo túnel. Ele deixa as primeiras salas ficarem "sujas" (quantizadas) exatamente como ficariam na vida real.
  2. O Aspecto Real: Quando a mensagem chega à Sala 10, ela já está um pouco ruidosa devido às Salas 1 a 9. O sistema captura esse sinal real e bagunçado.
  3. O Ajuste Personalizado: Em vez de usar uma ferramenta de limpeza genérica, o sistema constrói uma ferramenta de limpeza personalizada especificamente para aquele sinal bagunçado. Ele ajusta o "volume" (escalas) da mensagem ali mesmo, na sala.
  4. A Dobra Mágica: Uma vez construída a ferramenta de limpeza, ela é dobrada no batente da porta da sala (os pesos RMSNorm). Isso significa que, quando a mensagem real viajar mais adiante, a limpeza acontece automaticamente, com zero perda de tempo ou velocidade adicional.

Os Resultados: Uma Melhoria Massiva

A equipe testou isso em três modelos de IA famosos: LLaMA-3-8B, Qwen-2.5-7B e Mistral-7B.

  • O Jeito Antigo: Quando tentaram encolher o LLaMA-3-8B para 3 bits usando o método padrão (RTN), a mensagem tornou-se quase ininteligível, com uma pontuação (Perplexidade) saltando de 5,83 para 14,09. Isso é uma queda enorme de qualidade.
  • O Jeito RDQ: Usando seu novo método de "percurso", eles conseguiram reduzir a pontuação para 7,55. Isso é uma melhoria de 46,4% sobre o método antigo!
  • A 4 bits: Eles também obtiveram os melhores resultados já registrados, superando os campeões anteriores por uma margem ampla (ex: 5,62 vs 6,92 para o LLaMA).

O Que Isso Significa

Os autores são muito claros: isso não é apenas uma ferramenta melhor; é uma nova forma de enxergar o problema. Eles provaram que a "deriva" é a principal razão pela qual esses modelos falham em larguras de bits baixas. Eles também mostraram que a antiga ideia de "limpar cada sala de forma independente" é um beco sem saída porque ignora a bola de neve de ruído vinda das salas anteriores.

Embora não consigam resolver o problema para a compressão de 2 bits ainda (o ruído é forte demais ali), eles mostraram que, para a compressão de 3 bits e 4 bits, podemos manter os modelos inteligentes e rápidos. O melhor de tudo? Este novo método funciona com as ferramentas padrão que os engenheiros já usam, então pode ser implantado em telefones e computadores agora mesmo, sem precisar de nenhum hardware especial ou lento.

Em resumo: o túnel estava ficando bagunçado porque estávamos limpando as salas na ordem errada. Ao limpá-las na ordem em que a mensagem realmente viaja, podemos manter o sinal claro até o fim.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →