← Últimos artigos
🤖 machine learning

NSNQuant: A Double Normalization Approach for Calibration-Free Low-Bit Vector Quantization of KV Cache

O NSNQuant é um método de quantização vetorial livre de calibração para caches KV de LLMs que emprega uma transformação única de "Normalizar-Deslocar-Normalizar" combinada com uma transformada de Hadamard para alinhar as distribuições de tokens com uma distribuição normal padrão, permitindo compressão de baixa taxa robusta e ganhos de até 3x em throughput sem depender de conjuntos de dados de calibração.

Autores originais: Donghyun Son, Euntae Choi, Sungjoo Yoo

Publicado 2026-07-16
📖 7 min de leitura🧠 Leitura aprofundada

Autores originais: Donghyun Son, Euntae Choi, Sungjoo Yoo

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando carregar uma biblioteca massiva de memórias em sua mochila enquanto caminha por um caminho muito longo. É isso que acontece quando um Grande Modelo de Linguagem (LLM) — um cérebro de computador superinteligente que escreve histórias, resolve matemática e conversa com você — tenta processar uma conversa longa. Cada vez que ele lê uma palavra, ele tem que se lembrar de tudo o que veio antes para entender o contexto. Essa "memória" é chamada de KV Cache (Cache de Chave-Valor). O problema é que, conforme a conversa fica mais longa, essa mochila fica cada vez mais pesada, até que fica tão cheia que o computador fica sem espaço e começa a rodar de forma lenta.

Para resolver isso, cientistas tentaram encolher a mochila comprimindo as memórias, de forma muito semelhante a guardar roupas em um saco a vácuo. Um método popular é a Quantização Vetorial (VQ). Pense nisso como agrupar itens semelhantes e substituí-los por um único rótulo de um "dicionário" ou código. Em vez de se lembrar da tonalidade exata de azul para cada uma das meias, você apenas lembra "Grupo Azul 4". No entanto, há uma pegadinha: a maioria dos métodos existentes precisa estudar um conjunto específico de roupas (um conjunto de dados de calibração) para construir esse dicionário. Se você tentar empacotar um conjunto de roupas completamente diferente (um novo tipo de conversa), o dicionário não servirá, e a compressão falhará. Este artigo aborda exatamente esse problema: como encolher a memória sem precisar estudar as roupas primeiro.


O Problema: Um Dicionário Que Só Funciona para Um Guarda-Roupa

Os autores deste artigo, da Universidade Nacional de Seul, notaram uma falha frustrante no método atual de ponta para comprimir a memória de LLMs, chamado Quantização Acoplada (CQ). Imagine o CQ como um alfaiate que faz um terno personalizado com base em medidas tiradas de uma única pessoa. Se essa pessoa entrar em uma sala cheia de pessoas com tipos de corpo diferentes, o terno servirá perfeitamente na primeira pessoa, mas parecerá ridículo em todas as outras.

No mundo da IA, essa "pessoa" é o dado no qual o modelo foi calibrado (como um conjunto de dados de texto específico chamado WikiText-2). Quando o modelo tenta processar um tipo diferente de texto (como o conjunto de dados C4, que é uma coleção massiva de páginas da web), o "terno" não serve. Os autores descobriram que esse descompasso faz com que o modelo cometa erros bobos, especialmente com sinais de pontuação. Por exemplo, o modelo pode ficar confuso sobre vírgulas porque o "dicionário" que ele aprendeu a partir dos dados de treinamento não tinha os rótulos corretos para a maneira como as vírgulas aparecem no novo texto. Isso é um grande problema porque significa que o modelo se torna não confiável quando sai de sua zona de conforto.

A Solução: NSNQuant – O Cubo de Organização Universal

Para resolver isso, a equipe introduziu o NSNQuant, uma nova maneira inteligente de comprimir a memória que não precisa estudar nenhum dado específico primeiro. Em vez de tentar aprender um dicionário personalizado para cada novo guarda-roupa, o NSNQuant força todas as roupas a caberem em um cubo de organização padrão e pré-fabricado.

Eles fazem isso usando um truque de três etapas que chamam de Normalizar-Deslocar-Normalizar (NSN):

  1. Normalizar (A Primeira Etapa): Imagine que você tem uma pilha de meias onde algumas são minúsculas e outras são gigantes. O primeiro passo é esticar ou encolher cada meia para que todas tenham o mesmo tamanho. Isso evita que as meias gigantes ocupem todo o espaço e atrapalhem o empacotamento.
  2. Deslocar (A Etapa Intermediária): Agora, imagine que as meias têm todas o mesmo tamanho, mas estão todas inclinadas para a esquerda. A etapa de "Deslocamento" empurra todas elas de volta para o centro para que fiquem perfeitamente equilibradas.
  3. Normalizar (A Etapa Final): Apenas para garantir, eles verificam o tamanho uma última vez para ter certeza de que tudo ainda é uniforme.

Após essa dança de três etapas, os autores adicionam um toque final: uma Transformada de Hadamard. Você pode pensar nisso como girar toda a pilha de meias de uma maneira matemática específica. A mágica é que, após esse giro, as formas bagunçadas e imprevisíveis das meias (os dados) subitamente parecem uma curva de sino perfeita e suave (uma distribuição normal padrão).

Como os dados agora parecem essa curva de sino previsível, independentemente de qual era o texto original, os autores podem usar um "dicionário" (codebook) único e pré-fabricado projetado especificamente para essa curva de sino. Eles não precisam olhar para os dados primeiro; eles apenas sabem que os dados se encaixarão no dicionário porque forçaram os dados a terem essa aparência.

O Que Eles Descobriram: Uma Chave Universal

A equipe testou essa ideia em vários modelos de IA famosos, incluindo as famílias LLaMA e Mistral. Eles compararam o NSNQuant com os métodos antigos (como CQ e KIVI) usando diferentes tipos de texto, desde histórias simples até códigos complexos e problemas matemáticos.

Os resultados foram impressionantes:

  • Melhor Generalização: Enquanto os métodos antigos (CQ) tropeçavam ao mudar de um conjunto de dados para outro, o NSNQuant manteve um desempenho forte. Era como ter uma chave universal que abria todas as portas, enquanto as chaves antigas só funcionavam nas portas para as quais foram feitas.
  • Sucesso em Baixo Bitrate: A equipe testou a compressão da memória para apenas 1-bit e 2-bit. No cenário de 1-bit (onde a memória é reduzida ao seu tamanho absoluto mínimo), o NSNQuant esmagou a competição. Por exemplo, em uma tarefa de raciocínio matemático chamada GSM8K, o antigo método de 1-bit obteve uma pontuação de cerca de 24, enquanto o NSNQuant-1b obteve 53,45. Isso é mais que o dobro do desempenho!
  • Velocidade e Espaço: Como a memória é muito menor, o computador pode processar mais conversas ao mesmo tempo. Os autores mostraram que seu método pode lidar com 3 vezes mais volume de dados (throughput) do que a versão padrão não comprimida, usando significativamente menos memória.

As Letras Miúdas

Os autores observam cuidadosamente que, embora este método seja uma grande melhoria, não é uma mágica perfeita. Eles descobriram que, nas primeiras camadas do modelo de IA, as "meias" às vezes ainda possuem alguns valores discrepantes (outliers) que não se encaixam perfeitamente na curva de sino. No entanto, mesmo com esses pequenos problemas, o desempenho geral permaneceu muito alto.

Eles também enfatizam que este método é "livre de calibração". Ao contrário dos métodos antigos que exigiam horas estudando dados específicos para construir um dicionário, o dicionário do NSNQuant pode ser construído em menos de 5 minutos em uma única placa gráfica e, em seguida, reutilizado para qualquer modelo. Isso o torna incrivelmente prático para uso no mundo real.

Em resumo, o NSNQuant é como um sistema de organização universal que força qualquer pilha bagunçada de memórias a assumir uma forma limpa e previsível, permitendo que os modelos de IA carreguem suas memórias de longo prazo em uma mochila muito menor sem perder a capacidade de pensar claramente. Isso sugere que, ao padronizar os dados antes de comprimi-los, podemos tornar a IA mais rápida, barata e confiável, mesmo quando ela está lidando com tópicos completamente novos e desconhecidos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →