← Últimos artigos
🤖 machine learning

OffQ: Taming Structured Outliers in LLM Quantization by Offsetting

O OffQ é um novo método de quantização de baixa bitagem que mitiga outliers de ativação em grandes modelos de linguagem ao identificar um subespaço de outliers de baixa dimensão via PCA top-1, rotacionando ativações de alta magnitude para um único canal e convertendo sua magnitude em um offset compartilhado para permitir a quantização W4A4KV4 eficiente e precisa.

Autores originais: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

Publicado 2026-06-08
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Haoqi Wang, Lorenz K. Mueller, Jiawei Zhuang, Mathieu Salzmann, Lukas Cavigelli

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca de conhecimento massiva e incrivelmente detalhada (um Grande Modelo de Linguagem, ou LLM). Para fazer com que essa biblioteca caiba em uma mochila pequena para que você possa carregá-la em um celular ou notebook, você precisa encolher os livros. Esse processo é chamado de quantização.

Normalmente, você encolhe os livros arredondando os pequenos detalhes, transformando números complexos em números inteiros simples (como transformar 4,99 em 5). Isso economiza uma enorme quantidade de espaço.

O Problema: Os "Gritadores"
No entanto, há um porém: nestas bibliotecas, a maioria das páginas é calma e silenciosa, mas algumas páginas contêm "gritadores" — números extremamente altos e caóticos que são muito maiores do que todos os outros.

  • Se você tentar encolher toda a biblioteca para caber em uma caixa pequena, esses "gritadores" forçam você a usar uma grade muito grosseira.
  • É como tentar colocar um elefante gigante e um rato minúsculo na mesma caixa pequena. Para acomodar o elefféante, você tem que esmagar o rato em um monte minúsculo e irreconhecível.
  • Em termos técnicos, esses "gritadores" (outliers de ativação) arruinam a precisão do modelo porque os erros de arredondamento tornam-se grandes demais para as partes silenciosas dos dados.

As Soluções Antigas
Tentativas anteriores de corrigir isso foram como tentar resolver o problema do elefante e do rato usando:

  1. Aprender uma nova forma de encolher: Treinar o modelo novamente para ser melhor em encolher (caro e lento).
  2. Usar caixas de tamanhos diferentes: Manter o elefante em uma caixa grande e o rato em uma pequena (precisão mista). Isso funciona, mas torna o processo de empacotamento complicado e lento.
  3. Usar caixas estranhas e personalizadas: Criar caixas especiais que não se encaixam em prateleiras padrão (quantização não uniforme), que a maioria dos computadores não consegue lidar facilmente.

A Nova Solução: OffQ
O artigo apresenta um novo método chamado OffQ. Em vez de lutar contra os gritadores ou usar caixas diferentes, o OffQ usa um truque inteligente para "cancelar" os gritadores.

Veja como o OffQ funciona, passo a passo, usando uma analogia simples:

1. Encontrando os "Gritadores" (Top-1 PCA)

Primeiro, o OffQ observa os dados para encontrar exatamente onde os "gritadores" estão escondidos.

  • A Analogia: Imagine uma sala lotada onde todos estão sussurrando, exceto uma pessoa gritando no canto. Os métodos padrão podem ficar confusos com todos os sussurros. O OffQ usa um radar especial "Top-1" que ignora os sussurros e foca apenas no grito mais alto.
  • O Resultado: Ele identifica que esses gritadores seguem um padrão específico e podem ser agrupados em um único "canal barulhento".

2. Movendo os "Gritadores" para um Só Lugar (Rotação)

Uma vez encontrados, o OffQ rotaciona os dados para que toda a energia do grito seja concentrada em apenas um único canal (como mover todas as pessoas gritando para um assento específico em um teatro).

  • A Analogia: Em vez de ter algumas pessoas gritando em diferentes fileiras, você as move para a primeira fila, assento número 1. Agora, o resto do teatro está perfeitamente silencioso.

3. O Truque do "Offset" Mágico (Rotação de Hadamard)

Este é o núcleo da inovação. O OffQ pega esse "assento barulhento" e usa uma rotação matemática (chamada rotação de Hadamard) para espalhar esse ruído alto uniformemente por todos os assentos no teatro.

  • A Analogia: Imagine que o ruído alto do assento 1 é, na verdade, um cobertor gigante e pesado. Em vez de deixar o cobertor no assento 1 (onde ele bloqueia a visão), o OffQ corta o cobertor em pedaços minúsculos e iguais e coloca um pequeno pedaço sobre cada um dos assentos da sala.
  • O Resultado: Nenhum assento está mais sobrecarregado. O "ruído" agora é um zumbido de fundo constante e suave que é o mesmo para todos.

4. Absorvendo o Ruído (Quantização)

Como o ruído agora é um zumbido constante e igual em toda a sala, o processo de quantização (o encolhimento) pode simplesmente dizer: "Ok, sabemos que há um leve zumbido em todo lugar. Vamos apenas ajustar nosso ponto zero para ignorá-lo".

  • A Analogia: É como dizer ao bibliotecário: "Sabemos que a sala está um pouco empoeirada. Apenas subtraia um pouco de poeira do peso de cada livro, e agora eles caberão perfeitamente na mochila pequena".
  • O Resultado: Os "gritadores" são efetivamente neutralizados. O modelo agora pode ser encolhido para 4 bits (muito pequeno) sem perder sua capacidade de entender a linguagem.

Por que Isso Importa

  • Não Precisa de Hardware Especial: Ao contrário de outros métodos que exigem chips de computador customizados e complicados, o OffQ funciona com caixas uniformes padrão. É como usar contêineres de transporte padrão em vez de caixas feitas sob medida.
  • Melhor Precisão: O artigo mostra que o OffQ mantém o conhecimento da biblioteca muito mais preciso do que métodos anteriores, mesmo quando o encolhendo para o menor tamanho (4 bits para pesos, ativações e memória).
  • Eficiência: Não requer o retreinamento do modelo nem o uso de memória extra para diferentes tipos de caixas. Basta rearranjar os dados e ajustar o "ponto zero".

Em Resumo
O OffQ é um truque de embalagem inteligente. Em vez de deixar alguns números "altos" estragarem todo o carregamento, ele os isola, espalha seu efeito uniformemente por todo o pacote e, em seguida, ajusta a escala para que o pacote caiba perfeitamente em uma caixa pequena e eficiente sem quebrar o conteúdo. Isso torna a execução de modelos de IA poderosos em dispositivos comuns muito mais viável.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →