← Últimos artigos
🤖 machine learning

ADMM-Q: An Improved Hessian-based Weight Quantizer for Post-Training Quantization of Large Language Models

ADMM-Q é um algoritmo de quantização de pesos pós-treinamento, inovador e modular, baseado em uma variante combinatória do Método de Direção Alternada dos Multiplicadores, que melhora significativamente a utilidade dos Modelos de Linguagem Grandes em níveis agressivos de quantização abaixo de 4 bits, minimizando o erro de reconstrução por camada enquanto impõe restrições de quantização.

Autores originais: Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

Publicado 2026-05-13
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Ryan Lucas, Mehdi Makni, Xiang Meng, Adam Deng, Rahul Mazumder

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

A Visão Geral: Encolhendo Cérebros Gigantes

Imagine os Modelos de Linguagem de Grande Escala (LLMs) como Qwen ou LLaMA como bibliotecas massivas e altamente detalhadas. Essas bibliotecas contêm bilhões de livros (parâmetros) que permitem à IA escrever, raciocinar e conversar. No entanto, como essas bibliotecas são tão enormes, são difíceis de carregar (alto uso de memória) e levam muito tempo para serem lidas (computação lenta).

A Quantização é o processo de encolher essas bibliotecas. Em vez de manter cada livro escrito em tinta de alta definição e cor completa (precisão de 32 bits ou 16 bits), tentamos reescrevê-los usando menos cores ou símbolos mais simples (4 bits ou até 2 bits). O objetivo é tornar a biblioteca pequena o suficiente para caber em uma mochila sem perder a história.

O Problema: Os "Avarentos" Encolhedores

Os métodos existentes para encolher esses modelos, como o GPTQ (o padrão atual da indústria), funcionam como um editor ganancioso.

  • Como funcionam: Eles olham para a primeira frase, encolhem-na e seguem em frente. Depois, olham para a segunda frase, encolhem-na e seguem em frente.
  • O defeito: Quando o editor encolhe a primeira frase, ele pode cometer um pequeno erro. Como ele segue em frente imediatamente, nunca volta para corrigir esse erro. Quando chega ao final do livro, todos aqueles pequenos erros se acumularam, tornando a história confusa ou sem sentido. Isso é especialmente ruim ao tentar encolher os livros muito agressivamente (até 2 ou 3 bits).

A Solução: ADMM-Q (A Abordagem do "Encontro em Roda")

Os autores propõem um novo método chamado ADMM-Q. Em vez de um editor ganancioso trabalhando sozinho, imagine uma equipe de editores realizando uma reunião em roda para cada capítulo.

  1. O Encontro em Roda (Otimização Conjunta):
    Em vez de corrigir uma frase de cada vez, a equipe olha para o capítulo inteiro de uma vez. Eles perguntam: "Se mudarmos esta palavra aqui, como isso afeta aquela palavra ali?" Eles ajustam todas as palavras simultaneamente para encontrar a melhor combinação possível que mantém a história clara, mesmo usando muito poucas cores.

  2. A Dança entre "Suave" e "Blocado" (ADMM):
    A matemática por trás disso é chamada de ADMM (Método de Direção Alternada de Multiplicadores). Pense nisso como uma dança entre dois passos:

    • Passo A (O Deslize Suave): A equipe faz pequenos ajustes contínuos nas palavras para melhorar o fluxo da história.
    • Passo B (O Encaixe na Grade): De repente, eles precisam encaixar essas palavras em valores específicos e permitidos (como encaixar um tijolo de Lego no lugar).
    • Eles continuam alternando entre deslizar e encaixar. Com o tempo, esse processo força as palavras a se estabelecerem nas melhores possíveis "posições de Lego" sem quebrar a história.
  3. O Problema dos "Valores Extremos" (Escalonamento Diagonal):
    Nestes modelos, algumas palavras são "altas" (outliers) e algumas são "baixas". Se você tentar encolhê-las todas de uma vez, as palavras altas dominam a conversa e as baixas se perdem.

    • A correção do ADMM-Q: Eles usam uma técnica chamada Escalonamento Diagonal. Imagine dar um microfone às palavras baixas e diminuir o volume das palavras altas apenas para a sessão de edição. Isso garante que cada palavra tenha uma chance justa de ser otimizada, levando a uma história final muito mais clara.
  4. O Polimento Final (Busca Local):
    Assim que a equipe termina seu encontro, eles fazem uma rápida "verificação pontual". Eles procuram pares de palavras que podem ter sido trocados por acidente e veem se trocá-los de volta melhora a história. Isso é um polimento rápido e final para pegar quaisquer erros de última hora.

Por Que Isso Importa: Os Resultados

O artigo testou esse novo método em vários modelos (Qwen e LLaMA) e descobriu que:

  • Melhores Histórias: Quando encolheram os modelos para tamanhos muito pequenos (como 3 bits ou 2 bits), os antigos métodos "gananciosos" (GPTQ) produziam algarismos ou respostas muito confusas. O ADMM-Q manteve os modelos inteligentes e coerentes.
    • Exemplo: Em um teste chamado "WikiText-2", o método antigo teve uma pontuação de 12,85 (quanto maior, pior), enquanto o ADMM-Q reduziu para 10,06. Isso é uma enorme melhoria na clareza.
  • Funciona com Outras Ferramentas: O ADMM-Q não é um substituto para tudo; é um substituto direto para a parte do "encolhedor". Funciona perfeitamente junto com outros truques que as pessoas usam, como rotacionar os dados ou escaloná-los.
  • Mesma Velocidade: Uma vez que o modelo é encolhido, ele roda tão rápido quanto os métodos antigos. O tempo extra que o ADMM-Q leva ocorre apenas durante o processo de encolhimento "offline" (como editar um livro antes de publicar), não enquanto você está realmente usando a IA.

O Problema (Limitações)

  • Leva mais tempo para editar: Como o ADMM-Q realiza um complexo "encontro em roda" para cada camada, leva mais tempo de computador para encolher o modelo inicialmente em comparação com os métodos gananciosos simples. No entanto, os autores dizem que essa espera única vale a pena pela qualidade muito superior.
  • Precisa de uma amostra: Como todos esses métodos, ele precisa de uma pequena amostra de texto (dados de calibração) para entender o que o modelo está tentando dizer antes de começar a encolher.

Resumo

O ADMM-Q é uma maneira mais inteligente de comprimir modelos de IA. Em vez de correr pela etapa de compressão passo a passo e cometer erros ao longo do caminho, ele adota uma abordagem holística e matemática para ajustar todas as partes do modelo juntas. O resultado é uma IA muito menor que ainda lembra como pensar com clareza, mesmo quando espremida em um espaço muito apertado.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →