← Últimos artigos
🤖 machine learning

MosaicQuant: Inlier-Outlier Disaggregation for Unified 4-Bit LLM Quantization

A MosaicQuant introduz um framework unificado de quantização de LLM de 4 bits que desagrega os pesos em uma base densa e um resíduo esparso para preservar a precisão, enquanto seu componente ZipperEngine funde sua execução em um único pipeline de baixa precisão para alcançar um desempenho próximo ao FP16 com um aumento de velocidade de até 1,24× em relação aos baselines.

Autores originais: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

Publicado 2026-06-16
📖 4 min de leitura☕ Leitura rápida

Autores originais: Yangjia Hu, Haodong Wang, Zicong Hong, Qianli Liu, Quanxin Shou, Jian Lin, Song Guo, Xiaowei Shen, Xiangjun Huang, Dian Wang, Jian Yang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você tem uma biblioteca enorme de livros (Modelos de Linguagem de Grande Escala, ou LLMs) que deseja carregar em sua mochila. O problema é que os livros são tão pesados e grossos que sua mochila não consegue suportá-los, e lê-los leva uma eternidade.

Para resolver isso, você decide encolher os livros. Você quer comprimi-los para pequenas "edições de bolso" de 4 bits (quantização). Isso os torna leves e rápidos de ler. No entanto, há um porém: quando você encolhe demais os livros, perde os detalhes importantes.

A maioria dos livros possui muitas palavras comuns e entediantes (como "o", "é", "e") que são fáceis de encolher. Mas, de vez em quando, surge uma palavra rara e complexa ou uma reviravolta dramática na trama (um "outlier") que é crucial para a história. Se você tentar encolher essas palavras raras para o mesmo tamanho minúsculo das comuns, a história desmorona e a IA começa a cometer erros.

O Jeito Antigo: O Problema da "Seção VIP"

Métodos anteriores tentavam corrigir isso dizendo: "Ok, vamos manter as palavras raras e importantes no seu formato original, pesado (alta precisão) e apenas encolher as palavras entediantes".

Embora isso mantivesse a precisão da história, criou um novo problema. Imagine um ônibus onde a maioria dos passageiros está sentada em pequenos banquetes dobráveis (os dados pequenos e comprimidos), mas alguns VIPs estão sentados em poltronas gigantes e pesadas (os dados de alta precisão).

  • O Problema: O motorista do ônibus (o chip do computador) tem que mudar de marcha constantemente para lidar com os diferentes assentos. Ele tem que parar, mover as cadeiras pesadas e convertê-las de volta e para frente. Essa troca de marchas atrasa o ônibus, cancelando a velocidade que você ganhou ao encolher os outros passageiros.

O Novo Jeito: MosaicQuant

Os autores deste artigo propõem um novo sistema chamado MosaicQuant. Em vez de manter os VIPs em cadeiras grandes, eles mantêm todos nos mesmos pequenos banquetes dobráveis (4 bits unificado). Mas, eles adicionam um toque inteligente para lidar com as palavras raras e difíceis.

Veja como funciona, usando uma analogia de "Mosaico":

1. A Camada Base (O 4-bit Denso)
Eles pegam o livro inteiro e o encolhem para um tamanho uniforme de 4 bits. Isso captura todas as palavras comuns perfeitamente. No entanto, as palavras raras e complexas ficam um pouco borradas ou distorcidas porque foram forçadas no formato minúsculo.

2. A Camada de "Costura" (O Residual Esparso)
Em vez de dar às palavras raras uma cadeira nova e grande, eles criam um pequeno "remendo" ou "costura" invisível apenas para as partes da história que ficaram borradas.

  • Eles não remendam o livro todo. Eles apenas remendam as páginas específicas onde a distorção é pior.
  • Este remendo também é de 4 bits, então ele cabe no mesmo banquinho minúscio.
  • Como eles apenas remendam alguns pontos específicos (cerca de 10% do livro), é muito leve e não sobrecarrega a mochila.

3. O Motor de "Zíper" (ZipperEngine)
Este é o ingrediente secreto que o torna rápido. No antigo método "VIP", o computador tinha que parar e alternar entre as cadeiras pesadas e os banquetes minúsculos.

  • O ZipperEngine do MosaicQuant age como um mestre alfaiate. Ele pega o livro principal (a base densa) e os pequenos remendos (os resíduos esparsos) e os costura juntos enquanto o ônibus está em movimento.
  • Ele não para para mudar de marcha. Ele processa o texto principal e os remendos exatamente ao mesmo tempo, em um único movimento suave. Isso significa que o chip do computador nunca precisa parar para "converter" dados, mantendo a velocidade alta.

Por que isso importa

Os autores testaram isso em modelos de IA poderosos (como LLaMA e Qwen) e encontraram dois resultados principais:

  1. Precisão: As histórias (saídas da IA) permaneceram quase tão perfeitas quanto os livros pesados originais. Os "remendos" corrigiram as partes borradas tão bem que a IA não perdeu sua inteligência.
  2. Velocidade: Como não tiveram que alternar entre diferentes formatos, a IA rodou até 1,24 vezes mais rápido do que a versão padrão de 16 bits, e muito mais rápido do que outros métodos que tentavam misturar alta e baixa precisão.

Em resumo: O MosaicQuant é como encolher uma biblioteca inteira para um tamanho de bolso, mas em vez de deixar as partes importantes de fora ou torná-las pesadas, ele adiciona pequenos "remendos" leves para corrigir os erros, tudo isso mantendo o processo de leitura fluido e rápido.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →