← Últimos artigos
🤖 machine learning

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR é um método implantável de quantização de cache KV de 2 bits que aproveita a estimativa offline de covariância espectral para derivar rotações alinhadas à atenção e limites de corte, permitindo precisão quase sem perdas em tarefas de raciocínio de contexto longo enquanto reduz significativamente o uso de memória e melhora a vazão de inferência em frameworks modernos de serviço de LLM.

Autores originais: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

Publicado 2026-05-19
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

O Grande Problema: O "Acumulador de Memória"

Imagine um modelo de linguagem grande (LLM) como um bibliotecário brilhante, mas esquecido. Quando você faz uma pergunta longa, ele precisa manter uma lista contínua de tudo o que você disse até agora (o "KV Cache") para entender o contexto.

À medida que a conversa fica mais longa (até 32.000 palavras ou mais), essa lista torna-se massiva. Para armazená-la, o bibliotecário precisa de uma quantidade enorme de memória cara (como um armazém gigante e de alta velocidade). Se o armazém encher, o bibliotecário tem que parar de trabalhar ou ficar drasticamente mais lento.

O objetivo deste artigo é encolher esse armazém em 8 vezes sem que o bibliotecário esqueça nada importante. Eles querem comprimir as anotações de "alta definição" (BF16) para o tamanho de um "rascunho minúsculo" (2 bits).

O Jeito Antigo: O "Embaralhamento Hadamard"

Anteriormente, os pesquisadores tentavam encolher essas anotações simplesmente embaralhando as palavras ao redor. Eles usavam um truque matemático chamado rotação Hadamard.

  • A Analogia: Imagine que você tem um quarto bagunçado com alguns sofás gigantes e estranhos (outliers) e muitas cadeiras pequenas. Você não consegue encaixá-los todos em uma caixa pequena. O método antigo era pegar um misturador gigante e girar o quarto. Isso espalha os sofás gigantes para que pareçam algumas cadeiras ligeiramente maiores, facilitando o empacotamento.
  • A Falha: Essa mistura é "cega". Ela não sabe quais partes do quarto são realmente importantes para o trabalho do bibliotecário. Quando você comprime tudo para um rascunho minúsculo de 2 bits, essa mistura cega desfoca acidentalmente os detalhes mais críticos, fazendo com que o bibliotecário comece a alucinar ou dar respostas erradas. É como tentar empacotar um vaso delicado e uma pedra juntos; se você apenas sacudir a caixa, o vaso quebra.

A Nova Solução: OSCAR (O "Arquiteto Inteligente")

Os autores propõem o OSCAR (Rotação Offline Consciente da Covariância Espectral). Em vez de sacudir o quarto cegamente, o OSCAR age como um arquiteto inteligente que estuda exatamente como o bibliotecário trabalha antes que o empacotamento comece.

1. A "Calibração Offline" (A Fase de Estudo)

Antes do bibliotecário começar a atender clientes, o OSCAR pega uma pequena amostra de conversas e pergunta: "Quais partes da memória o bibliotecário realmente usa para tomar decisões?"

  • A Analogia: Imagine que o bibliotecário precisa escolher um livro com base em uma pergunta específica. O OSCAR percebe que o bibliotecário se importa profundamente com a cor da capa do livro (a "Query"), mas não se importa muito com a espessura das páginas (o "Value").
  • O Resultado: O OSCAR cria um mapa personalizado (uma matriz de rotação) que alinha o armazenamento de memória com essas necessidades específicas. Ele garante que as partes das quais o bibliotecário mais se importa sejam preservadas com alta precisão, enquanto as partes menos importantes são comprimidas de forma mais agressiva.

2. O "Empacotamento Inteligente" (A Rotação)

O OSCAR usa esse mapa para rotacionar os dados em uma forma perfeita para compressão.

  • A Analogia: Em vez de apenas girar o quarto aleatoriamente, o OSCAR rearranja os móveis para que todos os itens frágeis fiquem alinhados de uma maneira que caiba perfeitamente na caixa pequena. Ele separa as "direções importantes" do "ruído".
  • A Magia: Ao fazer isso, eles conseguem comprimir os dados para 2 bits (extremamente pequenos) e ainda manter a precisão do bibliotecário quase idêntica à versão original de alta definição.

3. O "Armazém Híbrido" (O Sistema)

O OSCAR não comprime tudo de uma vez. Ele usa um sistema híbrido inteligente:

  • Os Tokens "Sink" e "Recentes": As primeiras palavras (o início da história) e as últimas palavras (o que você acabou de dizer) são mantidas em alta definição. Estes são os âncoras mais críticas.
  • Os Tokens "História": A parte do meio da conversa (a longa história) é a parte que é comprimida no minúsculo rascunho de 2 bits usando a rotação inteligente do OSCAR.

Por Que Isso Importa (Os Resultados)

O artigo testou isso em alguns dos modelos de IA mais inteligentes disponíveis (como Qwen e GLM) com contextos muito longos.

  • Precisão: Quando outros métodos tentaram comprimir para 2 bits, os modelos basicamente esqueceram como pensar (a precisão caiu para perto de zero). O OSCAR manteve os modelos quase tão inteligentes quanto a versão original de alta definição.
  • Velocidade e Memória: Como os dados são 8 vezes menores, o armazém cabe 8 vezes mais conversas. Isso significa que o sistema pode lidar com 7 vezes mais usuários ao mesmo tempo sem ficar sem memória.
  • Pronto para o Mundo Real: Os autores não apenas escreveram uma teoria; eles construíram um sistema funcional que se encaixa em servidores de IA modernos (SGLang e vLLM). É como se eles não tivessem apenas projetado uma caixa melhor; eles construíram um novo caminhão que usa essa caixa e dirige mais rápido.

Resumo

O OSCAR é um método que impede que os modelos de IA "esqueçam" quando tentam economizar memória. Em vez de espremer os dados cegamente, ele primeiro estuda o que a IA realmente se importa, reorganiza os dados para atender a essas necessidades e, em seguida, os comprime. Isso permite que a IA lembre de quantidades massivas de informações (como um livro inteiro) usando uma fração minúscula da memória, sem perder sua inteligência.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →