← Últimos artigos
💬 NLP

KARA: Efficient Reasoning LLM Serving via Sliding-Window KV Cache Compression

KARA é um método de compressão de cache KV de janela deslizante que utiliza atenção bidirecional e um módulo Token2Chunk flexível para reter seletivamente o contexto informativo durante a decodificação, reduzindo assim o overhead de memória e melhorando o throughput para modelos de linguagem de raciocínio sem as limitações rígidas das abordagens existentes.

Autores originais: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

Publicado 2026-07-07
📖 4 min de leitura☕ Leitura rápida

Autores originais: Shen Han, Yuyang Wu, Junpu Yu, Olexandr Isayev

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um detetive brilhante (a IA) tentando resolver um mistério muito complexo. Para fazer isso, você precisa anotar cada pista que encontra em um quadro branco gigante (o KV Cache) enquanto pensa passo a passo no problema. Este "Cadeia de Pensamento" (Chain of Thought) é poderoso, mas conforme o mistério se torna mais longo, seu quadro branco enche tão rápido que você fica sem espaço na parede.

Quando a parede está cheia, você tem duas opções ruins:

  1. Parar de resolver porque não consegue escrever mais nada.
  2. Contratar mais detetives (executar mais requisições ao mesmo tempo), mas todos lutam pelo mesmo quadro pequeno, fazendo com que todos se movam mais devagar e fiquem na fila de espera.

Este artigo apresenta um novo sistema chamado Kara para resolver este problema. Veja como ele funciona, usando analogias simples:

O Probleel dos Métodos Antigos

As tentativas anteriores de economizar espaço eram como um zelador desajeitado limpando o quadro branco.

  • A Armadilha do "Limiar" (Threshold): O antigo zelador esperava até que o quadro estivesse 90% cheio, então subitamente apagava um grande pedaço do quadro para abrir espaço. Isso causava um ritmo de "parar e seguir". Às vezes, o quadro enchia tão rápido que o zelador tinha que limpar novamente de imediato, desperdiçando tempo e atrasando a todos.
  • O Erro do "Rígido": O antigo zelador apagava palavras isoladas e aleatórias ou apagava blocos de tamanho fixo (como apagar exatamente as primeiras 10 palavras, depois as próximas 10). Isso frequentemente deletava contextos importantes que não se encaixavam nessas caixas organizadas, fazendo o detetive esquecer pistas cruciais.

A Solução Kara: Uma Janela Deslizante Inteligente

Kara age como um editor inteligente e eficiente que olha apenas para a parte mais recente da história (uma "janela deslizante") para decidir o que manter.

1. A Pontuação de "Conversa de Duas Vias"
Em vez de apenas olhar o quanto um detetive se importa com uma pista, o Kara observa a conversa entre as pistas.

  • Analogia: Imagine que você está lendo um livro. Se o Personagem A menciona um segredo e, mais tarde, o Personagem B reage a esse segredo, eles estão "conversando" entre si. O Kara mede essa atenção de duas vias. Se uma pista no passado é fortemente referenciada pelo pensamento atual, ela recebe uma pontuação alta e é mantida. Se for ignorada, ela é apagada. Isso garante que as pistas mais "informativas" sobrevivam.

2. O Módulo "Token2Chunk" (Clusters Flexíveis)
O Kara percebe que, às vezes, as pistas vêm em grupos, não apenas palavras isoladas.

  • Analogia: Imagine que você tem uma lista de palavras importantes para manter. Os métodos antigos as mantinham como pontos isolados. O Kara olha para dois pontos importantes e diz: "Ei, tudo o que está entre esses dois pontos também é provavelmente importante!" Ele cria um bloco (chunk) de memória flexível. Ele não força o bloco a ter um tamanho fixo; ele estica ou encolhe para se ajustar ao fluxo natural da história, preservando o contexto completo daquela cena específica.

3. O Cronograma "Periódico" (KvLLM)
Para fazer isso funcionar em um escritório movimentado com muitos detetives, os autores construíram uma estrutura chamada KvLLM.

  • Analogia: Em vez de esperar o quadro branco ficar perigosamente cheio antes de limpar, o KvLLM tem um cronograma rigoroso. A cada 100 passos, ele limpa silenciosamente o fundo do quadro (as partes mais antigas do processo de pensamento atual) para alguns detetives selecionados. Isso evita o pânico de "parar e seguir" e mantém o fluxo suave, permitindo que mais detetives trabalhem ao mesmo tempo sem ficarem sem espaço.

Os Resultados

O artigo afirma que com o Kara:

  • Precisão: O detetive resolve os enigmas tão bem quanto se tivesse o quadro branco completo e não recortado (quase 100% de precisão), embora esteja mantendo apenas 20% das notas originais.
  • Velocidade: Como a limpeza é mais suave e eficiente, o escritório pode lidar com 12,75% mais detetives trabalhando ao mesmo tempo sem perder velocidade.

Em resumo, o Kara é uma maneira inteligente e flexível de eliminar o excesso da memória de uma IA sem cortar seu cérebro, permitindo que ela resolva problemas longos e complexos de forma mais rápida e com mais pessoas trabalhando ao mesmo tempo.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →