← Últimos artigos
🤖 machine learning

Sparse Prefix Caching for Hybrid and Recurrent LLM Serving

Este artigo apresenta o cache de prefixo esparsos para atendimento de LLMs híbridos e recorrentes, um método que otimiza a latência ao armazenar estrategicamente estados recorrentes exatos em posições de checkpoint esparsas para retomar o cálculo a partir da correspondência mais profunda, superando assim as heurísticas de cache denso existentes, ao mesmo tempo que preserva saídas exatas e não requer alterações no kernel.

Autores originais: Mikhail Shirokikh, Sergey Nikolenko

Publicado 2026-05-08
📖 4 min de leitura☕ Leitura rápida

Autores originais: Mikhail Shirokikh, Sergey Nikolenko

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um chef preparando uma refeição complexa, com vários pratos, para uma série de convidados. No mundo dos Modelos de Linguagem de Grande Escala (LLMs), a "refeição" é gerar uma resposta, e os "ingredientes" são as palavras (tokens) que o modelo já processou.

O Jeito Antigo: A Cozinha "Tudo ou Nada"

Tradicionalmente, quando um novo convidado (um novo pedido) chega, o chef verifica se ele pediu algo semelhante ao último convidado.

  • Se ele pediu a mesma entrada exata: O chef reutiliza o prato inteiro.
  • Se ele pediu algo ligeiramente diferente: O chef joga fora todo o prato de entrada e começa a cozinhar do zero, mesmo que 90% dos primeiros ingredientes fossem idênticos.

Em termos técnicos, isso é chamado de cache denso. O sistema salva uma cópia de cada passo individual (cada token) para reutilizar depois. Isso funciona muito bem para modelos padrão, mas para um novo tipo de modelo chamado Modelo Híbrido ou Recorrente, essa abordagem é como tentar carregar uma biblioteca de livros apenas para ler uma frase. É pesado demais e ocupa muita memória.

A Nova Ideia: A Estratégia de "Checkpoint"

Este artigo propõe uma maneira mais inteligente de lidar com esses modelos específicos. Pense na memória do modelo não como uma biblioteca de cada palavra individual, mas como um estado de espírito.

Imagine que você está lendo um romance muito longo.

  1. O Jeito Antigo: Você mantém um post-it em cada página individual para poder voltar instantaneamente. (Demasiados post-its!).
  2. O Jeito Novo (Cache de Prefixo Esparsos): Você coloca post-its apenas na Página 1, Página 100, Página 200, etc.

Se um novo leitor quiser continuar a história a partir da Página 150:

  • Você não joga fora o livro inteiro.
  • Você encontra o último post-it (Página 100).
  • Você relê rapidamente a história da Página 101 à 149 para retornar ao estado atual.
  • Então, você continua a partir da Página 150.

Como o modelo é "recorrente" (ele evolui seu estado passo a passo), ele não precisa de toda a história, apenas do estado em um ponto específico. Este artigo chama esses post-its de checkpoints.

O Problema: Onde Colocar os Post-its?

Agora vem a parte complicada. Você tem um orçamento limitado para post-its (memória). Onde você deve colocá-los para economizar o máximo de tempo?

  • A Estratégia "Equilibrada": Coloque os notas uniformemente (a cada 100 páginas). Isso é seguro, mas talvez não seja o mais rápido.
  • A Estratégia "Inteligente" (O que este artigo faz): Observe os hábitos dos seus leitores.
    • Se a maioria das pessoas parar de ler por volta da Página 50, você coloca uma nota ali.
    • Se as pessoas geralmente leem até o fim, você coloca notas perto do final.
    • Se as pessoas frequentemente param na Página 200, você coloca uma nota ali.

Os autores criaram uma fórmula matemática (um "Programa Dinâmico") que age como um bibliotecário superinteligente. Ele analisa pedidos passados para prever onde futuros leitores provavelmente pararão. Em seguida, ele coloca os post-its exatamente onde serão mais úteis, em vez de espalhá-los uniformemente.

Os Resultados: Economizando Tempo e Memória

O artigo testou isso em cenários do mundo real, como:

  • QuALITY: Um documento longo onde as pessoas fazem perguntas diferentes sobre o mesmo texto.
  • Prompts de Sistema: Um longo conjunto de instruções seguido por muitas perguntas diferentes de usuários.

O que eles descobriram:

  1. Menos Memória, Mesma Velocidade: Ao colocar checkpoints de forma "inteligente" com base em onde as pessoas realmente param, eles puderam usar menos post-its (checkpoints) do que o método padrão "espaçado uniformemente", enquanto ainda economizavam a mesma quantidade de tempo de cozimento.
  2. Grandes Vitórias para Orçamentos Curtos: As maiores melhorias ocorreram quando eles tinham muito poucos post-its para sobrar. Nessas situações apertadas, a colocação "inteligente" foi muito melhor do que apenas chutar ou espaçá-los uniformemente.
  3. Resultados Exatos: Ao contrário de algumas atalhos que chutam a resposta, este método garante que a saída seja 100% idêntica a fazer o trabalho do zero. Apenas faz isso mais rápido, pulando as partes que já conhece.

A Conclusão

Este artigo apresenta uma maneira de tornar modelos de IA que usam memória "recorrente" mais eficientes. Em vez de salvar cada passo individual ou não salvar nada, ele salva alguns "instantâneos" estratégicos do cérebro do modelo. Ao usar matemática para descobrir exatamente onde salvar esses instantâneos com base em como as pessoas realmente usam a IA, o sistema pode rodar mais rápido e usar menos memória, especialmente quando muitos usuários fazem perguntas semelhantes sobre o mesmo documento longo.

É como ter um GPS que não mostra apenas todo o mapa, mas sabe exatamente quais curvas você provavelmente fará, para que ele salve apenas as direções para essas curvas específicas.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →