← Últimos artigos
🤖 AI

Recency/Frequency Adaptive KV Caching for Large Language Model Serving

Este artigo propõe uma estratégia de cache KV adaptativa de recência/frequência que aloca dinamicamente o espaço de cache para mitigar a interferência de carga de trabalho inerente às políticas LRU tradicionais, alcançando melhorias significativas nas taxas de acerto e no tempo para o primeiro token para diversas cargas de trabalho de inferência de LLM.

Autores originais: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

Publicado 2026-06-23
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yang Shen, Meghana Madhyastha, Robert Underwood, Bogdan Nicolae, Randal Burns

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma biblioteca muito ocupada e de alta velocidade, onde um robô bibliotecário superinteligente (o Large Language Model) ajuda as pessoas a escreverem histórias, responderem perguntas e conversarem.

Para trabalhar rápido, esse robô mantém uma "folha de cola" com as informações mais recentes e importantes bem em cima de sua mesa. No mundo da tecnologia, isso é chamado de KV Cache (Cache de Chave-Valor). Isso evita que o robô tenha que reler todo o histórico de uma conversa ou de um documento longo toda vez que precisar escrever a próxima palavra.

No entanto, a mesa do robô é pequena. Ele só consegue guardar tantas páginas de sua folha de cola de cada vez. Quando a mesa fica cheia, o robô tem que jogar algumas páginas fora para abrir espaço para novas.

O Problema: O Erro do "O Último a Entrar é o Primeiro a Sair"

Atualmente, a maioria dos robôs bibliotecários usa uma regra simples chamada LRU (Least Recently Used - Menos Recentemente Utilizado). É como dizer: "A página que não toquei há mais tempo é a que vou jogar fora."

Isso funciona bem se todos estiverem lendo o mesmo livro em ordem. Mas, no mundo real, as coisas são bagunçadas:

  1. O Documento "Quente": Imagine que 50 pessoas diferentes façam perguntas sobre o mesmo artigo específico e longo. O robô continua lendo esse artigo, mas como ele não é a última coisa que ele olhou, a regra LRU pode tirar o artigo da mesa para dar lugar a uma pergunta nova e única. Então, quando a 51ª pessoa perguntar sobre esse mesmo artigo, o robô terá que reler tudo do zero. Lento!
  2. A Conversa "Fresca": Em um chat, você pode ter um histórico longo. O robô precisa se lembrar da última coisa que você disse, mesmo que você já tenha dito isso antes.

A regra antiga (LRU) é rígida demais. Ela não sabe a diferença entre algo que é frequente (um "hotspot") e algo que é apenas recente.

A Solução: A "Mesa Adaptável"

Os autores deste artigo construíram um sistema mais inteligente chamado ARC (Adaptive Replacement Cache - Cache de Substituição Adaptável). Pense nisso como dar ao robô bibliotecário uma mesa com duas zonas especiais que podem mudar de tamanho sobre a hora:

  1. A Zona "Acabou de Ser Olhada" (Recência): Esta contém páginas que o robô tocou há apenas um momento.
  2. A Zona "Super Popular" (Frequência): Esta contém páginas que o robô viu muitas vezes.

Como ele aprende:
O sistema possui uma "prateleira fantasma" (Ghost Cache). Ela não guarda as páginas reais, apenas uma lista do que costumava estar na mesa, mas foi jogado fora.

  • Se o robô joga uma página fora e, logo em seguida, alguém pede por ela novamente, o sistema percebe isso na "prateleira fantasma".
  • Ele percebe: "Ops! Eu joguei fora algo que é, na verdade, popular. Eu deveria ter mantido isso na zona 'Super Popular'."
  • Assim, ele automaticamente encolhe a zona "Acabou de Ser Olhada" e expande a zona "Super Popular" para abrir espaço para o item popular na próxima vez.

É como um termostato inteligente que aprende: "Está frio de manhã, então vou aquecer a sala de estar. Mas à tarde, todos se reúnem na cozinha, então vou deslocar o calor para lá." O sistema constantemente desloca seu espaço de memória entre o que é novo e o que é popular, baseando-se no que os usuários estão realmente fazendo.

O Que Eles Descobriram

Os pesquisadores testaram este novo "Sistema de Mesa Adaptável" contra a antiga "Mesa LRU" usando dois tipos de trabalho:

  1. Perguntas sobre Documentos: Pessoas fazendo perguntas sobre artigos longos (como um programa de perguntas e respostas).
  2. Chats Reais: Simulando conversas reais com um chatbot.

Os Resultados:

  • Melhores Acertos de Memória: O novo sistema manteve as páginas certas na mesa com mais frequência. Nos testes de documentos, ele melhorou a "taxa de acerto" (encontrar a informação sem precisar reler) em até 10,8%.
  • Respostas Mais Rápidas: Como o robô não teve que reler tanto, ele começou a responder mais rápido. O tempo para obter a primeira palavra da resposta caiu até 12,6% nos testes de documentos e cerca de 2% nos testes de chat real.
  • Ele se Adapta: Quando a carga de trabalho mudou (por exemplo, de muitas pessoas perguntando sobre um único documento para muitas pessoas tendo chats diferentes), o sistema redimensionou automaticamente suas zonas para se ajustar à nova situação.

A Conclusão

Este artigo mostra que, ao tornar o gerenciamento de memória do robô flexível — equilibrando o que é novo e o que é popular — podemos tornar os sistemas de IA significativamente mais rápidos e eficientes sem a necessidade de computadores maiores. É uma atualização de software que faz o hardware existente trabalhar de forma mais inteligente, não mais pesada.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →