← Últimos artigos
💬 NLP

Practical Online KV Cache Compaction for LLM Agents: An Empirical Study

Este estudo empírico demonstra que a compactação prática de cache KV online para agentes de LLM pode alcançar reduções significativas de memória e ganhos de throughput ao adiar a compactação até que consultas futuras do agente estejam disponíveis e ao utilizar a evasão de tokens com fontes proxy robustas, em vez de depender de suposições de contexto imediatas ou estáticas.

Autores originais: Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

Publicado 2026-08-04
📖 5 min de leitura🧠 Leitura aprofundada

Autores originais: Yujian Liu, Jiabao Ji, Li An, Rohit Jain, Gungor Polatkan, Siyu Zhu, Shiyu Chang

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está tentando resolver um mistério enorme e de múltiplas etapas. Você tem um detetive brilhante (uma IA) que pode fazer perguntas, verificar pistas e conversar com testemunhas. Mas há um porém: o cérebro do detetive tem um limite de memória rigoroso. Cada vez que ele dá um passo, escreve uma nota ou ouve a história de uma testemunha, essa informação se acumula. Se o caso durar tempo demais, o cérebro do detetive fica tão cheio de notas antigas que ele não consegue mais pensar com clareza ou simplesmente fica sem espaço para escrever novas notas. Este é o mundo dos "Agentes de LLM" — programas de computador inteligentes que resolvem tarefas complexas conversando com ferramentas e com a internet. O "cache KV" é apenas o nome técnico para esse crescente acúmulo de notas no cérebro do detetive. Manter esse monte pequeno o suficiente para caber na memória, sem perder as pistas necessárias para resolver o caso, é o grande desafio que este artigo aborda.

Os pesquisadores da UC Santa Barbara e da LinkedIn decidiram testar um truque inteligente chamado "compactação de cache KV". Pense nisso como um detetive resumindo um longo e entediante relatório policial em um único post-it. Em vez de manter cada palavra de uma conversa passada, a IA tenta comprimi-la em uma versão mais curta que ainda contenha o significado mais importante. Mas aqui está a reviravolta: em uma história normal, você sabe o final antes de começar a resumir. Na vida de um agente de IA, a história está sendo escrita enquanto ela acontece. A IA não sabe qual pergunta fará a seguir, então ela tem que resumir o passado antes de saber o que o futuro precisará. O artigo pergunta: Como você resume um capítulo de uma história quando ainda não leu o próximo capítulo?

A equipe testou duas formas principais de fazer esse resumo. O primeiro método, chamado Evicção de Tokens (TE), é como um editor rigoroso que lê a página atual e decide: "Estes 80% das palavras são entediantes; vamos jogá-las fora e manter apenas os 20% principais". O segundo método, Correspondência de Atenção (AM), é mais como um artista sofisticado que não apenas escolhe as melhores palavras, mas também tenta pintar uma versão mais curta que pareça exatamente com a versão longa original quando lida posteriormente.

Para descobrir a melhor forma de resumir, os pesquisadores tiveram que decidir quando fazê-lo e o que usar como guia. Eles testaram três estratégias de "guia" diferentes:

  1. O Guia "Agora Mesmo": Resumir imediatamente usando apenas as palavras que acabaram de ser ditas.
  2. O Guia "Repetição": Pedir à IA para fingir que está relendo a parte anterior e usar isso para decidir o que é importante.
  3. O Guia "Futuro": Esperar um pouco. Deixar a IA escrever os próximos passos da história e, então, usar essas novas perguntas para decidir o que manter dos passos antigos.

Os resultados foram surpreendentes e práticos. Primeiro, eles descobriram que resumir imediatamente (usando o guia "Agora Mesmo") muitas vezes tornava a IA menos inteligente. Era como resumir o primeiro capítulo de um romance de mistério antes de saber quem é o vilão; você poderia descartar uma pista que acabaria sendo vital mais tarde. No entanto, se eles esperassem apenas um turno — deixando a IA fazer sua próxima pergunta primeiro — o resumo tornava-se muito mais inteligente. Ao usar o guia "Futuro", a IA conseguia ver quais informações eram realmente necessárias e manter apenas isso.

Eles também descobriram que o método mais simples, a Evicção de Tokens (TE), era frequentemente mais confiável do que o sofisticado e complexo Correspondência de Atenção (AM). Mesmo quando o "guia" não era perfeito, a abordagem simples de "manter os melhores 20%" resistia melhor. Acontece que tentar ser inteligente demais com a matemática (como o AM faz) nem sempre ajuda quando você está adivinhando o futuro.

A parte mais emocionante é o que isso significa para velocidade e custo. Quando testaram isso em modelos de IA maiores e mais poderosos, os resultados foram transformadores. Ao comprimir a memória para apenas 20% do seu tamanho original (mantendo 1 de cada 5 tokens), eles não apenas economizaram espaço, mas fizeram a IA rodar 4,2 vezes mais rápido em um modelo e 1,7 vez mais rápido em outro. Como? Porque o "cérebro" da IA estava muito menor, o computador podia rodar quatro vezes mais casos de detetive ao mesmo tempo sem travar.

Curiosamente, o artigo também notou que, quando a memória da IA era comprimida, o detetive às vezes ficava um pouco "ansioso". Ele tendia a fazer mais perguntas e dar mais passos para resolver o mesmo enigma, talvez tentando checar fatos que sentia ter perdido. Isso sugere que, embora a IA ainda chegasse às respostas corretas, seu comportamento mudava ligeiramente para compensar essa memória mais apertada.

Em resumo, este artigo sugere que, se você quiser executar agentes de IA inteligentes e de longa duração sem quebrar o banco ou a memória do computador, você não deve apressar o resumo. Em vez disso, deixe a IA dar alguns passos a mais, dê uma espiada no que ela vai fazer a seguir e, então, comprima o passado. E, surpreendentemente, você não precisa de um algoritmo supercomplexo para fazer isso; uma seleção simples e inteligente das palavras mais importantes funciona tão bem quanto, se não melhor. Essa abordagem pode tornar a execução desses agentes de IA avançados muito mais barata e rápida para todos.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →