← Últimos artigos
🤖 AI

Learning Agent Execution for KV-Cache Management in Agentic Serving

Este artigo introduz o CacheScout, um runtime de cache KV consciente de agentes que aprende transições de execução de agentes online para gerenciar proativamente a expulsão e o pré-carregamento de cache, melhorando significamente as taxas de acerto e reduzindo a latência para o serviço de LLMs multiagentes sem exigir grafos de fluxo de trabalho predefinidos.

Autores originais: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Publicado 2026-08-18
📖 6 min de leitura🧠 Leitura aprofundada

Autores originais: Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

No mundo moderno da inteligência artificial, uma nova forma de construir assistentes inteligentes se consolidou. Em vez de pedir a um único cérebro de computador onisciente para resolver um problema complexo de uma só vez, os desenvolvedores agora dividem as tarefas em uma equipe de trabalhadores digitais especializados. Imagine um planejador de viagens que primeiro pede a um agente para encontrar voos, depois passa o trabalho para outro agente para reservar hotéis e, finalmente, o passa para um terceiro para localizar restaurantes. Cada um desses agentes é um modelo de linguagem de grande escala, um tipo de software que prevê a próxima palavra em uma frase com base em padrões que aprendeu. Para fazer isso, o software deve manter uma vasta quantidade de informações em sua memória de curto prazo, conhecida como cache de chave-valor. Esta memória atua como um espaço de trabalho onde o modelo mantém as regras do jogo, as definições das ferramentas que pode usar e os exemplos de como se comportar. Cada vez que um novo agente entra na conversa, ele traz seu próprio conjunto de instruções e exemplos, criando um grande bloco de dados que o sistema deve processar antes de poder começar a responder à pergunta específica do usuário.

O desafio surge porque essas equipes digitais são dinâmicas. O primeiro agente pode terminar seu trabalho e o sistema pode mudar imediatamente para um agente completamente diferente, ou pode retornar ao primeiro mais tarde. Os sistemas de computação atuais que executam essas equipes de IA gerenciam sua memória de forma reativa. Eles mantêm a informação usada mais recentemente e descartam o conteúdo antigo para abrir espaço para novas solicitações. Isso funciona bem para conversas simples, mas, em uma equipe multiagente, cria uma ineficiência frustrante. O sistema frequentemente descarta as instruções fixas e os exemplos de um agente apenas porque esse agente não falou nos últimos segundos, embora esse mesmo agente provavelmente será chamado novamente no próximo passo. Quando o agente retorna, o sistema tem que reler e reprocessar todas aquelas instruções do zero, desperdiçando tempo e poder de computação. Esse ciclo de descartar e reaprender torna a operação mais lenta, fazendo com que a IA pareça lenta e cara de operar.

Pesquisadores da Universidade da Califórnia, Santa Cruz, e outras instituições desenvolveram uma nova abordagem para resolver este problema, chamando-a de CacheScout. Em vez de simplesmente observar o que aconteceu no passado, este sistema aprende a antecipar o que acontecerá a seguir. Ele trata o fluxo da conversa não como uma série aleatória de eventos, mas como um padrão de transições entre diferentes trabalhadores. Ao observar com que frequência um agente de viagens é seguido por um agente de hotéis, ou como um agente de programação pode mudar para um agente de revisão, o sistema constrói um mapa mental do fluxo de trabalho enquanto executa. Ele não precisa de um roteiro pré-escrito ou de um mapa fornecido pelos desenvolvedores; ele aprende essas conexões sobre a marcha, atualizando seu entendimento com cada solicitação que processa.

O núcleo deste novo sistema é uma camada leve que se situa entre os agentes de IA e o hardware do computador. Quando um agente termina sua tarefa, esta camada analisa o histórico da conversa e prevê qual agente tem maior probabilidade de falar a seguir. Se o sistema estiver confiante sobre o próximo passo, ele toma duas ações específicas para acelerar as coisas. Primeiro, quando precisa limpar dados antigos para abrir espaço, ele se recusa a deletar as instruções do agente que se prevê que retornará em breve, mesmo que esse agente não tenha falado há algum tempo. Ele protege esses blocos valiosos de memória com base em sua importância futura, em vez de seu uso passado. Segundo, enquanto o sistema espera pela próxima solicitação, ele prepara silenciosa e invisivelmente a memória para esse agente previsto. Ele carrega as instruções necessárias para a memória rápida antes mesmo de o usuário solicitá-las, para que, quando o agente finalmente começar a trabalhar, possa iniciar imediatamente, sem atrasos.

Os pesquisadores testaram este sistema em tarefas do mundo real, incluindo planejamento de viagens, resolução de problemas matemáticos e escrita de código de software. Eles descobriram que, ao lembrar dos padrões de comportamento dos agentes, o sistema consegue manter a informação certa na memória com muito mais frequência do que antes. Em seus testes, a taxa de sucesso do sistema em reutilizar a memória existente saltou de dez a dezoito pontos percentuais. Essa melhoria traduziu-se diretamente em velocidade. O tempo que levou para a primeira palavra de uma resposta aparecer caiu em até quarenta e cinco por cento, e o tempo total para completar um único turno da conversa diminuiu quase quarenta por cento. O sistema também lidou com mais solicitações simultâneas, aumentando o número total de tarefas que pode concluir por segundo em até cinquenta e sete por cento.

Crucialmente, os pesquisadores mostraram que esta abordagem funciona mesmo quando o fluxo de trabalho não é fixo. Em muitas aplicações modernas, o próximo passo é decidido pela própria IA em tempo real, o que significa que o caminho pode mudar de forma imprevisível. O novo sistema se adapta a essa fluidez, aprendendo os camções mais comuns conforme eles acontecem e ajustando suas previsões de acordo. Também se mostrou eficaz com modelos de IA muito maiores e mais complexos, mantendo suas vantagens de velocidade mesmo quando os requisitos de memória eram significativamente mais altos. O sistema alcança tudo isso sem desacelerar o computador ou exigir hardware novo e complexo; ele simplesmente adiciona uma pequena dose de inteligência ao processo de gerenciamento de memória, transformando um sistema de armazenamento passivo em um participante ativo que sabe o que está por vir.

As descobertas sugerem que o futuro do serviço eficiente de IA reside em compreender o contexto do trabalho, não apenas os dados em si. Ao reconhecer que um agente de viagens provavelmente será seguido por um agente de hotéis, o sistema deixa de tratar cada momento como um novo começo e passa a ver a conversa como uma jornada contínua. Essa mudança de reagir ao passado para se preparar para o futuro permite que essas equipes digitais trabalhem de forma muito mais rápida e eficiente, removendo os gargalos que têm atrasado a implementação de aplicações complexas de IA. O resultado é um sistema que parece mais responsivo e capaz, apto a lidar com as tarefas intrincadas e de múltiplas etapas que definem a próxima geração de serviços de inteligência artificial.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →