A Policy-Driven Runtime Layer for Agentic LLM Serving
Este artigo propõe uma nova "camada de tempo de execução de agente" arquitetural que preenche a lacuna entre frameworks multiagente e motores de serviço de LLM para permitir otimizações orientadas por políticas, demonstrando, por meio do sistema CacheSage, que essa abordagem melhora significativamente as taxas de acerto de cache, o tempo até o primeiro token e a vazão em diversas cargas de trabalho multiagente.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está gerenciando um restaurante movimentado e de alto padrão.
A Configuração Atual: Uma Falha de Comunicação
Atualmente, seu restaurante possui duas camadas distintas que não se comunicam bem entre si:
- O Chef de Cozinha (A Estrutura do Agente): Esta pessoa conhece o cardápio, os papéis dos garçons e as instruções específicas para cada mesa. Ela sabe quem está fazendo o pedido e o que eles precisam. No entanto, ela nunca vê o chão da cozinha; não sabe quais panelas estão atualmente no fogão ou quais ingredientes estão acabando.
- A Equipe da Cozinha (O Motor de Atendimento): Esta equipe vê cada pedido que chega. Eles sabem exatamente quantas panelas estão fervendo e quão rápido conseguem cozinhar. Mas não têm ideia de quem são os clientes ou qual é a "história" da refeição. Para eles, cada pedido é apenas uma solicitação genérica.
O Problema: A "Costura" Onde as Coisas Quebram
Como esses dois grupos não compartilham informações, o restaurante toma decisões ineficientes.
- Exemplo: O Chef de Cozinha sabe que a Mesa 4 sempre pede a mesma entrada antes do prato principal. Mas a Equipe da Cozinha não sabe disso. Então, toda vez que a Mesa 4 faz um pedido, a cozinha tem que começar a picar cebolas do zero, mesmo tendo acabado de fazê-lo há cinco minutos para a mesma mesa.
- O artigo chama isso de "costura". Atualmente, se você quiser corrigir isso, precisa corrigir as anotações do Chef de Cozinha ou o fluxo de trabalho da Cozinha com uma regra específica e única. É bagunçado e não escala.
A Solução: A "Camada de Runtime do Agente" (O Novo Gerente de Piso)
Os autores propõem construir uma terceira camada exatamente entre o Chef e a Cozinha: um Gerente de Piso.
Este Gerente de Piso tem um trabalho especial. Ele escuta o Chef (para conhecer os papéis e identidades) e observa a Cozinha (para ver os eventos de cozimento). Ele usa esse conhecimento combinado para tomar decisões inteligentes usando quatro ferramentas simples:
- Observar: "Vejo um novo pedido chegando do garçom 'Planejador'."
- Avaliar: "Com base no histórico, este pedido do 'Planejador' é muito importante e provavelmente será seguido por um pedido do 'Codificador'. Dê a ele alta prioridade."
- Prever: "Aposto que o próximo pedido será do garçom 'Codificador'. Vamos preparar os ingredientes deles agora."
- Agir: "Vá em frente e pré-aqueça o fogão para o 'Codificador' para que não haja atraso."
Este Gerente de Piso atua como um tradutor universal. Qualquer nova regra (como "seja justo com todas as mesas" ou "economize energia") pode ser conectada a este gerente sem quebrar o Chef ou a Cozinha.
O Estudo de Caso: "CacheSage" (A Despensa Inteligente)
Para provar que isso funciona, os autores construíram um Gerente de Piso específico chamado CacheSage para gerenciar a "despensa" (a memória do computador, ou cache KV).
- O Jeito Antigo: A cozinha joga fora ingredientes (memória) com base em há quanto tempo foram usados. Se o garçom "Planejador" voltar após uma pausa, a cozinha tem que picar tudo novamente porque os ingredientes foram descartados.
- O Jeito CacheSage: O Gerente de Piso aprende os padrões. Eles notam que "Planejador" quase sempre leva a "Codificador".
- Quando o "Planejador" termina, o Gerente de Piso diz: "Eu prevejo que 'Codificador' é o próximo."
- Eles mantêm os ingredientes do "Planejador" seguros (para que não sejam jogados fora) e até começam a preparar os ingredientes do "Codificador" antes mesmo do pedido chegar.
Os Resultados
Quando testaram isso em cinco diferentes cenários de "restaurante" do mundo real (tarefas complexas de IA):
- Menos Desperdício: Eles mantiveram os ingredientes certos na despensa de 13% a 37% mais frequentemente do que antes.
- Atendimento Mais Rápido: Os clientes receberam sua comida de 12% a 29% mais rápido porque a cozinha não precisou começar do zero.
- Mais Clientes: O restaurante pôde atender de 6% a 14% mais mesas por hora.
Em Resumo
O artigo argumenta que, para fazer os agentes de IA funcionarem com eficiência, não podemos apenas ajustar a camada superior (a lógica) ou a camada inferior (o hardware). Precisamos de um "gerente intermediário" dedicado que entenda tanto a identidade dos agentes quanto os eventos do motor, usando um conjunto simples de quatro regras para tornar todo o sistema mais inteligente e rápido.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.