← Últimos artigos
💬 NLP

Agentic Plan Caching: Test-Time Memory for Fast and Cost-Efficient LLM Agents

O artigo propõe o Agentic Plan Caching (APC), um novo sistema de memória em tempo de execução que extrai, adapta e reutiliza modelos de planos estruturados de execuções anteriores de agentes para reduzir significativamente o custo e a latência de agentes baseados em LLM, mantendo o desempenho.

Autores originais: Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

Publicado 2026-01-28
📖 4 min de leitura☕ Leitura rápida

Autores originais: Qizheng Zhang, Michael Wornow, Gerry Wan, Kunle Olukotun

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você é um assistente pessoal altamente qualificado, mas muito caro (o Agente de IA), que o ajuda a resolver problemas complexos, como analisar relatórios financeiros ou navegar em um site.

Sempre que você faz uma pergunta a este assistente, ele não fornece apenas uma resposta imediatamente. Em vez disso, ele passa por um processo de duas etapas:

  1. Planejamento: Ele pensa intensamente sobre como resolver o problema (por exemplo, "Primeiro, preciso encontrar os ativos totais, depois os passivos..."). Esta etapa consome muita de sua capacidade cerebral e custa muito dinheiro.
  2. Ação: Ele realmente execpre o trabalho com base nesse plano.

O Problema: Desperdiçando Dinheiro com o "Pensar"

O artigo aponta uma grande ineficiência: mesmo que você faça uma pergunta ligeiramente diferente (por exemplo, "Qual é a razão para a Empresa A?" vs. "Qual é a razão para a Empresa B?"), o assistente frequentemente repensa toda a estratégia do zero. Eles ignoram o fato de que a parte do "pensar" (o plano) é quase idêntica para ambas as tarefas. Eles apenas substituem o nome da empresa.

Os métodos existentes para economizar dinheiro (como o "Cache Semântico") são como um bibliotecário que só se lembra de títulos exatos de livros. Se você pedir por "O Grande Gatsby", ele encontrará. Mas se você pedir por "O livro sobre a luz verde", ele pode não encontrar, ou se você pedir por "O Grande Gatsby (edição de 2024)", ele pode achar que é um livro totalmente diferente. Eles são rígidos demais para essas tarefas complexas e mutáveis.

A Solução: Cache de Plano Agêntico (APC)

Os autores propõem um novo sistema chamado Agentic Plan Caching (APC). Pense nisso como dar ao seu assistente um "Livro de Receitas" em vez de apenas uma memória de conversas passadas.

Veja como funciona, usando uma analogia culinária:

  1. A Extração da "Receita" (O Segredo do Chef):
    Quando seu assistente resolve um problema com sucesso (como calcular uma razão financeira), o sistema não salva apenas a resposta final. Ele observa as etapas que o assistente seguiu e remove os detalhes específicos (como "Costco" ou "2019").

    • Plano Original: "Encontrar os ativos circulantes totais para a Costco em 2019."
    • Receita Salva (Template): "Encontrar os ativos circulantes totais para [Nome da Empresa] em [Ano]."
  2. A Busca por "Palavras-Chave":
    Quando você faz uma nova pergunta, o sistema não tenta corresponder à frase inteira. Em vez disso, um ajudante pequeno e barato (um "modelo leve") extrai a palavra-chave ou o objetivo principal, como "razão de capital de giro". Ele usa essa palavra-chave para procurar a "Receita" correta no livro.

  3. A "Adaptação":
    Se o sistema encontrar uma receita correspondente, ele não chama o assistente caro e superinteligente para pensar novamente. Em vez disso, ele pega a "Receita" salva e um assistente pequeno e barato preenche as lacunas com seus detalhes específicos (por exemplo, trocando "Costco" por "Walmart").

    • Resultado: Você obtém um plano personalizado instantaneamente, sem pagar pela parte cara do "pensar".

Por Que Isso é Melhor

O artigo testou este sistema em cinco tipos diferentes de tarefas do mundo real (como análise financeira e problemas matemáticos) e descobriu que:

  • É Mais Barato: Reduziu o custo de execução desses agentes em cerca de 50%. Você para de pagar pelo "pensar" caro todas as vezes.
  • É Mais Rápido: Reduziu o tempo de espera em cerca de 27%.
  • É Preciso: Não tornou o assistente menos inteligente. Os resultados foram 96,6% tão bons quanto se o assistente tivesse pensado em cada problema do zero.

A Armadilha do "Cold Start" (Início a Frio)

O artigo observa uma limitação: quando você começa a usar este sistema pela primeira vez, o "Livro de Receitas" está vazio. O assistente tem que fazer o pensamento caro do zero para escrever as receitas. Isso é chamado de "Cold Start". No entanto, uma vez que o livro é preenchido com receitas, o sistema torna-se incrivelmente eficiente.

Resumo

Em suma, o Agentic Plan Caching é como ensinar uma IA a parar de reinventar a roda. Em vez de pedir a um gênio para projetar um novo carro toda vez que você precisa ir à loja, você dá a eles um projeto de carro padrão (o plano) e apenas diz para mudar a cor (o contexto). Isso economiza uma quantidade enorme de tempo e dinheiro, mantendo você seguro ao chegar à loja.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →