Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
Este artigo apresenta uma avaliação abrangente do cache de prompts em três grandes provedores de LLM para tarefas agentes de longo horizonte, demonstrando que técnicas estratégicas de cache — como excluir resultados de ferramentas dinâmicas e gerenciar a estrutura do prompt — podem reduzir os custos de API em 41–80% e melhorar o tempo para o primeiro token em 13–31% em comparação ao cache de contexto total ingênuo.
Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo
Imagine que você está contratando um assistente de pesquisa brilhante, mas caro, para resolver um mistério complexo. Esse assistente precisa ler um manual de instruções massivo (o "prompt do sistema") antes de começar a trabalhar. Enquanto trabalha, ele faz dezenas de chamadas telefônicas para diferentes fontes, obtém respostas e as anota em um caderno.
Cada vez que ele faz uma nova chamada telefônica, tem que reler o manual de instruções inteiro desde a primeira página para lembrar o que fazer. Isso leva muito tempo e custa muito dinheiro porque o assistente cobra por página lida.
"Prompt Caching" (Cache de Prompt) é como dar a esse assistente um marca-texto mágico. Se o manual de instruções não tiver mudado, o assistente pode pular a releitura dos primeiros 90% do livro e ir direto para a parte nova onde estão os resultados das chamadas telefônicas. Isso economiza tempo e dinheiro.
No entanto, este artigo faz uma pergunta intrigante: O marca-texto mágico sempre funciona, ou podemos estragá-lo?
Os pesquisadores testaram isso com três grandes empresas de "assistentes" (OpenAI, Anthropic e Google), usando um benchmark chamado DeepResearch Bench, onde agentes realizam buscas na web de várias etapas para responder a perguntas difíceies. Eles tentaram três maneiras diferentes de usar o marca-texto:
- A Abordagem "Ingênua" (Contexto Total): Destacar tudo, incluindo os novos resultados das chamadas telefônicas.
- A Abordagem "Post-it" (Apenas o Prompt do Sistema): Destacar apenas o manual de instruções, mas deixando os novos resultados das chamadas telefônicas sem destaque.
- A Abordagem "Quebra Limpa" (Excluir Resultados de Ferramentas): Destacar o manual e as chamadas telefônicas, mas colocando uma placa de "pare" especial após cada novo resultado para que o marca-texto não acabe pegando as notas bagunçadas da próxima pessoa.
O Que Eles Descobriram
1. Economiza Muito Dinheiro (A Vitória da "Carteira")
Não importa qual método usassem, o marca-texto mágico economizou uma enorme quantia de dinheiro. Dependendo da empresa, economizaram entre 41% e 80% na conta.
- Analogia: É como perceber que você não precisa comprar um novo cartão da biblioteca toda vez que entra nela; você apenas usa o que já tem.
2. Velocidade é Complicada (O Problema do "Trânsito")
Embora economizar dinheiro fosse fácil, economizar tempo foi mais difícil.
- A Surpresa: Às vezes, destacar tudo (a abordagem Ingênua) na verdade tornou o assistente mais lento.
- Analogia: Imagine um entregador que tenta memorizar o endereço de cada pacote que entrega. Se ele tentar memorizar um pacote que está sendo entregue apenas uma vez e nunca mais, ele perde tempo memorizando-o. Quando o próximo pacote chega, ele tem que "desmemorizar" o antigo para abrir espaço para o novo. Esse processo de "escrever para a memória" os torna mais lentos.
- O artigo descobriu que, se você destacar apenas as partes estáveis (o manual de instruções) e deixar as partes bagunçadas e mutáveis (os resultados das chamadas telefônicas) sozinhas, o assistente permanece rápido.
3. A Regra do "Não Quebre o Cache"
A maior lição é sobre onde você traça a linha.
- Se você colocar informações dinâmicas e mutáveis (como "Hora Atual: 14:00" ou "ID do Usuário: 123") dentro do manual de instruções, o marca-texto mágico quebra. O sistema pensa que o manual mudou, então ele para de destacar e começa a ler do zero.
- A Solução: Mantenha o manual de instruções puro e estático. Se você precisa incluir informações mutáveis, coloque-as no final do manual, como um post-it na última página. Dessa forma, os primeiros 99% do manual ainda estarão destacados e serão reutilizáveis.
A Conclusão
Para empresas que constroem agentes de IA que realizam tarefas longas e complexas:
- Sim, use o cache de prompt. Isso reduzirá drasticamente seus custos.
- Mas seja inteligente sobre isso. Não apenas o ligue para tudo.
- A Melhor Estratégia: Faça o cache apenas da "parte estável" (o Prompt do Sistema). Deixe as partes mutáveis (resultados de ferramentas) fluírem livremente sem serem colocadas em cache. Isso oferece a melhor mistura de baixo custo e alta velocidade.
Se você tentar fazer o cache das partes mutáveis, pode acabar pagando pela "escrita" do cache sem obter os benefícios da "leitura", o que pode até deixar seu sistema mais lento.
Afogado em artigos na sua área?
Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.