← Últimos artigos
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

Este artigo apresenta o Cache-Aware Prompt Compression (CAPC), uma estratégia que combina compressão agnóstica à consulta com controle de cache explícito e limites de preservação de nível para superar as limitações de métodos sensíveis à consulta, alcançando reduções de custo significativas (até 90%) enquanto mantém a qualidade em diversas cargas de trabalho de LLM de produção.

Autores originais: Yan Song

Publicado 2026-07-20
📖 3 min de leitura☕ Leitura rápida

Autores originais: Yan Song

Artigo original sob licença CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta é uma explicação gerada por IA do artigo abaixo. Não foi escrita nem endossada pelos autores. Para precisão técnica, consulte o artigo original. Ler aviso legal completo

Imagine que você está administrando uma biblioteca enorme e superinteligente onde um bibliotecário muito caro (uma IA) ajuda você a encontrar respostas. Para economizar dinheiro, a biblioteca tem dois truques especiais. Primeiro, há um "Lounge VIP" (cache): se você perguntar ao bibliotecário sobre o mesmo capítulo de um livro repetidamente, ele não precisa reler o capítulo inteiro nas estantes da biblioteca; ele apenas dá uma olhada em suas notas, o que é muito mais barato. Segundo, há um "Resumidor" (compressão): em vez de entregar ao bibliotecário um romance de 500 páginas, você entrega a ele um resumo de 50 páginas, o que também é mais barato para processar.

Por muito tempo, as pessoas pensaram que esses dois truques eram melhores usados separadamente. Você usaria o Lounge VIP para livros grandes e entediantes, ou usaria o Resumidor para perguntas curtas e complexas. Mas aqui está o problema: o Resumidor geralmente muda a história ligeiramente cada vez que você faz uma nova pergunta para que ela se ajuste melhor. O problema é que o VIP Lounge é um rigoroso cumpridor de regras. Se a história mudar mesmo que um pouquinho, o bibliotecário diz: "Desculpe, esse é um livro novo!" e joga fora as notas, forçando você a pagar o preço total para ler tudo de novo. Este artigo faz uma pergunta simples: Podemos usar os dois truques ao mesmo tempo sem quebrar as regras?

Os pesquisadores da PayPal decidiram testar isso em um sistema de IA do mundo real chamado Sonnet 4.6. Eles descobriram que o VIP Lounge não é tão perfeito quanto todos pensavam. Ele possui uma "zona quente" para notas curtas e uma "zona persistente" para notas longas, e se você for esperto demais com seus resumos, acaba expulsando suas notas da zona quente cara. Eles descobriram que a antiga maneira de fazer as coisas — mudar o resumo para cada pergunta individual — na verdade desperdiça dinheiro porque impede o bibliotecário de usar as notas baratas.

Para corrigir isso, eles inventaram uma nova estratégia chamada CAPC (Compressão de Prompt Consciente de Cache). Pense nisso desta forma: em vez de reescrever a história para cada pergunta, eles criam um resumo comprimido perfeito das partes entediantes uma única vez e o trancam no VIP Lounge. Então, para cada nova pergunta, eles apenas adicionam a pergunta específica àquele resumo trancado, sem alterar o resumo em si. É como ter um roteiro pré-escrito que nunca muda, para que o bibliotecário possa reutilizar suas notas baratas todas as vezes.

Os resultados foram surpreendentes. Em testes com 16 tipos diferentes de documentos, este novo método foi a opção mais barata em todas as vezes, economizando cerca de 49% em comparação ao uso apenas do VIP Lounge e 64% em comparação ao antigo método de "mudar o resumo". Eles também testaram em tarefas do mundo real, como um robô que usa ferramentas para consertar códigos de computador e um sistema que pesquisa através de enormes grafos de conhecimento. Em um caso, eles economizaram mais de 50% nos custos sem perder nenhuma qualidade. Em outro, provaram que o antigo método de "mudar o resumo" custou, na verdade, 40% mais do que não fazer nada, porque elebrando o cache constantemente. O artigo conclui que, ao sermos inteligentes sobre quando comprimir e o que armazenar em cache, podemos tornar a IA muito mais barata de usar sem torná-la mais burra.

Afogado em artigos na sua área?

Receba digests diários dos artigos mais recentes que correspondam às suas palavras-chave de pesquisa — com resumos técnicos, no seu idioma.

Experimentar Digest →