Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks
Questo articolo presenta una valutazione completa del prompt caching attraverso tre principali provider di LLM per compiti agentici a lungo termine, dimostrando che tecniche di caching strategiche — come l'esclusione dei risultati dinamici degli strumenti e la gestione della struttura del prompt — possono ridurre i costi delle API del 41–80% e migliorare il tempo al primo token (time to first token) del 13–31% rispetto al caching ingenuo dell'intero contesto.
Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo
Immagina di assumere un brillante ma costoso assistente alla ricerca per risolvere un mistero complesso. Questo assistente deve leggere un enorme manuale di istruzioni (il "system prompt") prima di iniziare a lavorare. Mentre lavora, effettua decine di telefonate a diverse fonti, ottiene le risposte e le annota in un taccuino.
Ogni volta che effettua una nuova telefonata, deve rileggere l'intero manuale di istruzioni dalla prima pagina per ricordare cosa fare. Questo richiede molto tempo e costa molto denaro perché l'assistente viene pagato in base alle pagine che legge.
Il "Prompt Caching" è come se dessi a questo assistente un evidenziatore magico. Se il manuale di istruzioni non è cambiato, l'assistente può saltare la rilettura del primo 90% del libro e passare direttamente alla parte nuova dove si trovano i risultati delle telefonate. Questo fa risparmiare tempo e denaro.
Tuttavia, questo articolo pone una domanda spinosa: il magic highlighter funziona sempre, o possiamo rovinarlo?
I ricercatori hanno testato questo scenario con tre grandi aziende di "assistenti" (OpenAI, Anthropic e Google) utilizzando un benchmark chiamato DeepResearch Bench, dove gli agenti compiono ricerche sul web lunghe e multi-step per rispondere a domande difficili. Hanno provato tre modi diversi per usare l'evidenziatore:
- L'approccio "Naive" (Full Context): Evidenziare tutto, inclusi i risultati delle nuove telefonate.
- L'approccio "Sticky Note" (Solo System Prompt): Evidenziare solo il manuale di istruzioni, lasciando i risultati delle nuove telefonate non evidenziati.
- L'approccio "Clean Break" (Escludere i Tool Results): Evidenziare il manuale e le telefonate, ma inserendo un segnale di "stop" speciale dopo ogni nuovo risultato, in modo che l'evidenziatore non prenda accidentalmente gli appunti disordinati della persona successiva.
Cosa hanno scoperto
1. Fa risparmiare un sacco di soldi (La vittoria del "Portafoglio")
Indipendentemente dal metodo utilizzato, il magic highlighter ha fatto risparmiare una grande quantità di denaro. A seconda dell'azienda, hanno risparmiato tra il 41% e l'80% del conto.
- Analogia: È come rendersi conto di non dover comprare una nuova tessera della biblioteca ogni volta che si entra in biblioteca; si usa semplicemente quella che si ha già.
2. La velocità è complicata (Il problema del "Traffico")
Sebbene risparmiare denaro fosse facile, risparmiare tempo era più difficile.
- La sorpresa: A volte, evidenziare tutto (l'approccio Naive) rendeva l'assistente effettivamente più lento.
- Analogia: Immagina un corriere che cerca di memorizzare l'indirizzo di ogni singolo pacco che consegna. Se prova a memorizzare un pacco che viene consegnato una sola volta e mai più, spreca tempo a memorizzarlo. Quando arriva il pacco successivo, deve "disimparare" il vecchio per fare spazio al nuovo. Questo processo di "scrittura nella memoria" lo rallenta.
- Il documento ha scoperto che se evidenzi solo le parti stabili (il manuale di istruzioni) e lasci le parti disordinate e mutevoli (i risultati delle telefonate) da sole, l'assistente rimane veloce.
3. La regola del "Non rompere la cache"
La lezione più importante riguarda dove si traccia la linea.
- Se inserisci informazioni dinamiche e mutevoli (come "Ora corrente: 14:00" o "ID Utente: 123") all'interno del manuale di istruzioni, il tuo magic highlighter si rompe. Il sistema pensa che il manuale sia cambiato, quindi smette di evidenziare e ricomincia a leggere da capo.
- La soluzione: Mantieni il manuale di istruzioni puro e statico. Se devi includere informazioni variabili, mettile alla fine del manuale, come un post-it sull'ultima pagina. In questo modo, il primo 99% del manuale rimane evidenziato e riutilizzabile.
In sintesi
Per le aziende che costruiscono agenti IA impegnati in compiti lunghi e complessi:
- Sì, usate il prompt caching. Ridurrà drasticamente i vostri costi.
- Ma, siate intelligenti. Non attivatelo semplicemente per tutto.
- La migliore strategia: Evidenzia solo la parte stabile (il System Prompt). Lascia che le parti variabili (i tool results) fluiscano liberamente senza essere messe in cache. Questo ti darà il miglior mix di basso costo e alta velocità.
Se provi a mettere in cache le parti mutevoli, potresti finire per pagare per la "scrittura" della cache senza ottenere i benefici della "lettura", il che può effettivamente rallentare il tuo sistema.
Sommerso dagli articoli nel tuo campo?
Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.