← Nieuwste papers
💬 NLP

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

Dit artikel presenteert een uitgebreide evaluatie van prompt caching bij drie grote LLM-providers voor langdurige agentische taken, waarbij wordt aangetoond dat strategische cachingtechnieken—zoals het uitsluiten van dynamische toolresultaten en het beheren van de promptstructuur—de API-kosten met 41–80% kunnen verlagen en de tijd tot het eerste token met 13–31% kunnen verbeteren in vergelijking met naïeve full-context caching.

Oorspronkelijke auteurs: Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

Gepubliceerd 2026-02-03
📖 4 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een briljante maar dure research assistent inhuurt om een complex mysterie op te lossen. Deze assistent moet een enorme instructiehandleiding (de "system prompt") lezen voordat hij aan het werk gaat. Terwijl hij werkt, maakt hij tientallen telefoontjes naar verschillende bronnen, krijgt antwoorden en schrijdt deze op in een notitieblok.

Elke keer dat hij een nieuw telefoontje pleegt, moet hij de hele instructiehandleiding vanaf de eerste pagina opnieuw lezen om te onthouden wat hij moet doen. Dit kost veel tijd en veel geld, omdat de assistent rekent per pagina die hij leest.

"Prompt Caching" is alsof je die assistent een magische markeerstift geeft. Als de instructiehandleiding niet is veranderd, kan de assistent de eerste 90% van het boek overslaan en direct naar het nieuwe deel springen waar de resultaten van de telefoontjes staan. Dit bespaart tijd en geld.

Echter, dit artikel stelt een lastige vraag: Werkt die magische markeerstift altijd, of kunnen we het verpesten?

De onderzoekers testten dit bij drie grote "assistent"-bedrijven (OpenAI, Anthropic en Google) met behulp van een benchmark genaamd DeepResearch Bench, waarbij agenten lange, meerstaps webzoekopdrachten uitvoeren om moeilijke vragen te beantwoorden. Ze probeerden drie verschillende manieren om de markeerstift te gebruiken:

  1. De "Naïeve" Aanpak (Full Context): Alles markeren, inclusief de nieuwe resultaten van de telefoontjes.
  2. De "Sticky Note" Aanpak (System Prompt Only): Alleen de instructiehandleiding markeren, maar de nieuwe resultaten van de telefoontjes ongemarkeerd laten.
  3. De "Clean Break" Aanpak (Exclude Tool Results): De handleiding en de telefoontjes markeren, maar een speciaal "stop"-bord plaatsen na elk nieuw resultaat, zodat de markeerstift niet per ongeluk de slordige aantekeningen van de volgende persoon oppakt.

Wat ze vonden

1. Het bespaart veel geld (De "Wallet" Win)
Ongeacht welke methode ze gebruikten, de magische markeerstift bespaarde een enorme hoeveelheid geld. Afhankelijk van het bedrijf bespaarden ze tussen de 41% en 80% op de rekening.

  • Analogie: Het is alsof je beseft dat je niet elke keer een nieuwe bibliotheekkaart hoeft te kopen als je de bibliotheek binnenloopt; je gebruikt gewoon de kaart die je al hebt.

2. Snelheid is lastig (Het "Verkeer" Probleem)
Hoewel het besparen van geld makkelijk was, was het besparen van tijd moeilijker.

  • De Verrassing: Soms maakte het markeren van alles (de Naïeve aanpak) de assistent zelfs langzamer.
  • Analogie: Stel je een bezorger voor die probeert het adres van elk pakketje dat hij bezorgt te onthouden. Als hij probeert een pakketje te onthouden dat slechts één keer wordt bezorgd en nooit meer terugkomt, verspilt hij tijd aan het onthouden ervan. Wanneer het volgende pakketje komt, moet hij het oude "ontleren" om ruimte te maken voor het nieuwe. Dit "schrijven naar het geheugen" vertraagt hem.
  • Het artikel vond dat als je alleen de stabiele delen (de instructiehandleiding) markeert en de rommelige, veranderende delen (de resultaten van de telefoontjes) ongemarkeerd laat, de assistent snel blijft.

3. De "Breek de Cache Niet" Regel
De belangrijkste les gaat over waar je de grens trekt.

  • Als je dynamische, veranderende informatie (zoals "Huidige tijd: 14:00 uur" of "Gebruikers-ID: 123") in de instructiehandleiding plaatst, breekt de magische markeerstift. Het systeem denkt dat de handleiding is veranderd, waardoor het stopt met markeren en vanaf het begin opnieuw begint met lezen.
  • De Oplossing: Houd de instructiehandleiding puur en statisch. Als je toch veranderende informatie wilt opnemen, plaats deze dan helemaal aan het einde van de handleiding, als een briefje op de laatste pagina. Op die manier blijft de eerste 99% van de handleiding gemarkeerd en herbruikbaar.

De Conclusie

Voor bedrijven die AI-agenten bouwen die lange, complexe taken uitvoeren:

  • Ja, gebruik prompt caching. Het zal je kosten drastisch verlagen.
  • Maar, wees slim. Zet het niet zomaar voor alles aan.
  • De Beste Strategie: Cache alleen de stabiele "instructiehandleiding" (System Prompt). Laat de veranderende delen (tool results) vrij doorstromen zonder te worden gecached. Dit geeft je de beste mix van lage kosten en hoge snelheid.

Als je probeert de veranderende delen te cachen, kun je er uiteindelijk voor betalen dat je de "schrijfactie" van de cache betaalt zonder de "leesvoordelen" te krijgen, wat je systeem zelfs kan vertragen.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →