← Nieuwste papers
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

Dit artikel introduceert Cache-Aware Prompt Compression (CAPC), een strategie die query-agnostische compressie combineert met expliciete cachecontrole en tier-preserverende grenzen om de beperkingen van query-bewuste methoden te overwinnen, waarbij aanzienlijke kostenreducties (tot 90%) worden behaald terwijl de kwaliteit behouden blijft over diverse productie LLM-workloads.

Oorspronkelijke auteurs: Yan Song

Gepubliceerd 2026-07-20
📖 3 min leestijd☕ Koffiepauze-leesvoer

Oorspronkelijke auteurs: Yan Song

Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer

Stel je voor dat je een enorme, superintelligente bibliotheek runt waar een zeer dure bibliothecaris (een AI) je helpt antwoorden te vinden. Om geld te besparen, heeft de bibliotheek twee speciale trucjes. Ten eerste is er een "VIP-lounge" (caching): als je de bibliothecaris keer op keer naar hetzelfde hoofdstuk van een boek vraagt, hoeft hij niet het hele hoofdstuk opnieuw van de bibliotheekplanken te lezen; hij kijkt alleen even in zijn aantekeningen, wat veel goedkoper is. Ten tweede is er een "Samenvatter" (compressie): in plaats van de bibliothecaris een roman van 500 pagina's te geven, geef je hem een samenvatting van 50 pagina's, wat ook goedkoper is om te verwerken.

Lama tijd dachten mensen dat deze twee trucjes het beste apart gebruikt konden worden. Je zou ofwel de VIP-lounge gebruiken voor grote, saaie boeken, of de Samenvatter voor korte, lastige vragen. Maar hier is de crux: de Samenvatter verandert het verhaal meestal telkens een klein beetje om het beter te laten passen bij de nieuwe vraag. Het probleem is dat de VIP-lounge een strikte regelvolger is. Als het verhaal ook maar een klein beetje verandert, zegt de bibliothecaris: "Sorry, dat is een nieuw boek!" en gooit hij de aantekeningen weg, waardoor je de volle prijs moet betalen om het hele boek opnieuw te lezen. Deze paper stelt een simpele vraag: kunnen we beide trucjes tegelijkertijd gebruiken zonder de regels te breken?

De onderzoekers van PayPal besloten dit te testen op een echt AI-systeem genaamd Sonnet 4.6. Ze ontdekten dat de VIP-lounge niet zo perfect is als iedereen dacht. Het heeft een "hot zone" voor korte aantekeningen en een "persistente zone" voor lange aantekeningen, en als je te slim uit de hoek komt met je samenvattingen, schop je je aantekeningen per ongeluk uit de dure hot zone. Ze ontdekten dat de oude manier van doen — de samenvatting voor elke vraag aanpassen — eigenlijk geld verspilt omdat het de bibliothecaris ervan weerhoudt om de goedkope aantekeningen te gebruiken.

Om dit op te lossen, hebben ze een nieuwe strategie uitgevonden genaamd CAPC (Cache-Aware Prompt Compression). Denk hierbij aan het volgende: in plaats van het verhaal voor elke vraag te herschrijven, maken ze één keer een perfecte, gecomprimeerde samenvatting van de saaie onderdelen en sluiten deze op in de VIP-lounge. Vervolgens voegen ze voor elke nieuwe vraag simpelweg de specifieke vraag toe aan die vergrendelde samenvatting, zonder de samenvatting zelf te veranderen. Het is also kind van een vooraf geschreven script dat nooit verandert, zodat de bibliothecaris de goedkope aantekeningen elke keer opnieuw kan gebruiken.

De resultaten waren verrassend. In tests met 16 verschillende soorten documenten was deze nieuwe methode elke keer de goedkoopste optie; het bespaarde ongeveer 49% vergeleken met alleen de VIP-lounge gebruiken en 64% vergeleken met de oude "verander-de-samenvatting"-methode. Ze testten het ook op echte taken, zoals een robot die gereedschap gebruikt om computercode te repareren en een systeem dat door enorme kennisgrafen zoekt. In één geval bespaarden ze meer dan 50% op de kosten zonder kwaliteitsverlies. In een ander geval bewezen ze dat de oude "verander-de-samenvatting"-methode zelfs 40% meer kostte dan helemaal niets doen, omdat het de cache constant verbrak. De paper concludeert dat door slim te zijn over wanneer we comprimeren en wat we cachen, we AI veel goedkoper kunnen maken zonder het dommer te maken.

Verdrinkt u in papers in uw vakgebied?

Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.

Probeer Digest →