← Derniers articles
🤖 machine learning

Cache-Aware Prompt Compression:A Two-Tier Cost Model for LLM API Caching

Ce document introduit la compression de prompts sensible au cache (CAPC), une stratégie qui combine la compression agnostique à la requête avec un contrôle explicite du cache et des limites de préservation de paliers pour surmonter les limites des méthodes dépendantes de la requête, atteignant des réductions de coûts significatives (jusqu'à 90 %) tout en maintenant la qualité à travers divers flux de travail de LLM en production.

Auteurs originaux : Yan Song

Publié 2026-07-20
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Yan Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez une bibliothèque massive et ultra-intelligente où un bibliothécaire très coûteux (une IA) vous aide à trouver des réponses. Pour économiser de l'argent, la bibliothèque utilise deux astuces spéciales. Premièrement, il y a un « Salon VIP » (le cache) : si vous interrogez le bibliothécaire sur le même chapitre de livre encore et encore, il n'a pas besoin de relire tout le chapitre dans les rayons de la bibliothèque ; il lui suffit de jeter un coup d'œil à ses notes, ce qui est beaucoup moins cher. Deuxيèmement, il y a un « Résumeur » (la compression) : au lieu de donner au bibliothécaire un roman de 500 pages, vous lui donnez un résumé de 50 pages, ce qui est également moins cher à traiter.

Pendant longtemps, on a pensé que ces deux astuces devaient être utilisées séparément. Soit vous utilisiez le Salon VIP pour les gros livres ennuyeux, soit vous utilisiez le Résumeur pour les questions courtes et complexes. Mais voici le hic : le Résumeur modifie généralement l'histoire légèrement à chaque nouvelle question pour qu'elle s'adapte mieux. Le problème est que le Salon VIP est un adepte du respect strict des règles. Si l'histoire change ne serait-ce qu'un tout petit peu, le bibliothécaire dit : « Désolé, c'est un nouveau livre ! » et jette ses notes, vous obligeant à payer le prix fort pour tout relire. Cette étude pose une question simple : pouvons-nous utiliser les deux astuces en même temps sans briser les règles ?

Les chercheurs de PayPal ont décidé de tester cela sur un système d'IA réel appelé Sonnet 4.6. Ils ont découvert que le Salon VIP n'est pas aussi parfait que tout le monde le pensait. Il possède une « zone chaude » pour les notes courtes et une « zone persistante » pour les longues, et si vous devenez trop astucieux avec vos résumés, vous expulsez accidentellement vos notes de la zone chaude coûteuse. Ils ont découvert que l'ancienne méthode — changer le résumé pour chaque question — gaspille en réalité de l'argent car elle empêche le bibliothécaire d'utiliser les notes bon marché.

Pour corriger cela, ils ont inventé une nouvelle stratégie appelée CAPC (Compression de Prompt Sensible au Cache). Voyez cela comme ceci : au lieu de réécrire l'histoire pour chaque question, ils créent un résumé compressé parfait des parties ennuyeuses une seule fois et le verrouillent dans le Salon VIP. Ensuite, pour chaque nouvelle question, ils ajoutent simplement la question spécifique à ce résumé verrouillé sans modifier le résumé lui-même. C'est comme avoir un script pré-écrit qui ne change jamais, afin que le bibliothécaire puisse réutiliser ses notes bon marché à chaque fois.

Les résultats ont été surprenants. Lors de tests sur 16 types différents de documents, cette nouvelle méthode a été l'option la moins chère à chaque fois, économisant environ 49 % par rapport à l'utilisation du seul Salon VIP et 64 % par rapport à l'ancienne méthode de « changement de résumé ». Ils l'ont également testée sur des tâches réelles, comme un robot utilisant des outils pour réparer du code informatique et un système qui parcourt d'immenses graphes de connaissances. Dans un cas, ils ont économisé plus de 50 % sur les coûts sans perdre en qualité. Dans un autre, ils ont prouvé que l'ancienne méthode de « changement de résumé » coûtait en fait 40 % de plus que de ne rien faire du tout car elle cassait systématiquement le cache. L'article conclut qu'en étant intelligent sur le quand compresser et le quoi mettre en cache, nous pouvons rendre l'IA beaucoup moins chère à utiliser sans la rendre moins intelligente.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →