← Derniers articles
💬 NLP

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

Cet article présente une évaluation complète de la mise en cache des prompts (prompt caching) à travers trois principaux fournisseurs de LLM pour les tâches agentiques à long horizon, démontrant que des techniques de mise en cache stratégiques — telles que l'exclusion des résultats d'outils dynamiques et la gestion de la structure du prompt — peuvent réduire les coûts d'API de 41 à 80 % et améliorer le temps jusqu'au premier jeton (time to first token) de 13 à 31 % par rapport à une mise en cache naïve du contexte complet.

Auteurs originaux : Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

Publié 2026-02-03
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous embauchiez un assistant de recherche brillant mais coûteux pour résoudre un mystère complexe. Cet assistant doit lire un manuel d'instructions massif (le « prompt système ») avant de commencer à travailler. Pendant qu'il travaille, il passe des dizaines d'appels téléphoniques à différentes sources, obtient des réponses et les note dans un carnet.

Chaque fois qu'il passe un nouvel appel, il doit relire l'intégralité du manuel d'instructions depuis la première page pour se souvenir de ce qu'il doit faire. Cela prend beaucoup de temps et coûte beaucoup d'argent car l'assistant facture chaque page lue.

Le « Prompt Caching » (mise en cache du prompt) est comme si vous donniez à cet assistant un surligneur magique. Si le manuel d'instructions n'a pas changé, l'assistant peut sauter les 90 % premiers du livre et passer directement à la nouvelle partie où se trouvent les résultats des appels téléphoniques. Cela permet de gagner du temps et de l'argent.

Cependant, ce document pose une question délicate : le surligneur magique fonctionne-t-il toujours, ou pouvons-nous le faire échouer ?

Les chercheurs ont testé cela avec trois grandes entreprises d'« assistants » (OpenAI, Anthropic et Google) en utilisant un benchmark appelé DeepResearch Bench, où des agents effectuent de longues recherches web en plusieurs étapes pour répondre à des questions difficiles. Ils ont essayé trois façons différentes d'utiliser le surligneur :

  1. L'approche « Naïve » (Contexte Complet) : Surligner tout, y compris les nouveaux résultats des appels téléphoniques.
  2. L'approche « Post-it » (Prompt Système Uniquement) : Surligner uniquement le manuel d'instructions, mais laisser les nouveaux résultats des appels téléphoniques non surlignés.
  3. L'approche « Rupture Propre » (Exclure les Résultats d'Outils) : Surligner le manuel et les appels téléphoniques, mais placer un panneau « stop » spécial après chaque nouveau résultat pour que le surligneur ne capture pas accidentellement les notes désordonnées de la personne suivante.

Ce qu'ils ont découvert

1. Cela permet d'économiser beaucoup d'argent (Le gain pour le « Portefeuille »)
Peu importe la méthode utilisée, le surligneur magique a permis d'économiser énormément d'argent. Selon l'entreprise, ils ont économisé entre 41 % et 80 % sur la facture.

  • Analogie : C'est comme réaliser que vous n'avez pas besoin d'acheter une nouvelle carte de bibliothèque à chaque fois que vous entrez dans la bibliothèque ; vous utilisez simplement celle que vous avez déjà.

2. La vitesse est délicate (Le problème du « Trafic »)
Si économiser de l'argent était facile, économiser du temps l'était moins.

  • La surprise : Parfois, surligner tout (l'approche Naïve) a en fait rendu l'assistant plus lent.
  • Analogie : Imaginez un livreur qui essaie de mémoriser l'adresse de chaque colis qu'il livre. S'il essaie de mémoriser un colis qui ne sera livré qu'une seule fois et jamais plus, il perd du temps à le mémoriser. Quand le colis suivant arrive, il doit « désapprendre » l'ancien pour faire de la place au nouveau. Cette « écriture dans la mémoire » le ralentit.
  • L'article a constaté que si vous ne surlignez que les parties stables (le manuel d'instructions) et laissez les parties désordonnées et changeantes (les résultats des appels téléphoniques) sans être surlignées, l'assistant reste rapide.

3. La règle du « Ne cassez pas le cache »
La plus grande leçon concerne l'endroit où vous tracez la ligne.

  • Si vous insérez des informations dynamiques et changeantes (comme « Heure actuelle : 14h00 » ou « ID Utilisateur : 123 ») à l'intérieur du manuel d'instructions, le surligneur magique se brise. Le système pense que le manuel a changé, il arrête donc de surligner et recommence la lecture depuis le début.
  • La solution : Gardez le manuel d'instructions pur et statique. Si vous devez inclure des informations changeantes, placez-les tout à la fin du manuel, comme un post-it sur la dernière page. De cette façon, les 99 % premiers du manuel sont toujours surlignés et réutilisables.

L'essentiel

Pour les entreprises qui construisent des agents d'IA effectuant des tâches longues et complexes :

  • Oui, utilisez le prompt caching. Cela réduira considérablement vos coûts.
  • Mais, soyez intelligents. Ne l'activez pas simplement pour tout.
  • La meilleure stratégie : Ne mettez en cache que la partie stable (le prompt système). Laissez les parties changeantes (résultats d'outils) circuler librement sans être mises en cache. Cela vous donne le meilleur mélange de faible coût et de vitesse élevée.

Si vous essayez de mettre en cache les parties changeantes, vous risquez de payer pour l'« écriture » du cache sans obtenir les bénéfices de la « lecture », ce qui peut en réalité ralentir votre système.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →