← Derniers articles
🤖 AI

Learning Agent Execution for KV-Cache Management in Agentic Serving

Cet article introduit CacheScout, un runtime de cache KV sensible aux agents qui apprend en ligne les transitions d'exécution des agents pour gérer proactivement l'éviction et le préchargement du cache, améliorant ainsi de manière significative les taux de réussite et réduisant la latence pour le service de LLM multi-agents sans nécessiter de graphes de flux de travail prédéfinis.

Auteurs originaux : Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Publié 2026-08-18
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Rui Zhang, Chaeeun Kim, Shaoting Feng, Kuntai Du, Yuhan Liu, Yi Zhong, Cheng-Wei Ching, Junchen Jiang, Liting Hu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le monde moderne de l'intelligence artificielle, une nouvelle façon de construire des assistants intelligents s'est imposée. Au lieu de demander à un seul cerveau informatique omniscient de résoudre un problème complexe en une seule fois, les développeurs décomposent désormais les tâches en une équipe de travailleurs numériques spécialisés. Imaginez un planificateur de voyage qui demande d'abord à un agent de trouver des vols, puis confie la tâche à un autre agent pour réserver des hôtels, et enfin la transmet à un troisième pour localiser des restaurants. Chacun de ces agents est un grand modèle de langage, un type de logiciel qui prédit le mot suivant dans une phrase en se basant sur des motifs qu'il a appris. Pour ce faire, le logiciel doit conserver une vaste quantité d'informations dans sa mémoire à court terme, appelée cache clé-valeur. Cette mémoire agit comme un espace de travail où le modèle conserve les règles du jeu, les définitions des outils qu'il peut utiliser et les exemples de comportement à adopter. Chaque fois qu'un nouvel agent rejoint la conversation, il apporte son propre ensemble d'instructions et d'exemples, créant un gros bloc de données que le système doit traiter avant de pouvoir commencer à répondre à la question spécifique de l'utilisateur.

Le défi surgit car ces équipes numériques sont dynamiques. Le premier agent peut terminer sa tâche, et le système peut immédiatement passer à un agent complètement différent, ou bien revenir à l'agent initial plus tard. Les systèmes informatiques actuels qui font fonctionner ces équipes d'IA gèrent leur mémoire de manière réactive. Ils conservent les informations les plus récemment utilisées et écartent les plus anciennes pour faire de la place aux nouvelles requêtes. Cela fonctionne bien pour des conversations simples, mais dans une équipe multi-agents, cela crée une inefficacité frustrante. Le système jette souvent les instructions fixes et les exemples d'un agent simplement parce que cet agent n'a pas parlé depuis quelques secondes, même si ce même agent est susceptible d'être appelé de nouveau dès l'étape suivante. Lorsque l'agent revient, le système doit relire et retraiter toutes ces instructions à partir de zéro, gaspillant ainsi du temps et de la puissance de calcul. Ce cycle d'écartement et de réapprentissage ralentit toute l'opération, rendant l'IA lente et coûteuse à exploiter.

Des chercheurs de l'Université de Californie à Santa Cruz et d'autres institutions ont développé une nouvelle approche pour résoudre ce problème, appelée CacheScout. Au lieu de simplement observer ce qui s'est passé dans le passé, ce système apprend à anticiper ce qui va se passer ensuite. Il traite le flux de la conversation non pas comme une série d'événements aléatoires, mais comme un schéma de transitions entre différents travailleurs. En observant à quelle fréquence un agent de voyage est suivi par un agent d'hôtel, ou comment un agent de codage pourrait passer à un agent de révision, le système construit une carte mentale du flux de travail pendant qu'il s'exécute. Il n'a pas besoin d'un script préécrit ou d'une carte fournie par les développeurs ; il apprend ces connexions à la volée, mettant à jour sa compréhension à chaque requête traitée.

Le cœur de ce nouveau système est une couche légère qui se situe entre les agents d'IA et le matériel informatique. Lorsqu'un agent termine sa tâche, cette couche examine l'historique de la conversation et prédit quel agent est le plus susceptible de prendre la parole ensuite. Si le système est confiant quant à l'étape suivante, il prend deux actions spécifiques pour accélérer les choses. Premièrement, lorsqu'il doit vider des données pour faire de la place, il refuse de supprimer les instructions de l'agent qui est prédit comme devant revenir bientôt, même si cet agent n'a pas parlé depuis un certain temps. Il protège ces blocs de mémoire précieux en fonction de leur importance future plutôt que de leur utilisation passée. Deuxièmement, pendant que le système attend la requête suivante, il prépare discrètement et invisiblement la mémoire pour l'agent prédit. Il charge les instructions nécessaires dans la mémoire rapide avant même que l'utilisateur ne les demande, de sorte que lorsque l'agent commence enfin à travailler, il puisse débuter immédiatement sans délai.

Les chercheurs ont testé ce système sur des tâches réelles, incluant la planification de voyages, la résolution de problèmes mathématiques et l'écriture de code informatique. Ils ont constaté qu'en mémorisant les schémas de comportement des agents, le système pouvait conserver les informations appropriées en mémoire beaucoup plus souvent qu'auparavant. Dans leurs tests, le taux de réutilisation réussie de la mémoire existante a bondi de dix à dix-huit points de pourcentage. Cette amélioration s'est traduite directement par de la vitesse. Le temps nécessaire pour l'apparition du premier mot d'une réponse a chuté de pas plus de quarante-cinq pour cent, et le temps total pour compléter un seul tour de conversation a diminué de près de quarante pour cent. Le système a également traité plus de requêtes simultanément, augmentant le nombre total de tâches qu'il peut terminer par seconde jusqu'à cinquante-sept pour cent.

Crucialement, les chercheurs ont montré que cette approche fonctionne même lorsque le flux de travail n'est pas fixe. Dans de nombreuses applications modernes, la prochaine étape est décidée par l'IA elle-même en temps réel, ce qui signifie que le chemin peut changer de manière imprévisible. Le nouveau système s'adapte à cette fluidité, apprenant les chemins les plus courants au fur et à mesure qu'ils se produisent et ajustant ses prédictions en conséquence. Il s'est également avéré efficace avec des modèles d'IA beaucoup plus grands et complexes, maintenant ses avantages de vitesse même lorsque les exigences de mémoire étaient nettement plus élevées. Le système parvient à tout cela sans ralentir l'ordinateur ni nécessiter de nouveau matériel complexe ; il ajoute simplement une petite dose d'intelligence au processus de gestion de la mémoire, transformant un système de stockage passif en un participant actif qui sait ce qui arrive.

Les conclusions suggèrent que l'avenir d'un service d'IA efficace réside dans la compréhension du contexte du travail, et non seulement des données elles-mêmes. En reconnaissant qu'un agent de voyage est probablement suivi par un agent d'hôtel, le système cesse de traiter chaque moment comme un nouveau départ et commence à voir la conversation comme un voyage continu. Ce passage d'une réaction au passé à une préparation pour le futur permet à ces équipes numériques de travailler beaucoup plus vite et plus efficacement, supprimant les goulots d'étranglement qui ont ralenti le déploiement d'applications d'IA complexes. Le résultat est un système qui semble plus réactif et capable, capable de gérer les tâches complexes et multi-étapes qui définissent la prochaine génération de services d'intelligence artificielle.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →