Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving
Le document présente ConServe, un cadre d'ordonnancement qui déplace l'unité d'ordonnancement des tours individuels vers des conversations entières afin d'éliminer la nécessité de prédire des coûts futurs inconnus, réduisant ainsi la latence et améliorant l'efficacité énergétique en exploitant une structure stable en deux phases de préremplissage limité par le calcul et de décodage limité par la mémoire.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous dirigez une cuisine de restaurant très occupée. Autrefois, chaque commande était simple : un client entre, vous cuisinez le plat, et il repart. Vous pouviez facilement gérer la cuisine car chaque commande prenait à peu près le même temps et demandait le même effort.
Mais aujourd'hui, imaginez que vos clients sont des « Agents IA ». Ils ne se contentent pas de commander un plat ; ils lancent un projet complexe.
- Le premier tour (Le briefing massif) : Le client s'installe et vous donne un manuel d'instructions massif de 50 pages. Cela prend du temps pour lire et comprendre (le « Prefill » ou préremplissage).
- Les tours intermédiaires (Les appels d'outils) : Le chef commence à cuisiner, puis s'arrête pour appeler un fournisseur, attendre une réponse, vérifier une recette, puis rappelle. Ces étapes sont courtes, mais elles se produisent encore et encore.
- Le tour final (Le résultat) : Enfin, le plat est prêt à être servi.
Le Problème : L'ancienne méthode de planification
Les gestionnaires de cuisine actuels (systèmes d'IA) traitent chaque étape comme une commande séparée. Chaque fois que le chef s'arrête pour appeler un fournisseur, le gestionnaire doit décider : « Est-ce que je laisse le chef terminer cette étape ici, dans la cuisine principale, ou est-ce que j'envoie cette étape spécifique à une autre station spécialisée ? »
Le problème est que le gestionnaire doit deviner combien de temps cette étape prendra ou de quelle mémoire elle aura besoin avant qu'elle ne se produise. S'il se trompe dans son estimation, il envoie l'étape au mauvais endroit, provoquant un embouteillage. C'est comme un agent de circulation qui essaierait de diriger les voitures en prédisant exactement la vitesse de chaque conducteur avant même qu'ils ne commencent à rouler.
La Solution : ConServe (L'approche au niveau de la conversation)
Le document présente un nouveau système appelé ConServe. Au lieu de gérer chaque étape séparément, ConServe gère l'intégralité de la conversation comme une seule unité.
Voici comment ConServe change les règles en utilisant un plan en deux phases :
Phase 1 : Le gros œuvre (Le Prefill)
Lorsque le client arrive avec ce manuel de 50 pages, ConServe l'envoie immédiatement vers une station ultra-rapide et de haute puissance (un GPU puissant). Cette station est conçue spécifiquement pour lire de gros documents rapidement. Elle lit le manuel, comprend le contexte et crée une « carte de mémoire » (appelée cache KV) de tout ce qui est nécessaire.
Phase 2 : La longue traîne (Le reste de la conversation)
Une fois que cette carte initiale est créée, ConServe dit : « D'accord, le gros œuvre est terminé. Maintenant, toute cette conversation appartient à une station spécifique, plus petite et plus économe en énergie. »
- La « carte de mémoire » est déplacée exactement une seule fois vers cette nouvelle station.
- À partir de ce moment-là, chaque étape de suivi (les appels d'outils, les mises à jour courtes) se déroule directement sur cette même station.
- Le système ne devine plus jamais. Peu importe si la prochaine étape est courte ou longue ; la conversation reste ancrée sur cette station unique jusqu'à ce que le travail soit terminé.
Pourquoi est-ce meilleur ? (L'analogie)
Pensez à un camion de livraison :
- L'ancienne méthode : Vous essayez de prédire si le prochain colis est lourd ou léger. Si vous vous trompez, vous envoyez un petit camion pour une charge lourde, ou un gros camion pour un petit colis. Vous gaspillez de l'essence et du temps.
- ConServe : Vous chargez le camion une seule fois au début. Vous conduisez le camion jusqu'à la destination et vous le garez là. Tous les colis suivants pour ce client spécifique sont chargés sur ce même camion. Vous n'avez pas besoin de prédire le poids du prochain colis ; vous faites simplement fonctionner le camion de manière efficace.
Les Résultats
Le document a testé cela sur de réels flux de travail d'agents d'IA et a constaté que :
- Vitesse : Il a réduit le temps nécessaire pour que le client voie le premier vrai résultat (pas seulement un appel d'outil) de 51 %. C'est comme recevoir votre plat 50 % plus vite parce que la cuisine n'est pas confuse sur l'endroit où mettre les ingrédients.
- Efficacité : Il a économisé 7,5 % d'énergie. En utilisant une station puissante uniquement pour la lecture initiale massive et une station moins coûteuse pour le reste, il gaspille moins d'électricité.
- Fiabilité : Comme le système n'a pas besoin de deviner (prédire) ce qui va suivre, il ne commet jamais d'erreurs de « mauvais virage ». Les anciens systèmes auraient planté ou ralenti si leurs prédictions étaient erronées ; ConServe continue simplement d'avancer car il se repose sur ce qu'il peut réellement voir à l'instant présent.
En bref : ConServe arrête d'essayer de prédire l'avenir de chaque petite étape d'une conversation d'IA. Au lieu de cela, il traite toute la conversation comme un seul travail, gère le démarrage intense avec un moteur puissant, puis laisse un moteur stable et efficace terminer le reste.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.