← Derniers articles
💻 computer science

DriftSched: Adaptive QoS-Aware Scheduling under Runtime Token Drift for Multi-Tenant GPU Inference

Cet article présente DriftSched, un cadre d'ordonnancement sensible à la QoS pour l'inférence de LLM multi-locataire qui utilise un mécanisme de rétroaction en ligne pour corriger les erreurs d'estimation de jetons au moment de l'exécution, démontrant que si le calibrage adaptatif améliore considérablement la précision de l'estimation, la politique d'ordonnancement Shortest-Job-First (SJF) produit les réductions les plus substantielles de la latence de bout en bout et de la latence de queue.

Auteurs originaux : Kathiravan Palaniappan

Publié 2026-06-03
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Kathiravan Palaniappan

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigez un restaurant très populaire avec une seule cuisine (le GPU) et un seul chef. Vous avez trois types de clients :

  1. Les VIP (Premium) : Ils veulent être servis rapidement et sont prêts à payer plus cher.
  2. Les Habitués (Standard) : Ils veulent juste un repas normal.
  3. Les Acheteurs en Gros (Batch) : Ils commandent d'énormes plateaux de traiteur et ne sont pas pressés.

Le problème ? La cuisine est débordée. Les commandes s'accumulent et certains attendent une éternité tandis que d'autres sont servis rapidement. Le chef doit décider qui cuisiner ensuite. C'est ce qu'on appelle l'« ordonnancement » (scheduling).

Le problème central : Deviner la charge de travail

Pour décider qui servir ensuite, l'ordonnanceur doit savoir quelle est l'ampleur de chaque commande.

  • Est-ce une simple salade (travail court) ?
  • Ou est-ce un repas complexe à 5 services (travail long) ?

Si l'ordonnanceur se trompe dans son estimation, c'est le chaos. S'il pense qu'une énorme commande de traiteur est petite, il pourrait la servir avant l'apéritif rapide d'un VIP, ce qui ferait attendre le VIP trop longtemps. C'est ce qu'on appelle la « mauvaise classification de la charge de travail » (Workload Misclassification).

Les deux façons de deviner

L'article, DriftSched, teste deux façons de deviner la taille d'une commande :

  1. Le « Guess de Paresseux » (Proxy par les espaces blancs) : Imaginez compter les mots sur le ticket de commande. S'il y a 10 mots, c'est probablement petit. S'il y en a 100, c'est grand. C'est rapide et facile pour l'hôte, mais c'est imprécis. Une phrase courte peut être complexe à cuisiner, et une phrase longue peut être simple.
  2. Le « Guess d'Expert » (Sensible au Tokenizer) : Imaginez que l'hôte lise réellement la recette et sache exactement combien d'ingrédients et d'étapes sont impliqués. C'est précis, mais cela prend un peu plus de temps et d'effort pour l'hôte à calculer.

La solution : DriftSched

DriftSched est un système intelligent qui gère ce restaurant. Il possède une fonctionnalité spéciale appelée « Calibration Adaptative » (ou EMA).

Voyez les choses ainsi : si l'hôte utilise le « Guess de Paresseux » et réalise qu'il sous-estime systématiquement le temps de préparation d'un repas de type « Rapport Technique », DriftSched apprend de ses erreurs. Il se dit : « Ah, chaque fois que nous estimons qu'un Rapport Technique est petit, il est en réalité 20 % plus long. La prochaine fois, j'ajouterai 20 % à l'estimation. »

Au fil du temps, le « Guess de Paresseux » devient presque aussi bon que le « Guess d'Expert » car le système corrige ses propres erreurs en fonction de ce qui s'est réellement passé en cuisine.

Les cinq stratégies d'ordonnancement

L'article a testé cinq règles pour décider qui mange ensuite :

  1. FIFO (First-In, First-Out) : Comme une file d'attente standard. Premier arrivé, premier servi. C'est équitable, mais si un Acheteur en Gros est devant vous avec une commande énorme, vous attendrez une éternité.
  2. Priorité : Les VIP passent toujours en tête de liste. Les habitués et les acheteurs en gros attendent. Excellent pour les VIP, terrible pour tous les autres.
  3. Pondéré (Weighted) : Un compromis. Les VIP sont servis 50 % du temps, les habitués 30 % et les acheteurs en gros 20 %. Tout le monde a son tour, mais les VIP en profitent davantage.
  4. SJF (Shortest-Job-First) : Le chef choisit toujours la plus petite et la plus rapide commande ensuite, peu importe qui a commandé. Si un Acheteur en Gros a un petit accompagnement, celui-ci sera cuisiné avant le plat principal d'un VIP.
  5. Priorité par Âge (Aging Priority) : Comme la Priorité, mais si un Acheteur en Gros attend trop longtemps, son ticket reçoit un « tampon » qui booste sa priorité afin qu'il ne meure pas de faim.

Qu'ont-ils découvert ?

1. La précision compte, mais la stratégie compte plus
Utiliser le « Guess d'Expert » (Tokenizer) est meilleur que le « Guess de Paresseux » (Espaces blancs). Cependant, la règle que vous utilisez pour choisir le client suivant (la politique d'ordonnancement) a un impact bien plus important sur les temps d'attente que la précision de votre estimation de la taille de la commande.

2. Le SJF est le roi de la vitesse
La règle SJF (Shortest-Job-First) a été la plus rapide. Elle a réduit le temps d'attente moyen d'environ 42 % par rapport à la file standard (FIFO). Pourquoi ? Parce qu'en traitant d'abord toutes les petites commandes rapides, la cuisine reste occupée et efficace, et moins de personnes restent bloquées derrière une seule commande géante.

3. La Priorité est le roi des VIP
Si vous voulez satisfaire les VIP, l'ordonnancement par Priorité est le meilleur. Les VIP n'ont attendu qu'environ 77 secondes, tandis que les Acheteurs en Gros ont attendu environ 427 secondes. Le SJF, en revanche, ne se souciait pas de qui vous étiez ; il s'intéressait seulement à la taille de votre commande. En fait, sous le régime SJF, des Acheteurs en Gros étaient parfois servis plus vite que des VIP parce que leurs commandes se trouvaient être plus petites.

4. Le « Guess de Paresseux » peut être réparé
La fonction d'auto-correction du système (EMA) a bien fonctionné. Lorsque le système utilisait le « Guess de Paresseux » imprécis, il apprenait à ajuster ses estimations au fil du temps, réduisant les erreurs d'environ 40 %. Cependant, si vous utilisez déjà le « Guess d'Expert », l'auto-correction n'aide pas beaucoup car les estimations étaient déjà précises.

L'essentiel à retenir

  • Si vous voulez le service le plus rapide globalement : Utilisez le SJF (Shortest-Job-First). Cela vide la file d'attente le plus vite.
  • Si vous voulez protéger vos clients les plus importants : Utilisez l'Ordonnancement par Priorité. Cela garantit que les VIP sont servis en premier, même si cela fait attendre les autres plus longtemps.
  • Ne vous souciez pas trop d'une estimation parfaite : Même si vous utilisez une estimation approximative du temps de préparation d'une commande, la règle d'ordonnancement que vous choisissez (SJF vs Priorité) compte beaucoup plus pour le temps d'attente final. Mais si vous pouvez estimer avec précision (en utilisant le Tokenizer), le système fonctionne de manière plus fluide.

En résumé : La façon dont vous alignez les clients compte plus que la perfection de votre estimation de la taille de leur commande.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →