← Derniers articles
🤖 machine learning

ML Inference Scheduling with Predictable Latency

Cet article identifie des limitations critiques dans les approches existantes d'ordonnancement de l'inférence de l'apprentissage automatique, spécifiquement leur prédiction d'interférence à grain grossier et leur dépendance à des modèles statiques, ce qui conduit à des prévisions de latence inexactes et à des SLO compromis sous des charges de travail dynamiques.

Auteurs originaux : Haidong Zhao, Nikolaos Georgantas

Publié 2026-06-16
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Haidong Zhao, Nikolaos Georgantas

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La vue d'ensemble : La cuisine d'un restaurant haut de gamme

Imaginez la cuisine d'un restaurant haut de gamme (le GPU) qui est incroyablement rapide mais très coûteuse à faire fonctionner. Pour économiser de l'argent, le propriétaire veut cuisiner autant de repas que possible à la fois (améliorer l'utilisation).

Dans cette cuisine, les commandes arrivent pour différents plats (comme des modèles de Machine Learning). Pour être efficace, le chef regroupe les commandes similaires dans un seul « lot » (batch) pour les cuire tous en même temps. Par exemple, au lieu de cuire un burger, puis deux frites, puis un burger, ils cuisinent un plateau de cinq burgers simultanément.

Cependant, la cuisine a un problème : l'Interférence.
Si le chef essaie de cuire un énorme plateau de burgers et un plateau de soufflés délicats exactement en même temps sur la même cuisinière, ils risquent de se gêner mutuellement. La chaleur pourrait devenir inégale, ou le chef pourrait devoir changer d'outils trop souvent. Cela ralentit tout, ce qui fait que la nourriture arrive en retard.

Dans le monde de l'IA, une « nourriture en retard » signifie la latence. Si une voiture autonome ou un appel vidéo reçoit une réponse retardée parce que la cuisine était trop encombrée, c'est un échec. L'objectif de ce papier est de déterminer comment planifier ces lots de cuisson afin que la cuisine reste occupée sans que la nourriture n'arrive en retard.

Le Problème : Deviner est dangereux

Le papier soutient que les méthodes actuelles pour prédire l'ampleur de l'encombrement (l'interférence) sont défaillantes pour deux raisons principales :

1. Le problème du « Instantané Statique » (Granularité grossière)

L'analogie : Imaginez que vous êtes un contrôleur de trafic. Vous regardez une carte et voyez un camion rouge et une voiture bleue actuellement sur l'autoroute. Vous prédisez qu'ils rouleront côte à côte pendant tout le trajet.
La Réalité : Dans la cuisine, le camion rouge (Lot 1) peut quitter l'autoroute après 10 secondes, et un géant semi-remorque (Lot 3) peut surgir et rester pendant 5 minutes.
L'affirmation du papier : Les planificateurs d'IA actuels sont comme ce contrôleur de trafic. Ils regardent qui est dans la cuisine en ce moment même et supposent qu'ils y resteront de la sorte. Ils ignorent le fait que les lots arrivent et partent à des moments différents.

  • Résultat : La prédiction est fausse. Le système pense que la cuisine sera calme, mais soudain, un nouveau lot très lourd arrive, provoquant un embouteillage et des livraisons tardives.

2. Le problème de la « Vieille Carte » (Modèles non adaptatifs/statiques)

L'analogie : Imaginez que vous avez formé un robot chef pour prédire les temps de cuisson en utilisant un menu de l'année dernière. L'année dernière, tout le monde commandait des burgers. Cette année, tout le monde commande des fruits de mer complexes.
La Réalité : Le robot chef pense toujours : « Oh, ce ne sont que des burgers », et prédit que le temps de cuisson sera rapide. Mais comme le menu a changé, le robot se trompe.
L'affirmation du papier : Les modèles d'IA actuels sont « statiques ». Ils sont entraînés une seule fois sur des données anciennes, puis ne sont jamais mis à jour. Si les types de requêtes changent (par exemple, de nouveaux modèles d'IA sont ajoutés, ou le nombre de commandes change), l'ancien modèle devient inexact.

  • Résultat : Le système continue de faire de mauvaises suppositions car il utilise une carte obsolète pour un monde changeant.

Ce que les auteurs ont fait (L'expérience)

Les auteurs ont mis en place une cuisine de test (en utilisant un GPU NVIDIA) pour voir à quel point ces deux problèmes sont réels.

  1. Tester le problème de l'« Instantané » : Ils ont lancé des simulations où les lots arrivaient et partaient à des moments différents. Ils ont constaté que si l'on ignore ces changements, la prédiction de la durée d'une tâche peut être erronée par une marge énorme (parfois plus de 60 % d'erreur). C'est comme deviner qu'un trajet de 10 minutes prendra 16 minutes parce que vous ne saviez pas qu'un feu rouge allait passer au rouge.
  2. Tester le problème de la « Vieille Carte » : Ils ont entraîné un modèle sur un ensemble de plats, puis ont tenté de prédire les temps pour un ensemble de plats complètement différent. L'ancien modèle a échoué lamentablement. Cependant, lorsqu'ils ont laissé le modèle « apprendre à la volée » (Apprentissage en ligne / Online Learning) — en mettant à jour ses prédictions à mesure qu'il voyait de nouvelles données — il est devenu bien meilleur pour gérer les changements.

La Conclusion

Le papier conclut que pour faire fonctionner une cuisine d'IA efficace sans livraisons tardives, nous devons arrêter d'utiliser des planificateurs « stupides » qui :

  1. Ignorent le fait que la foule dans la cuisine change chaque seconde.
  2. Refusent d'apprendre de nouveaux types de commandes.

Au lieu de cela, nous avons besoin d'un planificateur intelligent qui :

  • Surveille la cuisine de manière dynamique (en suivant qui arrive et qui part).
  • Apprend et met à jour ses prédictions en temps réel à mesure que la charge de travail change.

En faisant cela, nous pouvons maintenir le GPU (la cuisine) occupé et efficace tout en garantissant que chaque commande (chaque requête d'IA) reçoit sa réponse à temps.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →