← Derniers articles
🤖 AI

Towards Multi-Model LLM Schedulers: Empirical Insights into Offloading and Preemption

Cet article présente une étude empirique révélant que l'ordonnancement de LLM multi-modèles sur du matériel hétérogène subit une dégradation significative et dépendante du modèle des performances due au déchargement CPU-GPU et à une surcharge substantielle de préemption entraînée par des rechargements d'état, identifiant ainsi des facteurs critiques pour concevoir des ordonnanceurs de nouvelle génération efficaces.

Auteurs originaux : Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Publié 2026-05-20
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mert Yildiz, Pietro Spadaccino, Alexey Rolich, Francesca Cuomo, Andrea Baiocchi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous gérez une cuisine très animée (un serveur informatique) avec quelques chefs ultra-rapides (GPU) et un assistant de garde-manger plus lent, mais très spacieux (le CPU). Votre objectif est de préparer simultanément de nombreux types de plats complexes (des modèles de langage de grande taille, ou LLM). Parfois, la cuisine devient si bondée que les chefs rapides manquent d'espace sur le plan de travail ; vous devez alors demander à l'assistant de garde-manger de prendre en charge certains ingrédients, voire de réaliser une partie du hachage.

Ce document est comparable à une étude détaillée de ce qui se produit lorsque vous tentez de répartir le travail de cuisson entre les chefs rapides et l'assistant lent, ou lorsque vous devez soudainement interrompre un plat pour en préparer un plus urgent.

Voici les principales découvertes de l'étude, expliquées simplement :

1. Le problème du « demi-chef » (délégation)

Lorsqu'un plat est trop volumineux pour le plan de travail du chef, vous déplacez certaines étapes de la recette vers l'assistant de garde-manger.

  • La découverte : Ce n'est pas un compromis fluide. Si vous déplacez seulement un peu de travail vers l'assistant lent, la vitesse de cuisson ne diminue pas légèrement ; elle s'effondre brutalement.
  • L'analogie : Imaginez une course de relais. Si le coureur rapide (GPU) doit passer le témoin à un marcheur lent (CPU), même pour une infime partie de la course, toute l'équipe ralentit considérablement.
  • La surprise : Les petits plats (les modèles d'IA plus petits) souffrent le plus. Si vous tentez de déléguer même une petite partie d'un petit modèle, il devient très lent. Les grands plats (les modèles plus volumineux) gèrent mieux la répartition, en ralentissant de manière plus progressive.
  • La leçon : Vous ne pouvez pas simplement deviner la quantité de travail à confier au CPU. Vous devez savoir exactement quel « plat » vous préparez, car certains modèles détestent être divisés plus que d'autres.

2. Le « coût de changement » (préemption)

Parfois, un client VIP commande un nouveau plat, et vous devez arrêter le chef actuel, dégager son poste et commencer le nouveau. Cela s'appelle la « préemption ».

  • La découverte : Le temps nécessaire pour changer de plat est presque identique, que vous arrêtiez le plat actuel après 1 minute ou après 1 heure.
  • L'analogie : Imaginez que vous peignez une immense fresque murale. Si vous devez vous arrêter pour laisser quelqu'un d'autre peindre, le temps nécessaire pour nettoyer vos pinceaux et préparer ceux du nouveau peintre est le même, que vous ayez peint 3 mètres ou 300 mètres. Le temps passé à peindre n'a pas d'importance ; le temps nécessaire pour changer est fixe.
  • La grande révélation : La plupart des gens pensaient que le temps passé à déplacer les « notes » (la mémoire de ce qui avait déjà été peint, appelée cache KV) était la partie lente. L'étude a révélé que déplacer les notes est en fait instantané (moins de 1 % du temps). Le véritable gaspilleur de temps est le déballage des outils de l'ancien chef et le déballage des outils du nouveau chef (le chargement des poids du modèle depuis le disque dur).
  • La leçon : Changer de tâche est coûteux, mais ce coût est prévisible. Il dépend entièrement du poids de la « trousse d'outils » (la taille du modèle), et non de la durée d'exécution de la tâche.

3. L'« embouteillage » (déplacement de données)

Lorsqu'on déplace des éléments entre le chef rapide et l'assistant lent, ils doivent traverser un couloir (le câble de données).

  • La découverte : Même lorsque les « notes » (la mémoire) deviennent énormes parce que le plat est très long, les déplacer reste ultra-rapide par rapport au déballage des outils.
  • L'analogie : C'est comme déplacer une seule feuille de papier par rapport au déplacement d'une bibliothèque entière. Déplacer la feuille (les notes) est si rapide que cela compte à peine. Déplacer la bibliothèque (les outils du modèle) prend une éternité.
  • La leçon : Ne vous inquiétez pas trop de la taille des « notes » lorsque vous décidez de changer de tâche. Inquiétez-vous de la taille de la « bibliothèque ».

4. La « personnalité du matériel »

L'étude a testé deux types de cuisines différents (deux GPU différents).

  • La découverte : L'une des cuisines était plus rapide pour cuisiner, mais plus lente pour changer de tâche que l'autre.
  • L'analogie : L'une des cuisines possède un chef ultra-rapide mais un couloir étroit, rendant difficile l'échange rapide d'outils. L'autre a un chef légèrement plus lent mais un couloir large, facilitant les échanges.
  • La leçon : Vous ne pouvez pas utiliser une règle « unique pour tous ». La meilleure façon de planifier les tâches dépend exactement du matériel que vous possédez.

Résumé pour l'avenir

Les auteurs concluent que la prochaine génération de « gestionnaires de cuisine » (ordonnanceurs) doit être plus intelligente. Ils ne doivent pas seulement regarder le nombre de commandes dans la file d'attente. Ils doivent savoir :

  1. De quel modèle s'agit-il ? (Certains détestent être divisés).
  2. Quelle est la taille de la trousse d'outils ? (Cela détermine la durée d'un changement).
  3. De quel type de cuisine s'agit-il ? (Différents matériels modifient les règles).

En comprenant ces particularités spécifiques, les gestionnaires peuvent cesser d'essayer de forcer un clou carré dans un trou rond et créer à la place un système capable d'exécuter efficacement de nombreux modèles d'IA différents sans faire s'effondrer la cuisine.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →