← Derniers articles
💻 computer science

TEMPO: Makespan-Aware Expert-Parallel Load Balancing Across Memory- and Compute-Bound Regimes

TEMPO introduit un répartiteur d'équilibrage de charge par parallélisme d'experts sensible au makespan qui modélise les temps d'exécution non linéaires des experts à travers les régimes limités par la mémoire et par le calcul afin d'optimiser dynamiquement la distribution des jetons, atteignant jusqu'à 15,5 % de gains de débit et des réductions significatives de latence dans les scénarios de régimes mixtes où les méthodes traditionnelles basées sur le comptage linéaire échouent.

Auteurs originaux : Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Publié 2026-08-14
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Jie Li, Chenxin Jia, Jinliang Shen, Cunzhuang Liu, Ruiyi Ding, Jianwen Xian, Kang He, Chengru Song

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous dirigiez un service de livraison de pizzas massif et à grande vitesse pour une ville qui ne dort jamais. Vous avez une flotte de livreurs identiques (les GPU) et une cuisine centrale avec des centaines de chefs spécialisés différents (les « experts » d'un modèle d'IA). Chaque fois qu'un client commande une pizza, le système doit décider quels chefs travailleront sur elle et quel livreur emportera la pizza terminée. Dans le monde de l'intelligence artificielle, plus précisément avec un type de modèle appelé « Mixture-of-Experts » (MoE), c'est exactement ce qui se passe. Ces modèles sont comme des cerveaux géants composés de milliers de petits sous-cerveaux spécialisés. Quand l'IA réfléchit, elle n'utilise pas tout son cerveau à la fois ; elle choisit quelques experts spécifiques pour gérer la tâche.

Le grand défi est de maintenir toute l'équipe à la même vitesse. Si un livreur se retrouve coincé avec une commande énorme et compliquée alors que tous les autres sont inactifs, la livraison entière est retardée. Le temps nécessaire pour terminer un lot de commandes est déterminé par la personne la plus lente du groupe. Pendant des années, la règle standard pour équilibrer cette charge de travail était simple : « Divisez simplement le nombre de commandes de manière égale ». Si vous avez 100 commandes, donnez 10 à chacun de vos 10 livreurs. Cela semblait logique, comme partager un tas de pommes équitablement. Mais et si certaines pommes étaient des rochers lourds et d'autres des plumes légères ? Ou si la cuisine avait une règle selon laquelle choisir un nouveau chef prend un temps fixe, peu importe le nombre de pizzas qu'il prépare ? Les anciennes règles supposaient que le temps était toujours directement lié au nombre de commandes. Cette publication demande : et si cette supposition est fausse ?

Les chercheurs derrière ce document, travaillant chez KlingAI, ont découvert que l'ancienne règle du « comptage des commandes » est en réalité un piège. Ils ont découvert que dans le matériel informatique moderne utilisé pour l'IA, le temps nécessaire pour traiter un expert ne dépend pas seulement du nombre de jetons (mots ou morceaux de données) qu'il voit. C'est une bête à deux visages. Parfois, le temps est dominé par l'effort pur de charger la « recette » de l'expert (les poids) depuis la banque de mémoire, ce qui prend un temps fixe, quelle que soit la taille de la commande. D'autres fois, une fois la recette chargée, le temps augmente linéairement avec le nombre de commandes. Les anciennes méthodes, qui ne regardaient que le nombre de commandes, ignoraient le coût caché du chargement de la recette. Elles essayaient d'équilibrer un tas de plumes et de rochers en les comptant, plutôt qu'en les pesant.

Pour corrir cela, l'équipe a construit un nouveau répartiteur appelé TEMPO (Time-modeled Expert-Parallel Optimization). Au lieu de simplement compter les jetons, TEMPO agit comme un contrôleur de trafic intelligent qui comprend la physique de la cuisine. Il utilise un « modèle de coût » spécial qui mesure exactement le temps nécessaire pour charger la recette d'un chef et le temps nécessaire pour cuire la pizza. Il réalise que si vous avez un expert « froid » (qui n'a pas été utilisé depuis un certain temps), diviser sa petite commande entre deux livreurs est un désastre car vous devez payer la « taxe de chargement » deux fois. Mais si vous avez un expert « chaud » avec une montagne de commandes, la division est sans problème.

L'article montre que TEMPO ne fait pas que deviner ; il calcule l'équilibre parfait pour chaque lot de requêtes en quelques millisecondes. Ils ont testé cela sur de vrais modèles d'IA et ont constaté que les anciennes méthodes étaient souvent 15 % plus lentes ou causaient des retards significatifs pour les derniers clients d'une file d'attente. TEMPO, cependant, maintient la file d'attente en mouvement fluide. C'est comme passer d'une règle qui dit « tout le monde reçoit le même nombre de pommes » à une règle qui dit « tout le monde reçoit la même quantité de travail », en tenant compte du fait que certaines pommes sont lourdes et que certains chefs sont lents à se réveiller.

Les chercheurs ont été très méticuleux pour montrer exactement où cette nouvelle méthode fonctionne et où elle ne fonctionne pas. Ils ont prouvé que si les experts « chauds » sont si nombreux que le système est simplement submergé par le volume massif de données (le régime « compute-bound »), l'ancienne méthode de comptage des jetons est en fait correcte. Mais dans le monde réel, où certains experts sont occupés et d'autres se reposent, et où la « taxe de chargement » est élevée, TEMPO brille. Ils ont même cartographié un « diagramme de phase », qui est comme une carte météorologique pour le trafic de l'IA, prédisant exactement quand la nouvelle méthode fera gagner du temps et quand l'ancienne méthode est suffisante.

En fin de compte, ce document ne porte pas seulement sur un algorithme plus rapide ; il s'agit de changer notre façon de penser l'équilibrage du travail dans l'IA. Il nous enseigne que dans le monde complexe et à haute vitesse de l'IA moderne, on ne peut pas se contenter de compter les choses. Il faut comprendre les coûts cachés du déplacement des données et la forme spécifique du travail. En mesurant le temps réel nécessaire pour accomplir la tâche plutôt qu'en comptant simplement les articles, TEMPO rend les modèles d'IA plus rapides, plus efficaces et prêts à répondre aux demandes massives du futur. Il transforme une cuisine chaotique en une machine bien huilée, garantissant qu'aucun livreur ne reste à attendre pendant que la pizza repose sous la lampe chauffante.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →