← Derniers articles
🤖 AI

HeraSys: Collaborative Serving of Multiple LLM Workflows via Fine-Grained End-to-End Optimization

HeraSys est un système de service de LLM qui optimise la performance de bout en bout des flux de travail multi-locataires concurrents en éliminant la redondance computationnelle inter-flux grâce à la fusion structurelle de nœuds et en employant une politique d'ordonnancement conjoint sensible à la charge pour réduire significativement la latence de queue tout en augmentant le débit.

Auteurs originaux : Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

Publié 2026-07-28
📖 4 min de lecture☕ Lecture pause café

Auteurs originaux : Size Li, Zhiqing Tang, Hongrui Liang, Jianxiong Guo, Jiong Lou, Tian Wang, Weijia Jia

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez une cuisine en pleine effervescence où une équipe de chefs tente de préparer des centaines de repas complexes à la fois. Dans le monde de l'intelligence artificielle, ces « repas » sont des tâches exécutées par les grands modèles de langage (LLM) — ces cerveaux informatiques super intelligents qui écrivent des histoires, répondent à des questions et résolvent des problèmes. Habituellement, lorsque vous demandez quelque chose à une IA, cela est traité comme une commande unique et isolée. Mais dans le monde réel, les applications deviennent de plus en plus semblables à des banquets élaborés : une seule requête peut impliquer la recherche d'informations, la vérification d'une base de données, puis la rédaction d'un résumé, tout cela en une seule opération. On appelle cela des « workflows » (flux de travail).

Le problème est que lorsque de nombreuses personnes commandent ces banquets complexes en même temps, la cuisine devient chaotique. Si deux clients demandent que le même ingrédient soit découpé, la cuisine risque de le découper deux fois, gaspillant ainsi du temps et de l'énergie. Pire encore, si un client commande un ragoût massif et à cuisson lente, les chefs pourraient rester bloqués dessus, laissant tous les autres attendre que leurs salades rapides soient servies. C'est le défi de la « mise en service » (serving) de l'IA : comment gérer un flux de requêtes complexes et imbriquées sans que le système ne s'arrête ou ne laisse certaines personnes attendre indéfiniment ?

C'est là qu'intervient un nouveau système appelé HeraSys. Considérez HeraSys comme un gestionnaire de cuisine révolutionnaire qui ne se contente pas de regarder une commande à la fois, mais qui observe l'ensemble de la cuisine pour voir comment les différentes commandes peuvent s'entraider. Au lieu de traiter chaque requête comme une île isolée, HeraSys cherche les chevauchements. Si deux clients différents ont besoin qu'un même document soit analysé ou qu'un même outil soit utilisé, HeraSys dit : « Hé, faisons cela une seule fois et partageons le résultat ! » Il agit également comme un agent de circulation, veillant à ce que les commandes rapides et simples ne restent pas bloquées derrière les plus lourdes et les plus lentes, et que les plus lentes ne soient pas privées d'attention.

Les chercheurs derrière HeraSys ont construit un système qui décompose ces tâches d'IA complexes en morceaux minuscules et très précis. Ils ont découvert qu'en fusionnant les étapes dupliquées et en planifiant intelligemment l'attribution des ressources de la cuisine (comme les puces informatiques puissantes), ils pouvaient rendre l'ensemble du système beaucoup plus rapide. Lors de leurs tests, ils ont démontré que HeraSys pouvait réduire le temps nécessaire pour que les requêtes les plus lentes se terminent jusqu'à 2,17 fois (ce qui signifie qu'elles étaient plus de deux fois plus rapides) et augmentait le nombre total de tâches que le système pouvait gérer jusqu'à 1,85 fois par rapport aux meilleurs systèmes existants.

L'article s'oppose à l'ancienne méthode de travail, où les systèmes traitent chaque requête comme un travail indépendant et isolé. Ils montrent que cette « isolation » crée un gaspillage et des goulots d'étranglement inutiles. Au lieu de cela, ils proposent une approche collaborative où le système recherche activement un travail partagé. Ils s'opposent également aux règles de planification simples comme « premier arrivé, premier servi », qui peuvent bloquer tout le monde à cause des tâches longues, ou « le travail le plus court d'abord », qui peut faire attendre éternellement les tâches longues. HeraSys suggère une stratégie équilibrée, « sensible à la charge », qui réserve certaines ressources pour les tâches lourdes tout en donnant la priorité aux tâches rapides, garantissant ainsi l'équité et la rapidité pour tous.

Les résultats, mesurés via des expériences approfondies sur du matériel réel, suggèrent que cette approche collaborative et de précision constitue une étape significative en avant. En fusionnant les étapes redondantes et en ajustant dynamiquement la manière dont les tâches sont groupées et exécutées, HeraSys parvient à maintenir un temps d'attente moyen bas tout en évitant la « queue » de délais longs et frustrants qui affectent souvent les systèmes d'IA complexes. C'est un peu comme réaliser que si l'on organise un groupe d'amis pour nettoyer une maison, on ne devrait pas simplement assigner une pièce à chaque personne ; on devrait remarquer que deux personnes passent l'aspirateur dans le même couloir et leur demander de travailler ensemble, tout en s'assurant que la personne qui lave les vitres ne reste pas coincée en attendant le passage de l'aspirateur.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →