← Derniers articles
🤖 AI

Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs

Coral est un système de service multi-LLM adaptatif et conscient de l'hétérogénéité qui optimise conjointement l'allocation des ressources et les stratégies de service à travers des GPU cloud diversifiés, réalisant une réduction des coûts allant jusqu'à 2,79 fois et un débit utile supérieur de 2,39 fois grâce à l'utilisation d'une décomposition en deux étapes sans perte permettant une prise de décision rapide et quasi optimale.

Auteurs originaux : Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi

Publié 2026-05-07
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yixuan Mei, Zikun Li, Zixuan Chen, Shiqi Pan, Mengdi Wu, Xupeng Miao, Zhihao Jia, K. V. Rashmi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous gérez une immense cuisine de restaurant haut de gamme. Autrefois, tout le monde pensait qu'il fallait le chef le plus cher et le plus performant, ainsi que le plus grand et le plus rapide des fours, pour préparer chaque plat. Mais dans le monde des grands modèles de langage (LLM) — les cerveaux d'IA derrière les chatbots et les générateurs de code — les choses ont changé. Aucun « modèle d'IA » unique n'est le meilleur en tout. Certains excellent dans l'écriture de code, d'autres dans la conversation, et certains sont simplement bons pour des tâches simples.

De plus, la « cuisine » (les serveurs cloud) est un chaos d'équipements variés. Vous disposez de fours « H100 » ultra-rapides et coûteux, mais ils sont souvent en rupture de stock. Vous avez aussi des fours « L4 » ou « A100 » plus anciens et moins chers, disponibles et, étonnamment, offrant tout autant de puissance de cuisson pour le dollar investi.

Le problème est le suivant : Comment gérer une cuisine avec 46 recettes différentes (modèles) en utilisant un mélange de fours coûteux et bon marché, sans gaspiller d'argent ni faire attendre les clients ?

C'est le problème que Coral résout.

L'ancienne méthode : l'erreur du « taille unique »

Les systèmes précédents tentaient de résoudre ce problème en traitant chaque plat comme une boîte noire. Ils disaient : « Pour le plat d'écriture de code, nous avons besoin d'un four H100 entier. Pour le plat de conversation, nous avons besoin d'un A100. » Ils ne regardaient pas à l'intérieur de la recette pour voir s'ils pouvaient combiner des parties du four.

Cela a conduit à deux grands problèmes :

  1. Gaspillage d'argent : Ils achetaient souvent l'équipement le plus cher, même lorsqu'un mélange moins coûteux aurait fonctionné tout aussi bien.
  2. Goulots d'étranglement : Si les fours coûteux venaient à manquer, toute la cuisine s'arrêtait, même s'ils disposaient de nombreux fours moins chers restés inactifs.

La solution Coral : le chef « mélange intelligent »

Coral est comme un chef étoilé génial qui réalise qu'un seul plat n'a pas besoin d'être cuit sur un seul type de four. Au lieu de cela, Coral décompose le processus de cuisson en étapes et assigne le four parfait à chaque étape.

Voici comment cela fonctionne, en utilisant une analogie simple :

1. La stratégie en deux étapes (Hors ligne vs En ligne)

Coral divise sa réflexion en deux parties pour éviter d'être submergé :

  • Étape 1 : Le livre de recettes (Hors ligne)
    Avant l'ouverture du restaurant, Coral consacre du temps à créer un immense « Livre de recettes ». Pour chaque plat possible (modèle) et chaque combinaison possible de fours (GPU), il calcule la meilleure façon absolue de le cuire.

    • Exemple : Il détermine que pour le plat « Qwen-3 235B », la meilleure façon de cuire la première partie (préremplissage) consiste à utiliser trois fours L40S bon marché et deux fours H100 coûteux, disposés dans une ligne spécifique.
    • Il consigne ces « recettes » parfaites sous forme de Modèles de Service. Cela prend beaucoup de temps à réaliser, mais cela ne doit se produire qu'une seule fois.
  • Étape 2 : Le service quotidien (En ligne)
    Lorsque le restaurant ouvre et que les commandes commencent à arriver, Coral ne s'arrête pas pour réfléchir à la façon de cuisiner à partir de zéro. Il consulte simplement son Livre de recettes.

    • Il vérifie : « Nous avons 5 L40 et 2 H100 disponibles actuellement. Nous devons cuire 100 plats Qwen-3. »
    • Il sélectionne instantanément la recette précalculée qui correspond à ces fours spécifiques et répond aux exigences de rapidité du client.
    • Parce que les calculs complexes ont été effectués à l'avance, Coral peut prendre ces décisions en secondes, et non en heures. Cela permet à la cuisine de s'adapter instantanément si un four tombe en panne ou si une nouvelle vague de commandes arrive.

2. L'analogie du « travail d'équipe »

Imaginez que vous avez deux équipes de travailleurs (deux modèles d'IA différents) et un stock limité d'outils (GPU).

  • L'ancienne méthode : L'équipe A s'empare de tous les meilleurs outils parce qu'ils sont l'équipe « la meilleure ». L'équipe B se retrouve avec des outils cassés et ne peut pas terminer son travail.
  • La méthode de Coral : Coral examine la situation dans son ensemble. Il réalise que l'équipe A peut en fait accomplir son travail tout aussi bien avec un mélange d'outils bons et moyens si elle réorganise son flux de travail. Cela libère les meilleurs outils pour l'équipe B. Les deux équipes terminent leur travail à temps, et aucun outil n'est gaspillé.

Pourquoi cela compte

L'article a testé Coral avec 6 modèles d'IA différents et 20 types de puces informatiques différentes (GPU). Les résultats ont été impressionnants :

  • Moins cher : Coral a réduit le coût d'exécution de ces modèles d'IA jusqu'à 2,79 fois par rapport aux meilleures méthodes existantes. C'est comme payer 100 $ pour un repas et ne payer que 36 $ pour la même qualité.
  • Plus rapide (lorsque les ressources sont rares) : Lorsque la « cuisine » est bondée et que les outils sont difficiles à trouver, Coral a réussi à servir 2,39 fois plus de clients que la concurrence sans ralentir.

En résumé

Coral est un système qui cesse de traiter les modèles d'IA comme des machines rigides et monolithiques. Au lieu de cela, il les traite comme des recettes flexibles pouvant être cuites sur un mélange d'équipements anciens et nouveaux. En planifiant le « mélange parfait » à l'avance puis en l'appliquant rapidement en temps réel, il économise d'énormes sommes d'argent et maintient l'IA en fonctionnement fluide, même lorsque l'approvisionnement en matériel est instable.

En bref : Coral est le gestionnaire avisé qui sait comment utiliser un mélange d'outils coûteux et bon marché pour accomplir le travail plus vite et moins cher que quiconque.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →