← Derniers articles
🤖 AI

Position: LLM Serving Needs Mathematical Optimization and Algorithmic Foundations, Not Just Heuristics

Ce document de position soutient que la mise en œuvre de l'inférence des LLM a dépassé les heuristiques génériques et nécessite le développement de modèles d'optimisation mathématique et de fondements algorithmiques adaptés à ses caractéristiques uniques afin de garantir des performances prouvables sur des charges de travail diversifiées.

Auteurs originaux : Zijie Zhou

Publié 2026-05-06
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zijie Zhou

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous gérez une immense cuisine de restaurant à très haute vitesse. Cette cuisine ne se contente pas de cuire des hamburgers ; elle prépare des repas complexes à plusieurs plats, basés sur des commandes qui arrivent une par une. Le hic ? Vous ne savez pas combien de temps chaque repas prendra à cuire, et plus le chef cuisine, plus le repas occupe d'espace sur le comptoir, encombrant les autres commandes.

C'est exactement la situation des Modèles de Langage à Grande Échelle (LLM) aujourd'hui. Ils sont les « cuisines » qui alimentent les moteurs de recherche, les assistants de codage et les chatbots.

L'article soutient qu'à l'heure actuelle, ces cuisines numériques fonctionnent sur la devinette et des règles simples (des heuristiques). L'auteur estime qu'il est temps de passer à la précision mathématique et à des fondations algorithmiques solides pour les rendre plus rapides, moins chers et plus fiables.

Voici la décomposition de l'argument de l'article en utilisant des analogies du quotidien :

1. Le Problème : Des règles « assez bonnes » qui échouent

Actuellement, des systèmes comme vLLM et SGLang (le logiciel qui fait fonctionner ces modèles) utilisent d'anciennes règles empruntées à l'informatique générale.

  • La File d'attente : Si vous avez une file de clients, la cuisine les sert simplement dans l'ordre d'arrivée (Premier arrivé, premier servi).
  • Le Routage : Si vous avez plusieurs chefs, la cuisine envoie la prochaine commande au chef ayant la file la plus courte, ou fait simplement tourner une roue pour en choisir un.
  • Le Nettoyage : Si le comptoir est plein, la cuisine jette l'objet le plus ancien du comptoir pour faire de la place à un nouveau.

Le point de l'article : Ces règles fonctionnent bien pour un restaurant de hamburgers standard. Mais les LLM sont étranges.

  • Le repas « grandissant » : Contrairement à un hamburger qui occupe le même espace du début à la fin, un repas LLM grandit au fur et à mesure qu'il est cuit. Chaque mot généré par l'IA occupe davantage de mémoire.
  • La cuisson en « deux phases » : La première partie de la commande (la lecture de l'invite) est rapide et nécessite beaucoup de puissance de calcul. La seconde partie (la génération de la réponse) est lente et nécessite beaucoup de bande passante mémoire.
  • L'inconnu : La cuisine ne sait pas combien de temps durera le repas tant qu'il n'est pas terminé.

À cause de ces bizarreries, les anciennes règles du « file la plus courte » ou « jeter l'objet le plus ancien » provoquent souvent le chaos, laissant certains chefs inactifs tandis que d'autres sont submergés, ou entraînant un manque d'espace sur le comptoir de manière imprévue.

2. La Solution : Faire appel aux mathématiciens

L'auteur dit qu'il faut arrêter de deviner et commencer à utiliser l'optimisation mathématique. Imaginez cela comme embaucher un planificateur logistique de maître qui utilise un superordinateur pour calculer la façon parfaite de faire fonctionner la cuisine, plutôt que de simplement suivre un manuel de règles.

L'article met en évidence quatre domaines spécifiques où les mathématiques peuvent réparer la cuisine :

  • Équilibrer les chefs (Équilibrage de charge) :

    • Façon actuelle : Envoyer les commandes au chef ayant le moins de tickets.
    • Façon mathématique : Calculer exactement combien d'« espace comptoir » et de « puissance de calcul » chaque commande nécessitera au fur et à mesure qu'elle grandit, et les distribuer de sorte qu'aucun chef unique ne reste bloqué à attendre le plus lent. L'article cite un système réel (DeepSeek) qui utilise la Programmation Linéaire (un type de mathématiques) pour faire cela parfaitement, économisant du temps et de l'argent.
  • La File d'attente (Ordonnancement) :

    • Façon actuelle : Servir la première personne de la file.
    • Façon mathématique : Regarder la file et réaliser : « Cette personne a commandé un essai de 10 pages, mais la suivante ne veut qu'une blague d'une phrase. » Servir la blague en premier ! Cela libère le comptoir plus vite et permet à plus de gens de manger. Les mathématiques peuvent prédire quelles commandes se termineront rapidement pour maintenir la cuisine en mouvement.
  • L'espace du comptoir (Mise en cache) :

    • Façon actuelle : Jeter l'objet le plus ancien lorsque le comptoir est plein.
    • Façon mathématique : Réaliser que jeter une « vidéo haute résolution » pour faire de la place à une « miniature toute petite » est une mauvaise affaire. Refaire la vidéo prend une éternité et coûte une fortune. Les mathématiques peuvent calculer le « coût » de jeter des choses et garder les objets coûteux sur le comptoir.
  • Planifier le personnel (Planification des capacités) :

    • Façon actuelle : Continuer à ajouter des chefs lorsque la file devient trop longue.
    • Façon mathématique : Utiliser des formules pour savoir exactement combien de chefs vous avez besoin avant même d'ouvrir les portes, en fonction du nombre de clients attendus. Cela empêche la cuisine d'être submergée dès le départ.

3. Pourquoi s'en tenir simplement aux règles ?

L'article s'adresse aux sceptiques qui disent : « Les règles actuelles fonctionnent bien, pourquoi changer ? »

  • « Ça fonctionne à grande échelle » : L'auteur admet que les règles actuelles fonctionnent correctement, mais elles sont fragiles. Si une application virale envoie soudainement un type de commande étrange, la cuisine pourrait s'effondrer. Les mathématiques fournissent un filet de sécurité (des garanties) qui assure que la cuisine ne tombera pas en panne, même dans les pires scénarios.
  • « Le matériel change trop vite » : L'auteur soutient que, bien que le matériel (les fours) change, la logique de la façon d'organiser la cuisine reste la même. Les mathématiques vous donnent un plan qui fonctionne même si vous changez les fours.
  • « L'ingénierie des systèmes est plus importante » : L'auteur dit que les mathématiques et l'ingénierie sont des partenaires. Vous pouvez avoir le four le plus rapide au monde, mais si votre ordonnancement est mauvais, le four reste inactif. Les mathématiques vous disent comment maintenir le four en activité.

4. La Grande Image

L'article conclut que le domaine du service des LLM a dépassé son « enfance » de règles simples. Il a mûri en un système complexe qui exige une surveillance adulte de la part des mathématiciens et des experts en algorithmes.

En traitant ces problèmes comme des énigmes mathématiques plutôt que de simples ajustements d'ingénierie, nous pouvons obtenir :

  1. Prévisibilité : Savoir exactement comment le système se comportera.
  2. Efficacité : Économiser d'énormes quantités d'énergie et d'argent.
  3. Fiabilité : S'assurer que le système ne s'effondre pas lorsque les choses deviennent folles.

En bref : Arrêtez de deviner. Commencez à calculer. L'avenir du service des IA ne consiste pas seulement à construire des modèles plus grands ; il s'agit de construire des façons plus intelligentes, prouvées mathématiquement, de les faire fonctionner.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →