← Derniers articles
⚡ electrical engineering

Provisioning to Runtime Optimization of a +100 MW AI Cluster

Ce document présente le premier compte rendu de bout en bout de la gestion de l'énergie pour un centre de données d'IA à hyper-échelle, détaillant le processus depuis la planification précoce de l'alimentation pour les accélérateurs de nouvelle génération jusqu'à l'optimisation en temps réel d'une installation de 150 MW hébergeant 83 000 GPU GB200.

Auteurs originaux : Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valent
Publié 2026-05-26
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Ehsan K. Ardestani, Leonardo Piga, Jovan Stojkovic, Pavan Balaji, Mustafa Ozdal, Mikel Jimenez Fernandez, Mihaela Dimovska, Luka Tadic, Hao Shen, Devika Vishwanath, Richa Mishra, Melaku Mihret, Valentin Andrei, Mauricio Cespedes, Julien Prigent, James Monahan, Tyler Graf, Bin Li, Charles Marquez, Shobhit Kanaujia, Kaushik Veeraraghavan, Chunqiang Tang

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de construire le plus grand et le plus puissant supercalculateur au monde pour résoudre les problèmes les plus difficiles de l'intelligence artificielle. Vous avez acheté des milliers des puces informatiques les plus rapides que l'argent puisse acheter (GPU). Mais il y a un piège : vous n'avez pas assez d'électricité pour les faire tous fonctionner à pleine vitesse.

En fait, l'article soutient que manquer d'électricité est désormais un problème plus grand que manquer de puces informatiques. C'est comme avoir une flotte de 100 voitures de course mais seulement assez d'essence pour en remplir la moitié.

Cet article décrit comment Meta (la société derrière Facebook) a résolu ce problème pour un centre de données massif de 150 mégawatts. Ils n'ont pas simplement branché tout le monde et espéré le meilleur ; ils ont traité l'électricité comme une ressource précieuse et limitée devant être gérée en trois étapes distinctes.

Voici l'histoire de comment ils l'ont fait, en utilisant des analogies simples.

Les Trois Étapes de la Gestion de l'Électricité

Les auteurs décomposent le processus en trois phases : Planification, Vérification et Exécution.

Phase 1 : Planification (La phase de « Budgetisation »)

Avant même que les ordinateurs n'arrivent, l'équipe devait déterminer combien ils pouvaient en faire entrer dans leur budget électrique fixe.

  • L'Ancienne Méthode : Habituellement, les ingénieurs regardent la « vitesse maximale » d'une puce (sa Puissance de Conception Thermique, ou TDP) et supposent que c'est ce qu'elle utilisera toujours. Si une puce est évaluée à 1 200 Watts, ils prévoient 1 200 Watts.
  • La Méthode Meta : Ils ont réalisé que s'ils forçaient chaque puce à fonctionner à son maximum absolu, ils ne pourraient en installer que quelques-unes dans le bâtiment. Au lieu de cela, ils se sont demandé : « Et si nous faisions fonctionner toutes les puces légèrement moins vite ? »
  • L'Analogie : Imaginez un buffet avec une quantité fixe de nourriture.
    • Stratégie A : Donnez à chacun un repas massif de 10 plats. Vous ne pouvez nourrir que 50 personnes.
    • Stratégie B : Donnez à chacun un repas légèrement plus petit de 8 plats. Maintenant, vous pouvez nourrir 60 personnes.
    • Le Résultat : Même si chaque personne a reçu un peu moins de nourriture, la quantité totale de nourriture consommée par le groupe est plus élevée, et plus de personnes sont nourries.
  • La Découverte : Ils ont constaté qu'en abaissant la limite de puissance de chaque GPU de 1 200 Watts à environ 1 000 Watts, ils pouvaient installer beaucoup plus de GPU dans le centre de données. La légère baisse de vitesse pour chaque puce individuelle était plus que compensée par le fait d'avoir plus de puces travaillant ensemble. Cela leur a donné un saut de 10 % dans la puissance de calcul totale.

Phase 2 : Vérification (La phase de « Réalité »)

Une fois les ordinateurs installés, l'équipe a réalisé que leurs plans ne correspondaient pas parfaitement à la réalité.

  • Le Problème : Les compteurs de puissance internes des ordinateurs (PSU) mentaient. Ils étaient excessivement prudents, signalant que les machines consommaient plus d'électricité qu'elles ne le faisaient réellement. C'est comme un jauge de carburant de voiture qui indique toujours « Vide » alors qu'il reste encore un quart de réservoir.
  • La Solution : Ils ont comparé les compteurs internes aux capteurs principaux du bâtiment (qui sont très précis). Ils ont constaté que s'ils ignoraient les lectures « au pire des cas » et regardaient la consommation « moyenne » (spécifiquement le 70e percentile), ils pouvaient faire davantage confiance aux chiffres.
  • Le Résultat : Parce qu'ils ont cessé de faire confiance aux compteurs internes excessivement prudents, ils ont réalisé qu'ils avaient un peu de puissance « cachée » qu'ils n'utilisaient pas. Ils ont légèrement remonté la puissance (de 1 000 W à 1 020 W), extrayant un autre gain de performance de 2 %.

Phase 3 : Exécution (La phase de « Agent de Circulation »)

Maintenant, le centre de données exécute des tâches d'entraînement d'IA en direct. Le problème est que les charges de travail d'IA sont « synchrones », ce qui signifie que toutes les puces doivent attendre les autres. Si une puce est lente, tout le travail ralentit.

  • Le Problème : Parfois, le réseau électrique subit une pointe soudaine. Si le système détecte une pointe, l'ancienne méthode consistait à immédiatement éteindre ou ralentir une puce spécifique pour économiser de l'énergie. Mais dans une course synchronisée, si vous ralentissez un coureur, toute l'équipe perd.
  • La Solution (Gradateur) : Ils ont construit un système intelligent appelé « Dimmer ». Au lieu de punir une puce, il réduit doucement la puissance de toutes les puces de la tâche d'une quantité minuscule et égale.
  • L'Analogie : Imaginez un groupe de coureurs dans une course de relais. Si la piste devient glissante (limite de puissance), au lieu de faire trébucher un coureur (ce qui arrête toute l'équipe), l'entraîneur dit à tout le monde de courir juste un tout petit peu moins vite. L'équipe reste ensemble et la course continue sans s'arrêter.
  • Le Résultat : Cela empêche le système de planter et leur permet d'utiliser les derniers pourcents d'électricité « échouée » qui étaient auparavant gaspillés. Cela a ajouté un autre gain d'environ 2 %.

Autres Insights Clés

  • L'Effet « Goulot d'Étranglement » : Le centre de données est un mélange de différents matériels (ordinateurs, refroidissement, commutateurs réseau). Parfois, la limite de puissance n'est pas fixée par les ordinateurs, mais par le système de refroidissement ou les câbles réseau. Si une partie de la chaîne est faible, elle limite toute la chaîne.
  • Oscillations de Puissance : Lorsque les puces d'IA travaillent, elles s'arrêtent parfois une fraction de seconde pour se parler, ce qui fait que la consommation d'électricité plonge puis explose. L'équipe a créé un « lisseur logiciel » qui comble ces minuscules écarts avec du travail factice, maintenant la consommation d'électricité stable comme une rivière calme au lieu d'une mer agitée. Cela protège le réseau électrique du bâtiment contre les chocs.
  • Plus Récent est Mieux : Ils ont comparé leurs nouvelles puces (GB200) aux anciennes (H100). Les nouvelles puces sont si efficaces que même si elles consomment moins d'énergie par puce, le nouveau cluster est presque deux fois plus rapide que l'ancien l'aurait été dans le même bâtiment.

La Conclusion

En traitant l'électricité comme une ressource flexible plutôt que comme une limite fixe, et en la gérant soigneusement depuis la phase de planification jusqu'aux opérations quotidiennes, Meta a réussi à obtenir environ 14 % de puissance de calcul en plus de son centre de données de 150 mégawatts, sans construire un seul nouveau mur ni acheter un seul nouveau fil.

Ils n'ont pas trouvé de batterie magique ; ils ont simplement appris à utiliser l'électricité qu'ils avaient déjà beaucoup plus sagement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →