Provisioning to Runtime Optimization of a +100 MW AI Cluster
本論文は、超規模 AI データセンターにおける電力管理の最初のエンドツーエンドの記述を提示し、次世代アクセラレータ向けの初期電力計画から、83,000 個の GB200 GPU を搭載した 150 MW 施設のランタイム最適化に至るプロセスを詳述する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
世界最大の超高性能コンピューターを構築し、人工知能における最も困難な問題を解決しようとしていると想像してみてください。あなたは購入可能な最速のコンピューターチップ(GPU)を数千枚調達しました。しかし、一つの問題があります:それらをすべてフル速度で動作させるのに十分な電力がないのです。
実際、この論文は、チップの不足よりも電力不足が現在より大きな問題であると主張しています。100 台のレーシングカーの車隊を持っているのに、その半分しか給油できないようなものです。
この論文は、メタ(Facebook の親会社)が 150 メガワットの巨大データセンターにおいてこの問題をどのように解決したかを説明しています。彼らは単にすべてを接続して最善を祈るのではなく、電力を管理すべき貴重で限られた資源として扱い、3 つの明確な段階で管理しました。
以下に、彼らがどのように行ったかを、簡単なアナロジーを用いて物語ります。
電力管理の 3 つの段階
著者らはこのプロセスを 3 つのフェーズに分解しています:計画(Planning)、確認(Checking)、そして**実行(Running)**です。
フェーズ 1:計画(「予算管理」フェーズ)
コンピューターが到着する前から、チームは固定された電力予算の中に何台収容できるかを計算しなければなりませんでした。
- 従来の方法: 通常、エンジニアはチップの「最大速度」(熱設計電力、TDP)を見て、それが常に消費される電力であると仮定します。チップが 1,200 ワットと定格されていれば、1,200 ワットを計画します。
- メタの方法: 彼らは、すべてのチップを絶対的な最大値で動作させれば、建物内に収められるチップ数はごくわずかになることに気づきました。代わりに、彼らはこう問いかけました:「もしすべてのチップをわずかに遅く動作させたらどうなるか?」
- アナロジー: 固定された量の食べ物があるビュッフェを想像してください。
- 戦略 A: 全員に巨大な 10 皿コースの食事を提供する。すると 50 人しか食事が提供できない。
- 戦略 B: 全員にわずかに少ない 8 皿コースの食事を提供する。すると 60 人を食事にありつけさせることができる。
- 結果: 一人あたりの食事はわずかに減りましたが、グループ全体で消費された食料の総量は増加し、より多くの人々が食事を済ませることができました。
- 発見: 彼らは、各 GPU の電力制限を 1,200 ワットから約 1,000 ワットに下げることで、データセンターにより多くの GPU を収容できることを発見しました。個々のチップのわずかな速度低下は、より多くのチップが協力して動作することによって完全に補われました。これにより、総計算能力が10% 向上しました。
フェーズ 2:確認(「現実確認」フェーズ)
コンピューターが設置されると、チームは計画が現実と完全に一致していないことに気づきました。
- 問題: コンピューター内部の電力計(PSU)が嘘をついていました。それらは過度に慎重で、実際よりも多くの電力を消費していると報告していました。まるで、まだ 1/4 タンク残っているのに、常に「空」と表示される車の燃料計のようです。
- 解決策: 彼らは内部のメーターを、非常に正確な建物のメイン電力センサーと比較しました。その結果、「最悪のケース」の読み取り値を無視し、「平均」の使用量(具体的には 70 パーセンタイル)を見ることで、数値をより信頼できることがわかりました。
- 結果: 過度に慎重な内部メーターを信頼しなくなったため、彼らは使用していなかったわずかな「隠れた」電力があることに気づきました。彼らは電力をわずかに上げ(1,000W から 1,020W に)、さらに2% のパフォーマンス向上を引き出しました。
フェーズ 3:実行(「交通整理」フェーズ)
現在、データセンターはライブの AI 学習ジョブを実行しています。問題は、AI ワークロードが「同期型」であることです。つまり、すべてのチップが互いを待たなければなりません。もし一つのチップが遅ければ、ジョブ全体が遅くなります。
- 問題: 時々、電力網に急激なスパイクが発生します。システムがスパイクを検出すると、従来の方法は電力を節約するために、特定の 1 つのチップを即座に停止または減速させるものでした。しかし、同期されたレースにおいて、一人のランナーを遅くすれば、チーム全体が負けてしまいます。
- 解決策(ディマー): 彼らは「Dimmer」と呼ばれるスマートシステムを構築しました。一つのチップを罰するのではなく、ジョブ内のすべてのチップの電力を、小さく均等な量だけ優しく下げます。
- アナロジー: リレーレースをしているランナーのグループを想像してください。もしトラックが滑りやすくなったら(電力制限)、一人のランナーを転ばせる(それはチーム全体を停止させます)のではなく、コーチが全員にほんの少しだけ遅く走るよう伝えます。チームはまとまり、レースは停止することなく続行されます。
- 結果: これによりシステムのクラッシュを防ぎ、以前は浪費されていた最後の数パーセントの「 stranded(行き場を失った)」電力を利用できるようになりました。これによりさらに約 2% の向上が得られました。
その他の重要な洞察
- 「ボトルネック」効果: データセンターは、さまざまなハードウェア(コンピューター、冷却装置、ネットワークスイッチ)の組み合わせです。時々、電力制限はコンピューターによって設定されるのではなく、冷却システムやネットワークケーブルによって設定されます。チェーンの一部分が弱ければ、それがチェーン全体を制限します。
- 電力の揺らぎ: AI チップが動作する際、互いに通信するために一瞬停止することがあり、電力使用量が低下した後にスパイクします。チームは、これらの微小な隙間をダミーの作業で埋める「ソフトウェア・スムーザー」を作成し、電力使用量を荒れた海ではなく、穏やかな川のように一定に保ちました。これにより、建物の電力網への衝撃から守ります。
- 新しいほど良い: 彼らは新しいチップ(GB200)と古いチップ(H100)を比較しました。新しいチップは非常に効率的で、チップあたりの電力消費は少ないにもかかわらず、同じ建物内で運用した場合、新しいクラスターは古いクラスターのほぼ 2 倍の速度を誇ります。
結論
電力を固定された制限ではなく、柔軟な資源として扱い、計画段階から日常運用まで慎重に管理することで、メタは新しい壁を一つも建てず、新しいケーブルを一本も購入することなく、150 メガワットのデータセンターから約 14% 多くの計算能力を引き出すことに成功しました。
彼らは魔法のバッテリーを見つけましたのではありません。彼らが学んだのは、すでに持っている電力をより賢く使う方法でした。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。