← 最新の論文
🤖 machine learning

Cost-aware Duration Prediction for Software Upgrades in Datacenters

本論文は、非対称な誤予測コストとストラグラー効果を解決することでデータセンターにおけるソフトウェアアップグレードのスケジューリングを最適化し、Meta の本番システムにおいて効率性、スループットの大幅な向上およびキャンセル率の低減をもたらすコスト意識型継続時間予測フレームワーク「Acela」を紹介する。

原著者: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

公開日 2026-05-19
📖 1 分で読めます☕ さくっと読める

原著者: Yi Ding, Aijia Gao, Thibaud Ryden, Michal Sedlak, Essam Ewaisha, Igor Marnat, Henry Hoffmann

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大なデータセンターを、数百万台のサーバーがひしめく活気ある大都市だと想像してみてください。これらのサーバーは、お気に入りのアプリや動画、検索を動かす働き者です。しかし、どんな機械と同様、安全かつ高速に動作し続けるためには、定期的なメンテナンスとソフトウェアの更新が必要です。

問題は、これらのサーバーを更新するのが難しいことです。すべてを一度に更新しようとすれば、都市は完全に停止してしまいます。逆に、更新を遅すぎれば、永遠に終わらないことになります。メタ(Facebook や Instagram などを運営する会社)のデータセンター運営者は、非常に慎重な姿勢をとってきました。つまり、すべての更新が可能な限り最長の時間を要すると想定していたのです。

問題:「最悪のケース」による交通渋滞
これは、乗客のほとんどが 30 秒で乗車するのに、運転手が「すべての乗客が 10 分かかる」と想定しているようなバス運転手に似ています。運転手が過度に慎重であるため、バスは何時間も停車したままになり、時間と燃料が無駄に消費されます。

データセンターでは、この「最悪のケース」思考により、「更新ウィンドウ」(更新のために確保された特定の時間枠)が実際に使用されていたのは 20〜40% だけでした。多くの潜在的な作業機会が見過ごされ、すべてのサーバーを更新するには、はるかに多くのサイクルが必要でした。

解決策:スマートな交通制御者「Acela」
この論文では、Acelaと呼ばれる新しいシステムが紹介されています。Acela は単に推測するだけでなく、個々のサーバーごとの特定の更新に正確にどれだけの時間がかかるかを予測する、超スマートな交通制御者だと考えてください。

ただし、ここには注意点があります。Acela は数学の授業のような意味での「正確さ」を目指しているのではありません。それはコストを考慮したアプローチを目指しているのです。

  • 過小予測(更新に 10 分かかると予測して実際には 20 分かかる)は危険です。サーバーが期限を逃し、更新が失敗し、全体のスケジュールが混乱します。
  • 過大予測(更新に 20 分かかると予測して実際には 10 分)は安全です。サーバーは早めに完了しますが、ウィンドウは少しだけ遊んでしまいます。

Acela は、少し「安全側」(過大予測)に振ることは、「リスク」(過小予測)よりも優れていると理解しています。これは**Quantile Regression(分位数回帰)**と呼ばれる特別な数学的トリックを用いて、平均よりも少し長い時間を意図的に予測し、クラッシュを引き起こすことなく作業を期限内に完了させることを保証します。

Acela の仕組み(秘密のソース)

  1. 過去から学ぶ:Acela は、数百万件の過去の更新データを見てパターンを学習します。
  2. 「変わり者」を無視する:時々、サーバーにハードウェアの欠陥があり、更新に永遠に時間がかかる(「ストラグラー」と呼ばれる)ことがあります。Acela がこれらの欠陥から学習すれば、すべての更新が永遠に時間がかかると予測し始めてしまいます。そこで Acela は、学習前にこれらの極端な外れ値を賢くフィルタリングし、過度に保守的になることを防ぎます。
  3. 最良の予測を選ぶ:Acela はさまざまな予測戦略を試して、失敗率を低く保ちつつ、最も多くの更新を完了できるものを選びます。

結果:より速く、スムーズな都市
研究者がメタの実際のデータセンターで Acela をテストしたところ、その結果は印象的でした。

  • 時間の有効活用:同じ時間内で1.25 倍多くの作業を完了できました。更新ウィンドウはついに効率的に利用されるようになりました。
  • 更新数の増加:更新のスケジュールを33% 多く組むことが可能になり、成功して完了した更新数も41% 増加しました。
  • 失敗の減少:より多くの作業を行っていたにもかかわらず、失敗またはキャンセルされた更新の数は2.4 倍減少しました。95% の更新が時間通りに完了するという安全目標を、はるかに確実に達成しました。

要約
Acela 以前、データセンターは遅延を恐れて渋滞に巻き込まれ、ゆっくりとしか進めない慎重な運転手のような状態でした。Acela は、すべての移動に正確にどれだけの時間がかかるかを知っている GPS のようなものです。これにより、運転手は時間を浪費することなく、一日に多くの移動をこなすことができます。Acela は、スピードの必要性と安全性の必要性のバランスを取り、システム全体をはるかにスムーズに動作させます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →