← 最新の論文
💻 computer science

Astrolabe: Balancing Load in LLM Serving with Randomized Prediction-Guided Scheduling

Astrolabeは、応答長の推定、シミュレーションに基づくレイテンシ予測、および2つの選択肢に基づくディスパッチ・ポリシーを組み合わせることで、コストのかかるマイグレーションベースの再バランシングを不要にし、優れたロードバランシングとレイテンシ削減を実現する、マルチインスタンスLLMサービングのためのランダム化された予測誘導型スケジューラである。

原著者: Wei Da, Evangelia Kalyvianaki

公開日 2026-08-12
📖 1 分で読めます☕ さくっと読める

原著者: Wei Da, Evangelia Kalyvianaki

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、何百万人もの顧客のために「ソート・ケーキ(思考のケーキ)」を焼く、非常に高度な技術を用いた巨大なハイテク・ベーカリーを運営していると想像してください。このベーカリーでは、オーブンは非常に強力ですが、レシピが非常にトリッキーです。時には、顧客がシンプルなクッキー(短い回答)を求めることもあれば、時には10層のウェディングケーキ(長く複雑な回答)を求めることもあります。問題は、パン屋の職人(コンピュータ)は、焼き始めるまでその注文がどれほどの大きさになるのかを知らないということです。もし、ある職人が巨大な注文を引き受けてしまい、他の職人たちが暇を持て余している状態になると、行列が滞ってしまいます。そして、顧客は怒り出します。

これを解決するために、多くのベーカリーでは以前、「ランナー(走者)」がオーブンの間を走り回り、焼きかけのケーキを掴み取っては、より空いているオーブンへと移動させていました。これは「マイグレーション(移行)」と呼ばれます。しかし、人工知能の世界において、こうした焼きかけのケーキを移動させることは、厄介で時間がかかる作業です。それはまるで、巨大で壊れやすく、半分凍ったケーキを、混雑した部屋の中を運ぶようなものです。エネルギーを大量に消費し、通路を塞ぎ、結果としてベーカリー全体の動きを遅らせてしまうことがよくあります。この論文「Astrolabe」は、大胆な問いを投げかけています。「そもそも、ケーキを移動させる必要はないのではないか?注文がオーブンに届く前に、そのサイズを予測して、最初から適切な職人に送ってしまうことはできないだろうか?」

ケンブリッジ大学のウェイ・ダ(Wei Da)とエヴァンジェリア・カリヴィアナキ(Evangelia Kalyvianaki)は、まさにこの問題を解決するために、「Astrolabe」と呼ばれる新しいシステムを構築しました。彼らは、作業をあちこちでシャッフルするために慌てて走り回る代わりに、巧妙な「推測ゲーム」を用いることで、注文を即座に適切な場所へ送ることができると発見しました。

Astrolabeがどのように機能するかを、単純な確率のゲームを使って説明しましょう。あなたは1ダースの職人を持っているとします。新しい注文が入ってきたとき、すべての職人に「今、この注文を受け取ったらどれくらい時間がかかりますか?」と尋ねる(これでは時間がかかりすぎます)代わりに、あるいは単にランダムに一人を選ぶ(これはリスクがあります)代わりに、システムはランダムに2人の職人を選びます。そして素早く、「もし今この注文を受け取ったら、どのくらい時間がかかりますか?」と尋ねます。一人が「約10秒です」と言い、もう一人が「約50秒です」と言ったとします。システムは即座に、10秒の方の職人を選び、そこに注文を送ります。

このトリックは「2つの選択肢の力(power-of-two choices)」と呼ばれています。これは、混雑した食堂に入り、部屋全体をスキャンするのではなく、たった2つの列だけをチェックして、一番短い列を選ぶようなものです。論文によれば、この単純なランダムチェックは驚くほど強力です。この手法を、「水晶玉(予測モデル)」——つまり、AIの回答がどのくらいの長さになるかを推測するもの——と組み合わせることで、Astлоbeは行列ができ始める前に、リクエストを最適な職人のもとへとルーティングできるのです。

結果は極めて素晴らしいものです。テストにおいて、Astrolabeは従来の「ランナー」方式(マイグレーション)と同じ量のリクエストを処理しながら、データを移動させる際の煩わしいオーバーヘッドなしで実現しました。実際、ベーカリーが非常に忙しくなったとき、旧来の手法は崩壊し始め、待ち時間が数秒から数分へと跳ね上がりました。しかし、Astloreはスムーズな状態を維持しました。Astloreは、回答の最初の言葉が出るまでの時間を、いくつかのケースで最大77%短縮し、注文が中断・再開される回数を競合と比較して約6分の1に抑えました。

また、この論文は「水晶玉」が完璧ではない場合に何が起こるかもテストしています(現実の世界では予測が外れることはよくあります)。たとえ予測が多少ずれていたとしても、システムは従来の方法よりも優れた働きを見せました。システムは一度に2人の職人を比較することしかしないため、推測における小さなミスは、思っているほど大きな影響を与えないことが判明しました。もし両方の職人が「遅い」と予測されたとしても、システムは単に「より遅くない方」を選ぶだけであり、数学的な仕組みは成立するのです。

著者たちはまた、オーブンの種類や焼かれるケーキの種類が変わった場合でも、これが機能するかどうかを検証しました。彼らは異なるモデルや設定を試しましたが、Astloreは勝ち続けました。この「推測して確認する」アプローチは、ワークロードが混沌としていて予測不可能な状況であっても、AIシステムを高速に稼働させ続けるための堅牢な方法であるようです。

要約すると、この論文は、負荷を分散させるために複雑で重厚なシステムを構築する必要はないことを示唆しています。代わりに、少しのランダム性と、未来に対する優れた推測があれば、より迅速かつ効率的に目的を達成できるのです。これは、群衆を管理する最も賢い方法は、一人ひとりを細かく管理することではなく、いくつかの優れた選択肢を与えて、最適な道を選ばせることであるという教訓を与えてくれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →