Cascade: Exploiting SLO-Aware latency budget for fair and high goodput LLM inference serving
Cascadeは、リクエストごとに動的なレイテンシ予算を活用してスケジューリングとKVキャッシュ管理を共同で最適化することで、従来の先着順アプローチと比較して、SLOを満たすグッドスループットと公平性を大幅に向上させつつ、違反を減少させるLLMサービングシステムである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
活気あふれる、高速鉄道の駅を想像してみてください。そこでは何千人もの乗客が、同時に異なる列車に乗り込もうとしています。バックパック一つだけ(短く、素早い質問)を持つ乗客もいれば、長年の思い出が詰まった巨大で重いスーツケース(長く複雑なストーリーや深い推論タスク)を引きずっている乗客もいます。人工知能の世界において、これらの「列車」は大規模言語モデル(LLM)です。これらはチャットボット、コーディングアシスタント、推論エージェントを動かす超スマートなコンピュータです。「乗客」は、私たちが彼らに送るリクエストです。
これらのシステムが速く、かつ役に立つと感じられるためには、サービスレベル目標(SLO)として知られる特定の制限時間内に回答を提供することを約束しなければなりません。これは、「5秒以内に列車に乗り込み、出発しなければならない」と書かれたチケットのようなものです。問題は、駅のマネージャーたちが「先着順」という非常に古いルールを使っていることです。これは、もし巨大なスーツケースを持った乗客が最初に到着した場合、たとえその後ろの人がバックパック一つだけで一瞬で処理できるとしても、全員がその人の後ろで待たなければならないことを意味します。これにより、大規模な交通渋滞が発生します。さらに、駅には乗客の荷物を保管するための限られた量の高速ストレージ(VIP待合室のようなもの)があります。もし荷物が遅くて遠い倉庫に保管されていると、それを取り出すのに時間がかかります。もし駅のマネージャーが、各乗客の列車が出発するまでにあとどれくらいの時間があるのかを知らなければ、すでに遅刻している人のために貴重な数秒を無駄にしてしまう一方で、間に合っている他の誰かが取り残されてしまうかもしれません。
これは、ブリティッシュコロンビア大学、マイクロソフト・アズール・リサーチ、およびNVIDIAの研究者による最近の論文で説明されている、CASCADEと呼ばれる新しいシステムによって取り組まれている課題です。研究者たちは、すべてのリクエストには隠れた「タイムバジェット(時間の予算)」、つまり、その仕事が完了する必要がある時刻と、許容される時間の差があることに気づきました。リクエストには、膨大なバジェット(たっぷりの余剰時間)を持つものもあれば、ほとんどないものもあります。論文は、単に誰が先に到着したか、あるいはリクエストがいかに大きいかを見るのではなく、システムはこの「残り時間の予算」を見て、次に誰を優先すべきか、そして彼らのデータをどのように扱うべきかを決定すべきだと主張しています。
CASCADEの核心となるアイデアは、このタイムバジェットを、リクエストの順序決定とデータの所在管理という2つの異なるジョブのための「共通の通貨」として扱うことです。論文のシミュレーションでは、プロダクションサーバーからの実際のトラフィックデータを使用し、3つの異なる巨大なAIモデル(Qwen-2.5-72B、Llama-3-70B、Llama-3-405B)でテストを行いました。CASCADEは、各リクエストに残された「タイムヘッドルーム(時間の余裕)」を常に計算することで、時間が切れそうなリクエストを優先し、一方で時間に余裕があるリクエストには少し待ってもらったり、より低速で安価なストレージからデータを取得させたりすることができました。
この結果は、このアプローチが効率性の面でゲームチェンジャーであることを示唆しています。テストにおいて、CASCADEはvLLMのような普及しているシステムで使用されている標準的な「先着順」の方法と比較して、システムが処理できる成功リクエスト数(グッドスループット)を最大2.4倍向上させました。さらに重要なことに、SLO違反(制限時間の超過)の数を**40%**削減しました。おそらく最も独創的な点は、CASCADEが長い、複雑なリクエストを犠牲にすることなくこれを実現したことです。短いリクエストを急いで長いリクエストを飢えさせるような他の手法とは異なり、CASCADEは「バックパック」の乗客と「巨大なスーツケース」の乗客の両方が予定通りにサービスを受けられるよう、公平性を保ちました。システムは、特定の要求が遅延を吸収できるだけのタイムバジェットを持っているかに基づいて、データを高速メモリから取得するか、低速ストレージから取得するか、あるいは単に再計算するかを動的に決定することで、これを達成したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。