Coral: Cost-Efficient Multi-LLM Serving over Heterogeneous Cloud GPUs
Coral は、多様なクラウド GPU におけるリソース割り当てとサービング戦略を共同で最適化する、適応的かつ異質性を認識するマルチ LLM サービングシステムであり、損失のない 2 段階分解を用いて高速かつ準最適な意思決定を可能にすることで、最大 2.79 倍のコスト削減と 2.39 倍の高いグッドスループットを実現します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたが巨大で高級なレストランのキッチンを経営していると想像してください。過去には、すべての料理を調理するには、最も高価で最先端のシェフと、最大かつ最速のコンロが必要だと考えられていました。しかし、チャットボットやコード生成器の背後にあるAIの頭脳である大規模言語モデル(LLM)の世界では、状況は変わりました。すべての面で最善の「AIモデル」は存在しません。コード作成に優れたもの、会話に優れたもの、単純なタスクにのみ優れたものがあります。
さらに、「キッチン」(クラウドサーバー)は、さまざまな機器がごちゃ混ぜになっています。超高速で高価な「H100」コンロがありますが、しばしば品切れになっています。また、入手可能で、驚くべきことに1ドルあたりの調理能力も同等である、より古く安価な「L4」または「A100」コンロもあります。
問題はこれです:高価なコンロと安価なコンロを混ぜて使いながら、46種類の異なるレシピ(モデル)を運営し、お金を無駄にしたり顧客を待たせたりすることなく、どのようにキッチンを経営するか?
これがCoralが解決する問題です。
古い方法:「万能型」の過ち
従来のシステムは、すべての料理をブラックボックスとして扱うことでこの問題を解決しようとしました。「コード作成という料理には、H100コンロ全体が必要だ。会話という料理には、A100が必要だ」と言うのです。彼らはレシピの中身を見て、コンロの部品を組み合わせられないかを確認しませんでした。
これにより、2つの大きな問題が生じました:
- 費用の無駄:より安価な組み合わせでも同等に機能するにもかかわらず、最も高価な機器を購入することがよくありました。
- ボトルネック:高価なコンロが不足すると、より安価なコンロが大量に遊んでいるにもかかわらず、キッチン全体が停止してしまいました。
Coralの解決策:「賢い組み合わせ」シェフ
Coralは、単一の料理が1種類のコンロだけで調理される必要はないと気づいた天才的なヘッドシェフのようなものです。代わりに、Coralは調理プロセスを段階に分け、各段階に最適なコンロを割り当てます。
これがどのように機能するか、簡単な比喩を使って説明します:
1. 2段階戦略(オフライン対オンライン)
Coralは圧倒されないように、思考を2つの部分に分けます:
段階1:レシピ帳(オフライン)
レストランが開店する前に、Coralは膨大な「レシピ帳」を作成するために時間を費やします。すべての可能な料理(モデル)と、すべての可能なコンロの組み合わせ(GPU)について、それを調理する絶対的に最善の方法を計算します。- 例:「Qwen-3 235B」という料理の場合、最初の部分(プリフィル)を調理する最善の方法は、3台の安価なL40Sコンロと2台の高価なH100コンロを特定の列に配置することであると判断します。
- これらの完璧な「レシピ」をサービングテンプレートとして書き留めます。これには時間がかかりますが、一度行えば済みます。
段階2:日常のシフト(オンライン)
レストランが開店し、注文が流れ込んできたら、Coralはゼロから調理方法を考え直すために立ち止まりません。単にレシピ帳を参照するだけです。- 確認します:「現在、5台のL40と2台のH100が利用可能です。Qwen-3の料理を100品調理する必要があります。」
- すぐに、それらの特定のコンロに適合し、顧客の速度要件を満たす事前計算されたレシピを選択します。
- 難しい計算は事前に済んでいるため、Coralはこれらの決定を数時間ではなく数秒で行うことができます。これにより、コンロが故障したり新しい注文が殺到したりしても、キッチンが即座に適応できます。
2. 「チームワーク」の比喩
2つの労働チーム(2つの異なるAIモデル)と、限られた数の道具(GPU)を持っていると想像してください。
- 古い方法:チームAは「最良の」チームであるため、すべての最良の道具を奪います。チームBは壊れた道具しか残され、作業を終えることができません。
- Coralの方法:Coralは全体像を見ます。チームAは、作業フローを再編成すれば、良い道具とそこそこの道具の組み合わせでも実際には仕事をうまくこなせることに気づきます。これにより、最良の道具をチームBのために解放できます。両方のチームが時間通りに作業を完了し、道具が無駄になることはありません。
これが重要な理由
この論文は、6つの異なるAIモデルと20種類の異なるコンピュータチップ(GPU)でCoralをテストしました。結果は印象的でした:
- より安価:Coralは、既存の最良の方法と比較して、これらのAIモデルを運用するコストを最大2.79倍削減しました。これは、100ドルの食事に対して、同じ品質で36ドルしか支払わないようなものです。
- より高速(リソースが不足している場合):「キッチン」が混雑し、道具が見つかりにくい場合、Coralは速度を落とすことなく、競合他社よりも2.39倍多くの顧客に対応できました。
結論
Coralは、AIモデルを硬直した単一ブロックの機械として扱うのをやめるシステムです。代わりに、古い機器と新しい機器の組み合わせで調理できる柔軟なレシピとして扱います。「完璧な組み合わせ」を事前に計画し、それをリアルタイムで素やかに適用することで、莫大な金額を節約し、ハードウェアの供給が不安定な場合でもAIを円滑に稼働させます。
要約すると:Coralは、高価な道具と安価な道具を混ぜて使い、誰よりも速く、安く仕事を完了する方法を知っている賢い管理者です。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。