Scalable Inference Architectures for Compound AI Systems: A Production Deployment Study
本論文は、Salesforce におけるモジュール式かつプラットフォーム非依存の推論アーキテクチャの生産環境導入事例を提示し、Agentforce や ApexGuru などの複合 AI システムのスケーラブルでコスト効果が高く低遅延なサービングを可能にし、マルチモデルファンアウトや連鎖的なコールドスタートといった固有の課題に対処しながら、スループット、テールレイテンシ、運用コストの大幅な改善を達成したものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
Agentforceという忙しい高級レストランを運営していると想像してください。過去、このレストランには単一の巨大なキッチン(「静的」な設定)があり、一人のシェフが野菜を刻み、ステーキを焼く、デザートを作る、皿を洗うなど、すべてを一人でこなしていました。レストランが混雑すると、キッチンは詰まってしまいました。シェフが休憩を取る(「コールドスタート」)必要があると、レストラン全体の料理提供が停止しました。そして最悪なのは、誰も食べていない時でも、シェフの給料を 24 時間 365 日払い続けなければならなかったことです。
この論文は、Salesforce がコンパウンド AI システムを処理するためにどのように「レストラン」を再構築したかを説明しています。巨大なキッチン 1 つの代わりに、彼らはオンデマンド型のモジュール式フードデリバリーネットワークを構築しました。
以下に、その仕組みを簡単に説明します。
1. 問題点:「万能型」キッチン
Agentforce や ApexGuru などの現代の AI アプリケーションは複雑です。顧客が質問をすると、システムは単一のロボットに回答を依頼するわけではありません。それは、チームの専門家が協力して作業するのとより似ています。
- 専門家 A(埋め込みモデル):顧客の履歴を検索します。
- 専門家 B(LLM):回答を作成します。
- 専門家 C(SQL 実行エンジン):データベースを確認します。
- 専門家 D(分類器):顧客が実際に何を求めているかを判断します。
従来の「静的」な設定では、これらのすべての専門家が同じハードウェア上の同じ部屋に閉じ込められていました。
- ボトルネック:データベースの専門家が遅いと、注文全体が遅延します。
- 無駄:午前 3 時に「刻む」専門家しか必要ない場合でも、すべての専門家を 24 時間 365 日、起きている状態に保ち、準備させておく必要がありました。
- 「コールドスタート」の悪夢:レストランが 1 時間閉まって再開すると、すべての専門家が目を覚まし、ストレッチをして道具の準備を整えなければなりませんでした。顧客は、最も遅い専門家が起きるまで、料理を受け取るまで待たなければなりませんでした。
2. 解決策:「スマートなデリバリーネットワーク」
Salesforce は、スマートで動的なデリバリーサービスのように機能する新しいアーキテクチャを構築しました。
- 注文受付(予測サービス):顧客が注文すると、スマートなディスパッチャーは注文を 1 つの巨大なキッチンに送るのではなく、注文を部品に分解し、その仕事に最も適した特定の専門家へ送ります。
- 独立したスケーリング:100 人が「ステーキ」(LLM 呼び出し)を注文すると、システムは瞬時にステーキのシェフ 100 人を雇います。5 人だけが「サラダ」(埋め込み呼び出し)を注文する場合、サラダのシェフ 5 人だけを雇います。彼らは同じキッチンでスペースを争うことはありません。
- サーバーレス(従量課金制):専門家は注文を待って建物に座っているわけではありません。彼らは注文が届いたときだけ現れ、作業が終わると去る「クラウドワーカー」です。支払うのは実際に働いた時間分のみです。
3. 「目覚め」の問題(カスケード型コールドスタート)の解決
この論文は、厄介な問題を発見しました。コンパウンドシステムでは、専門家が互いに依存しています。専門家 A が完了するまで、専門家 B は開始できません。
- 従来の方法:レストランが再開すると、専門家 A が目覚める(30 秒)、次に専門家 B が目覚める(150 秒)、次に専門家 C が目覚める(20 秒)。顧客は合計180 秒待たされます。
- 新しい「予熱」のトリック:システムはレシピを知っているほど賢いです。専門家 A が呼び出されると、システムは裏で専門家 B と C を同時に目覚めさせます。
- 結果:180 秒待つ代わりに、顧客の待機時間は約65 秒に短縮されます。論文によると、これにより「目覚め」の時間が**65%**削減されました。
4. 結果:より速く、安価で、スムーズに
この新しいシステムを 1 年以上、実際の顧客と共に運用した結果、以下のようなことが起こりました。
- 速度:「テールレイテンシ」(遅い顧客の最悪の待機時間)が**50%**減少しました。以前は 37 秒かかっていた注文が、現在では約 10〜11 秒で済みます。
- 容量:システムは、古いキッチンと比較して、同時に3.9 倍の注文を処理できます。
- コスト:アイドル状態のワーカーへの支払いを止めたため、コストが**30〜40%**削減されました。
- 信頼性:ある専門家が病気(故障)になっても、システムはレストラン全体をシャットダウンしません。その人を迂回して注文をルーティングするだけです(例:「データベースを確認できませんが、一般的な回答を提供します」)。レストランは、一部が故障していても95% の時間営業を継続します。
5. 得られた重要な教訓(「シェフの秘訣」)
著者らは、これらのシステムを構築する人々へのいくつかの重要な教訓を共有しました。
- コールドスタートは足し算ではなく、掛け算になります。タスクの連鎖がある場合、待機時間は積み重なります。一つずつではなく、連鎖全体を同時に目覚めさせる必要があります。
- 個々のワーカーだけでなく、パイプライン全体を見てください。ワーカー自体は速くても、他の誰かを待って立ち往生している場合、注文全体が遅くなります。注文の「全体像」を見る必要があります。
- 部品を個別にテストしてください。システムがモジュール式であるため、「ステーキのシェフ」を解雇することなく、「サラダのシェフ」だけを新しいものと入れ替えることができます。これにより、AI モデルの改善を数週間ではなく数日で行うことができます。
- 完璧さよりも、 graceful degradation(優雅な劣化)の方が優れています。システムの小さな部分が失敗しても、全体がクラッシュしてはいけません。全く回答しないよりも、少し詳細が少ない回答を提供する方がましです。
まとめ
この論文は、硬直で高価な「1 キッチン」型の AI 設定から、柔軟で「ギグエコノミー」スタイルのネットワークへの移行について述べています。すべての AI ツールを、即座にスケールアップまたはスケールダウン可能な、個別のオンデマンドワーカーとして扱うことで、Salesforce は数千のエンタープライズユーザーにとって、その AI エージェントをより速く、安価で、はるかに信頼性の高いものにしました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。