あなたは、忙しいレストランを経営していると想像してください。
旧来のやり方(標準的なLLMサービング):
かつて、AIモデルの提供はファストフードのドライブスルーのようなものでした。車(リクエスト)がやってくるたびに、ハンバーガー(単一の質問)を注文し、それを受け取って走り去ります。厨房は、その車が以前に何をしていたか、あるいは次に何をする予定かなど気にしません。各注文は独立しています。もし車が後で戻ってきたとしても、それは全く新しい顧客として扱われます。
新しいやり方(マルチターン・エージェント・サービング):
今、そのレストランでは複雑な料理コンテストが開催されています。一組のチーム(「エージェント」)が、長い時間をかけて一つのテーブルに留まっています。彼らはある材料を求め、その後、シェフはチームがパントリーへスパイスを探しに行く間(「ツール呼び出し」)、待機しなければなりません。そして、チームは戻ってきて次のステップを要求します。これが一つのセッションの中で数十回繰り返されます。
- 問題点: シェフ(AI)は、これまでのレシピ全体を覚えておく必要があります。もしチームがパントリーへ行くために5分間席を外した場合、シェフはカウンターの上にあるメモ(「KVキャッシュ」)を捨ててはいけません。なぜなら、チームが戻ってきた時にそれが必要になるからです。もしチームが戻ってきた時に別のテーブル(別のサーバー)に移動していたら、新しいシェフはレシピを最初から読み直さなければならず、時間を浪費することになります。
- 課題: これを管理するのは困難です。メモを「高価で速いカウンター」に置いておくべきか? それとも「後ろにある遅い棚」に移すべきか? あるいは、チームが離れている間、メモを捨ててしまうべきか? そして、チームの次のターンをどのシェフが担当すべきか?
解決策:AGENTSERVESIM
著者らは、AGENTSERVESIMと呼ばれる「仮想レストラン・シミュレーター」を構築しました。
これらの複雑なルールを、実際に高価なスーパーコンピュータ上でテストしようとする代わりに、彼らは通常の安価なコンピュータ上で動作するデジタルツインを構築しました。
このシミュレーターの仕組みは、以下のレストランの比喩を用いて説明できます:
プログラム・オーケストレーター(ヘッドウェイター):
従来のシミュレーターでは、すべての注文は個別に扱われていました。しかし、このシミュレーターには「ヘッドウェイター」がおり、料理コンテスト全体を一つの「プログラム」として追跡します。ウェイターは、「チームAは現在パントリーでの作業待ちである」ことを把握しており、パントリーへの移動が終わるまで次の注文を開始させません。
ツール・シミュレーター(パントリーのタイマー):
時として、チームはパントリーへ行く(grepやpytestのようなツールを実行する)必要があります。これらの移動には、数ミリ秒から数分かかることがあります。シミュレーターには、これらの遅延を正確に模倣する特別なタイマーがあり、待機中にレシピのメモをカウンターに残しておくべきか、それとも棚に移すべきかをテストできる仕組みになっています。
セッション認識型ルーター(テーブル割り当て係):
レストランに複数のシェフ(サーバー)がいる場合、このルーターはチームAを、開始時と同じシェフの元へ戻すように試みます。これにより、レシピのメモがそのまま保持され、時間を節約できます。もしそのシェフが忙しすぎる場合、ルーターはメモを新しいシェフに移動させるコストと、最初からやり直すコストのどちらが高いかを計算します。
KVレジデンシー・モデル(メモ取り係):
これが最も賢い部分です。これは「レシピのメモ」(KVキャッシュ)をどこに保存するかを決定します。
- HBM(高速なカウンター): 速いが、容量は小さい。
- DRAM/CXL(後ろの棚): 遅いが、容量は大きい。
モデルはこう問いかけます。「チームは10秒後に戻ってくるのか、それとも10分後か?」もし10秒後なら、メモをカウンターに残します。もし10分後なら、カウンターを他のチームのために空けておくため、メモを棚に移します。
なぜこれが重要なのか?
これらの戦略を実際のスーパーコンピュータでテストすることは、新しいレストランのレイアウトをテストするために、実際にレストランを建設し、スタッフを雇い、数週間にわたって運営してみるようなものです。それは非常にコストがかかり、時間がかかります。
- 結果: 著者らがこのシミュレーターを実際のスーパーコンピュータ(実際のAIモデルと実際のハードウェアを使用)と比較したところ、シミュレーターは「料理コンテスト」が終了するまでの速度を6%未満の誤差で予測できることが分かりました。
- メリット: これにより、エンジニアは、あらゆるテストのために高価なスーパーコンピュータをレンタルすることなく、通常のノートパソコン上で何千もの「もしも(what-if)」のシナリオを実行し、複雑なAIエージェントを運用するための最適な方法を見つけ出すことができるようになりました。
要約すると、 彼らはAIエージェントのための非常に精度の高い「フライトシミュレーター」を構築しました。これにより、研究者は、実機(あるいは燃料代に大金を投じること)をクラッシュさせることなく、複雑で多段階のAIタスクをどのように実行するかを練習し、最適化することができるのです。
技術サマリー: AGENTSERVESIM
問題提起
現代の大規模言語モデル(LLM)のデプロイメントは、ステートレスなシングルターンのチャットクエリから、マルチターン型のエージェントシステムへと移行しています。従来のサービングでは、各プロンプトと補完のペアが独立したリクエストとして扱われますが、エージェントシステムは、LLMの呼び出しと外部ツール(コード実行やウェブ検索など)の呼び出しを交互に実行するステートフルなプログラムを実行します。これらのツール呼び出しは、ミリ秒から数分に及ぶ可変的な時間のギャップを生じさせます。
この変化は、サービングの要件を根本的に変えます:
- ステートフルな実行: ユーザーが知覚するレイテンシは、個々のターンのレイテンシではなく、プログラム全体の**ジョブ完了時間(JCT: Job Completion Time)**となります。
- ターン間の依存関係: 後続のターンはしばしば同一の会話を拡張するため、ターンを跨いだプレフィックスの再利用が体系的に発生します。
- KVキャッシュのダイナミクス: KVキャッシュの状態は、コストのかかる再プリフィル(re-prefilling)を避けるためにツールによるギャップの間も生存し続ける必要がありますが、長いギャップの間に状態を保持し続けることは希少なメモリを浪費します。
- ルーティングの複雑性: マルチインスタンスのデプロイメントにおいて、ルーティングは単なるロードバランシングではなく、キャッシュの局所性を維持するためにセッション・アフィニティを保持しなければなりません。
これらのワークロードを実機ハードウェア上で評価することは、極めて困難です。各設計ポイントには専用のアクセラレータの時間が必要であり、構成空間(到着率、モデル規模、メモリ階層)は網羅的な実機でのスイープを行うにはあまりに広大です。既存のシミュレータ(Vidur、APEX、LLMServingSimなど)はステートレスなワークロードを対象としており、プログラムのアイデンティティ、ツールのギャップ、またはターン間を跨ぐKVの滞留(residency)を捉えることができていません。
メソドロジー
著者らは、マルチターンLLMエージェント・サービングのために特別に設計された、ハードウェア認識型のシミュレータであるAGENTSERVESIMを提案します。このシミュレータは、個々のLLM呼び出しではなく、エージェント・プログラムを実行単位として扱います。これは、以下の5つの主要なコンポーネントからなるモジュール式アーキテクチャで構築されています。
- プログラム・オーケストレーター: ターンの順序と未完了のツール状態を追跡する、プログラムごとの状態マシンを維持します。これは、ターン t+1 がターン t および関連するツールのギャップがシミュレーション時間内で経過した後にのみリリースされることを保証し、プログラムのアイデンティティと依存関係を保持します。
- ツール・シミュレータ: ツールによるギャップを具現化します。これには2つのモードがあります。
- リプレイ・モード: 検証のために、実際のトレースから取得された実時間の継続時間を使用します。
- 生成的モード: カウンターファクチュアル(反事実的)な探索のために、適合された分布から継続時間をサンプリングします。
- セッション認識ルーター: マルチインスタンス・デプロイメントを管理します。プログラムとインスタンスのアフィニティ・テーブルを維持し、後続のターンを同じ「ホーム」エンジンにルーティングすることで、プレフィックス・キャッシュの局所性を保持します。ホームエンジンが容量超過の場合、マイグレーションまたは再プリフィルのコストを計算します。
- プログラム認識型バッチ・スケジューラ: スケジューラを拡張し、プログラムのアイデンティティに基づいてキューを管理します。プログラムレベルの状態(例:到達したサービス)をプラグ可能なポリシー・フックに公開し、標準的なアドミッションおよび継続的バッチング・ロジックを維持しながら、プログラムレベルのFCFSまたは到達サービス優先順位付けを可能にします。
- KV滞留モデル: メモリ階層(HBM、ホストDRAM、CXL)にわたるKVキャッシュの配置を追跡します。ツール・ギャップの継続時間と再計算コストに基づいて、KVブロックにポリシー定義のデッドラインを割り当てます。これは、エビクション(追い出し)、ホストメモリへのスワッピング、およびツールのギャップ中の保持決定を明示的にモデル化します。
このシミュレータは、オペレータ・グラフ実行エンジン(LLMServingSim 2.0およびASTRA-simに基づく)と統合されており、ヘテロジニアスなハードウェア、インターコネクト、およびマルチティア・メモリ・アクセスをモデル化します。
主な貢献
- プログラム中心のシミュレーション・アーキテクチャ: エージェント・プログラムを実行単位として抽象化する新しいフレームワークであり、単一のハードウェア認識型フレームワーク内で、ターンの依存関係、ツールによるアイドル間隔、およびターン間を跨ぐKVの滞留を研究することを可能にします。
- 実デプロイメントによる検証: 著者らは、SWE-Bench Verifiedワークロードを用い、3つのハードウェアプラットフォーム(RTX 3090、H100-SXM、B200)上での実システムの実行と比較して、AGENTSERVESIMを検証しました。このシミュレータは、主要な指標(JCTおよびスループット)において6%未満のエラーで実システムの挙動を再現し、完全に汎用CPU上で動作します。
- ハードウェア認識型デザインスペース分析: 本論文では、プレフィックス・キャッシング、スケジューリング、ルーティング、およびKV管理の相互作用を系統的に研究するためにこのシミュレータを使用しています。これにより、プレフィックス再利用率やツールのレイテンシ分布の影響など、エージェント認識型ポリシーが利益をもたらす特定の条件を特定しています。
結果
- 精度: 80個の構成セル(ハードウェア、モデルサイズ、およびポリシーを変化させたもの)にわたり、AGENTSERVESIMは実システムのJCTと平均相対誤差**<5%**で一致しました。スループットのエラーも同様に低くなりました(<2%)。
- ルーティングの影響: マルチインスタンス・クラスターにおいて、セッション認識型ルーティングはプレフィックス・キャッシュのヒット率をシングルインスタンスの天井に近い水準(96.26%)に保持しましたが、ラウンドロビンおよび最小負荷ルーティングはヒット率を3.3〜3.6ポイント低下させ、JCTを大幅に増大させました。
- ポリシーの感度: リクエストレベルのベースライン(vLLM-FCFS)に対するエージェント認識型スケジューリング(Autellix、InferCeptなど)の利点は、プレフィックス再利用率 (η) に強く依存します。η<0.3 の場合、再計算コストが支配的となり、ポリシーの違いは無視できます。η≥0.5 の場合、誤ったポリシーを選択すると、JCTが倍数的に増加する可能性があります。
- ツール・レイテンシ: ツール・レイテンシがスケールするにつれ、エージェント認識型ポリシー(特に適応型または静的TTL保持を持つもの)は、FCFSを大幅に上回ります。バイモーダル(二峰性)なツール・トレースにおいては、静的な閾値保持ルールが、多くの利点を得るために十分であることが多いことが示されました。
- メモリ・ティアリング: 第2のメモリ・ティア(CPU DRAMまたはCXL)を追加することで、高負荷時におけるHBMのみのシステムのパフォーマンス崩壊を緩和できます。CXL帯域幅は、特定の飽和点において、主にテールレイテンシに恩恵をもたらす形で、測定可能なメリット(最大約10%のJCT削減)を提供します。
重要性
本論文は、AGENTSERVESIMが、高価なアクセラレータへの徹底的なデプロイを必要とせずに、エージェント・サービング・ポリシーの制御可能で再現可能な探索を可能にすると主張しています。エージェント実行のステートフルな性質を忠実にモデル化することで、研究者は以下が可能になります:
- 密接に結合しており、実システムでは分離が困難なポリシーの相互作用(スケジューリング、ルーティング、KV管理)を評価すること。
- 物理的なテストが不可能、あるいは高価すぎる構成(より大規模なクラスター、CXLのような仮説的なメモリ・ティア、または特定のツール・レイテンシ分布など)を探索すること。
- リクエストレベルの指標を超えて、プログラムレベルの目的(ジョブ完了時間など)の最適化を行うこと。
本研究は、現代のエージェンティックAIの複雑でステートフルなワークロードを処理できる、次世代のLLMサービングスタックを設計するための基礎を確立しています。
毎週最高の NLP 論文をお届け。
スタンフォード、ケンブリッジ、フランス科学アカデミーの研究者に信頼されています。
受信トレイを確認して登録を完了してください。
問題が発生しました。もう一度お試しください。
スパムなし、いつでも解除可能。
週刊ダイジェスト — 最新の研究をわかりやすく。登録