← 最新の論文
🤖 AI

A Policy-Driven Runtime Layer for Agentic LLM Serving

本論文は、マルチエージェントフレームワークとLLMサービングエンジンの間のギャップを埋め、ポリシー駆動型の最適化を可能にする新たなアーキテクチャ「エージェントランタイムレイヤー」を提案し、CacheSage システムを通じて、このアプローチが多様なマルチエージェントワークロードにおいてキャッシュヒット率、初トークン到達時間、スループットを大幅に改善することを示している。

原著者: Rui Zhang, Chaeeun Kim, Liting Hu

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Rui Zhang, Chaeeun Kim, Liting Hu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが忙しく高級なレストランを経営している状況を想像してください。

現在の設定:コミュニケーションの断絶
現在、あなたのレストランには互いにうまく連携していない 2 つの明確な層が存在します。

  1. ヘッドシェフ(エージェントフレームワーク): この人物はメニュー、ウェイターの役割、各テーブルへの具体的な指示を知っています。誰が注文し、何を必要としているかを知っています。しかし、彼らはキッチンのフロアを見ることはなく、今どの鍋がコンロに載っているか、あるいはどの材料が不足しつつあるかは知りません。
  2. キッチンスタッフ(サービングエンジン): このチームは入ってくるすべての注文を見ています。彼らはどのくらい多くの鍋が沸騰しているか、そしてどれほど速く調理できるかを正確に知っています。しかし、彼らは顧客が誰であるか、あるいは食事の「物語」が何かを全く知りません。彼らにとって、すべての注文は単なる一般的なリクエストに過ぎません。

問題:物事が破綻する「継ぎ目」
これら 2 つのグループが情報を共有しないため、レストランは非効率的な決定を下します。

  • 例: ヘッドシェフは、テーブル 4 がメインコースの前にいつも同じ前菜を注文することを理解しています。しかし、キッチンスタッフはこれを知らません。そのため、テーブル 4 が注文するたびに、キッチンはその 5 分前に同じテーブルのためにすでにやったばかりの玉ねぎの切り直しをゼロから行わなければなりません。
  • この論文はこの現象を「継ぎ目」と呼んでいます。現在、これを修正しようとする場合、ヘッドシェフのメモやキッチンのワークフローに、特定の単発的なルールをパッチとして適用する必要があります。これは散漫であり、拡張性もありません。

解決策:「エージェントランタイム層」(新しいフロアマネージャー)
著者たちは、シェフとキッチンの間に第 3 の層、すなわちフロアマネージャーを構築することを提案しています。

このフロアマネージャーには特別な役割があります。彼らはシェフに耳を傾けて(役割と正体を知る)おり、キッチンを見守って(調理イベントを確認)います。彼らはこの統合された知識を用いて、4 つの単純なツールを使用して賢明な決定を下します。

  1. 観察: 「『プランナー』というウェイターから新しい注文が入ってくるのを見ました。」
  2. 評価: 「過去の履歴に基づき、この『プランナー』からの注文は非常に重要であり、その後に『コーダー』からの注文が続く可能性が高いです。これを高優先度とします。」
  3. 予測: 「次の注文は『コーダー』からのものだと予想します。彼らの材料を今から準備しましょう。」
  4. 実行: 「『コーダー』のためにコンロを予熱するよう指示を出します。これで遅延は発生しません。」

このフロアマネージャーは万能な通訳として機能します。「すべてのテーブルに公平であること」や「エネルギーを節約すること」といった新しいルールは、シェフやキッチンを壊すことなく、このマネージャーに接続(プラグイン)できます。

ケーススタディ:「CacheSage」(スマートなパントリー)
これが機能することを証明するために、著者たちは「パントリー」(コンピュータのメモリ、すなわち KV キャッシュ)を処理するための特定のフロアマネージャーであるCacheSageを構築しました。

  • 従来の方法: キッチンでは、材料(メモリ)がいつ使用されたかという時間経過に基づいて、それを廃棄します。「プランナー」のウェイターが休憩後に戻ってきた場合、材料が捨てられていたため、キッチンは何度もすべてを切り直す必要があります。
  • CacheSage の方法: フロアマネージャーはパターンを学習します。彼らは「プランナー」の後にほぼ常に「コーダー」が続くことに気づきます。
    • 「プランナー」が完了すると、フロアマネージャーは「次は『コーダー』だと予測します」と言います。
    • 彼らは「プランナー」の材料を安全に保管し(捨てられないようにし)、注文が来る前であっても「コーダー」の材料の準備を始めてさえいます。

結果
彼らは 5 つの異なる現実世界の「レストラン」シナリオ(複雑な AI タスク)でこれをテストした際、以下の結果を得ました。

  • 廃棄の減少: 以前よりも 13% から 37% 多く、正しい材料をパントリーに保持できました。
  • 高速なサービス: キッチンがゼロから始めなくて済むため、顧客は 12% から 29% 早く食事を提供されました。
  • より多くの顧客: レストランは 1 時間あたり 6% から 14% 多くのテーブルを対応できました。

まとめ
この論文は、AI エージェントを効率的に実行させるためには、最上位層(ロジック)や最下位層(ハードウェア)を微調整するだけでは不十分であると主張しています。エージェントの「正体」とエンジンの「イベント」の両方を理解し、4 つの単純なルールのセットを使用してシステム全体をより賢く、より高速にするための専用の「中間管理職」が必要なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →