← 最新の論文
💻 computer science

Observation, Not Prediction: Conversation-Level Disaggregated Scheduling for Agentic Serving

本論文は、スケジューリングの単位を個々のターンから会話全体へと移行させることで、未知の将来コストを予測する必要性を排除し、計算量主体のプリフィル(prefill)とメモリ主体のデコーディング(decoding)という安定した二相構造を活用することで、レイテンシを低減しエネルギー効率を向上させるスケジューリングフレームワークであるConServeを紹介するものである。

原著者: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Jianru Ding, Ryien Hosseini, Pouya Mahdi Gholami, Mingyuan Xiang, Henry Hoffmann

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常に忙しいレストランの厨房を切り盛りしていると考えてください。昔は、すべての注文はシンプルでした。客が店に入り、料理を作り、客は帰っていく。すべての注文がおよそ同じ時間と労力を要したため、厨房を管理するのは容易でした。

しかし今、あなたの顧客は「AIエージェント」です。彼らは単に料理を注文するだけでなく、複雑なプロジェクトを開始します。

  1. 最初のターン(膨大なブリーフ): 顧客が席に着き、50ページに及ぶ膨大な指示書を渡してきます。これを読み解き、理解するには長い時間がかかります(これが「プリフィル(Prefill)」です)。
  2. 中間のターン(ツール呼び出し): シェフが調理を開始しますが、途中で手を止め、サプライヤーに連絡し、返信を待ち、レシピを確認し、再び呼び戻すといった作業を行います。これらのステップは短いですが、何度も繰り返されます。
  3. 最終ターン(結果): ついに料理が完成し、提供されます。

問題点:旧来のスケジューリング手法

現在の厨房マネージャー(AIシステム)は、あらゆるステップを個別の注文として扱っています。シェフがサプライヤーに連絡するたびに、マネージャーはこう判断しなければなりません。「このステップを、今このメインキッチンで完結させるべきか、それとも別の専門的なステーションに送るべきか?」

問題は、マネージャーがそのステップが実際に起こる前に、それがどれくらいの時間を要するか、あるいはどれだけのメモリを必要とするかを**予測(推測)**しなければならないことです。もし予測を誤ると、ステップを間違ったステーションに送ってしまい、交通渋滞を引き起こします。これは、ドライバーが動き出す前に、それぞれのドライバーが正確にどのくらいの速さで走るかを予測して、交通整理をしようとする警官のようなものです。

解決策:ConServe(会話レベルのアプローチ)

この論文では、ConServeと呼ばれる新しいシステムを紹介しています。ConServeは、一つひとつのステップを個別に管理するのではなく、会話全体を一つのユニットとして管理します。

ConServeが、シンプルな二段階の計画を用いてどのようにルールを変えるのかを説明します。

フェーズ1:重労働(プリフィル)
顧客が最初に50ページの指示書を持って到着したとき、ConServeは即座に彼らを超高速・高出力のステーション(強力なGPU)へと送り込みます。このステーションは、巨大な文書を素早く読み取るために特別に設計されています。ステーションはマニュアルを読み、文脈を理解し、必要なすべての情報の「メモリマップ(KVキャッシュ)」を作成します。

フェーズ2:ロングテール(残りの会話)
初期のマップ作成が終わると、ConServeはこう指示します。「よし、重労働は終わった。これ以降、この会話全体は、特定の、より小型でエネルギー効率の高いステーションに属するものとする。」

  • 「メモリマップ」は、この新しいステーションへ正確に一度だけ移動されます。
  • その瞬間から、あらゆる後続のステップ(ツール呼び出しや短い更新など)は、すべて同じステーション上で実行されます。
  • システムは、もはや二度と予測(推測)を行いません。次のステップが短かろうが長かろうが関係ありません。会話はその一つのステーションに固定され、仕事が終わるまでそこから動きません。

なぜこれが優れているのか(比喩による説明)

配送トラックを想像してみてください。

  • 旧来の方法: 次の荷物が重いか軽いかを予測しようとします。もし予測を誤れば、重い荷物に対して小さなトラックを送ってしまったり、小さな荷物に対して大きなトラックを送ってしまったりします。ガソリンと時間の無駄が生じます。
  • ConServe: 最初に出発するときに一度だけトラックに荷物を積み込みます。そして、そのトラックを目的地まで運転し、そこに停車させます。その特定の顧客に関するその後の荷物はすべて、すべて同じトラックに積み込まれます。次にくる荷物の重さを予測する必要はありません。ただ、そのトラックを効率的に走らせ続けるだけでよいのです。

結果

この論文では、実際のAIエージェントのワークロードを用いてテストが行われ、以下の結果が得られました。

  1. スピード: 顧客が(単なるツール呼び出しではなく)最初の本当の結果を目にするまでの時間を51%削減しました。厨房が材料をどこに置くべきか迷うことがなくなるため、料理が50%早く届くようなものです。
  2. 効率性: 7.5%のエネルギーを節約しました。強力なエンジンを最初の大きな読み取りだけに使い、残りの工程には安価なステーションを使うことで、電力を無駄にしません。
  3. 信頼性: システムが次に何が起こるかを予測(推測)する必要がないため、「判断ミス」によるエラーが発生しません。従来のシステムは予測が外れるとクラッシュしたり速度が低下したりしましたが、ConServeは現在見えているものに依拠しているため、スムーズに進行し続けます。

要約すると: ConServeは、AIの会話における一つひとつの小さなステップの未来を予測しようとするのをやめました。代わりに、会話全体を一つのジョブとして扱い、重い開始部分は強力なエンジンで処理し、残りの工程は安定した効率的なエンジンに任せるのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →