Learning Agent Execution for KV-Cache Management in Agentic Serving
本論文は、事前定義されたワークフローグラフを必要とすることなく、エージェントの実行遷移をオンラインで学習することでキャッシュの追い出しとプリフェッチをプロアクティブに管理し、マルチエージェントLLMサービングにおけるヒット率の向上とレイテンシの低減を大幅に実現する、エージェント認識型のKVキャッシュ・ランタイムであるCacheScoutを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
現代の人工知能の世界において、スマートなアシスタントを構築するための新しい手法が定着しています。複雑な問題を解決するために、単一の全知全能なコンピュータ・ブレインに一度にすべてを任せるのではなく、開発者はタスクを専門化されたデジタル・ワーカーのチームへと細分化するようになりました。例えば、旅行プランナーを想像してみてください。まず一つのエージェントに航空券を探させ、次に別のエージェントにホテルの予約を渡し、最後に第三のエージェントにレストランの場所を特定させるという流れです。これらの各エージェントは、学習したパターンに基づいて文章の次の単語を予測するソフトウェアの一種である、大規模言語モデル(LLM)です。これを行うために、ソフトウェアは「キー・バリュー・キャッシュ」として知られる短期記憶の中に、膨大な量の情報を保持しておく必要があります。このメモリは、ゲームのルール、使用できるツールの定義、そして振る舞いの例を保持するためのワークスペースとして機能します。新しいエージェントが会話に加わるたびに、そのエージェント独自の指示や例を持ち込み、システムがユーザーの具体的な質問に答え始める前に処理しなければならない大きなデータ塊(チャンク)が生成されます。
課題は、これらのデジタル・チームが動的であることから生じます。最初のエージェントが仕事を終えると、システムは即座に全く異なるエージェントに切り替わったり、あるいは後で最初のエージェントに戻ったりすることがあります。現在のAIチームを実行しているコンピュータ・システムは、メモリをリアクティブ(反応的)に管理しています。つまり、最も最近使用された情報を保持し、新しいリクエストのためのスペースを作るために古い情報を破棄するのです。これは単純な会話には適していますが、マルチエージェント・チームにおいては、もどかしい非効率性を生み出します。システムは、あるエージェントが数秒間話していなかったという理由だけで、そのエージェントの固定された指示や例を捨ててしまうことがよくあります。しかし、そのエージェントはまさに次のステップで再び呼び出される可能性が高いのです。エージェントが戻ってきたとき、システムはそれらの指示をゼロから読み直し、再処理しなければなりません。この「破棄と再学習」のサイクルは、操作全体を遅らせ、AIを鈍重でコストのかかるものにしてしまいます。
カリフォルニア大学サンタクルーズ校などの研究者たちは、この問題を解決するための新しいアプローチを開発し、それを「CacheScout」と呼んでいます。CacheScoutは、単に過去に何が起きたかを監視するのではなく、次に何が起こるかを予測することを学びます。それは、会話の流れをランダムな出来事の連続としてではなく、異なるワーカー間の遷移のパターンとして扱います。旅行エージェントの後にホテルエージェントが続く頻度や、コーディング・エージェントがレビュー・エージェントに切り替わる頻度などを観察することで、システムは実行しながらワークフローのメンタルマップ(精神地図)を構築します。このシステムは、開発者からあらかじめ書かれたスクリプトやマップを提供される必要はなく、リクエストを処理するたびに、その場でこれらのつながりを学習し、理解を更新していきます。
この新システムの核となるのは、AIエージェントとコンピュータ・ハードウェアの間に位置する軽量なレイヤーです。エージェントがタスクを終了すると、このレイヤーは会話の履歴を確認し、次にどのエージェントが話す可能性が最も高いかを予測します。システムが次のステップに確信を持てた場合、処理を高速化するために2つの具体的なアクションを取ります。第一に、古いデータをクリアしてスペースを作る際、たとえそのエージェントがしばらく話していなくても、すぐに戻ってくると予測されるエージェントの指示を削除することを拒否します。これは、過去の使用状況ではなく、将来の重要性に基づいてこれらの貴重なメモリの塊を保護するものです。第二に、次のリクエストを待っている間、システムは予測されたエージェントのために、静かに、かつ目に見えない形でメモリを準備します。必要な指示をユーザーが要求する前に高速メモリにロードしておくことで、エージェントがようやく作業を開始するときには、遅延なく即座に開始できるようにします。
研究者たちは、旅行の計画、数学の問題の解決、ソフトウェアコードの記述を含む実世界のタスクを用いて、このシステムをテストしました。その結果、エージェクターの行動パターンを記憶することで、システムは以前よりもはるかに高い頻度で適切な情報をメモリ内に保持できることが分かりました。テストでは、既存のメモリを再利用することに成功した割合が10〜18パーセントポイント上昇しました。この向上は、直接的に速度へとつながりました。回答の最初の単語が表示されるまでの時間は最大45パーセント短縮され、会話の1ターンを完了するまでの総時間は40パーセント近く減少しました。また、システムはより多くのリクエストを同時に処理できるようになり、1秒間に完了できるタスクの総数は最大57パーセント増加しました。
決定的なことに、研究者たちは、このアプローチがワークフローが固定されていない場合でも機能することを示しました。現代の多くのアプリケーションでは、次のステップはAI自身によってリアルタイムで決定されるため、経路は予測不能に変化し得ます。この新しいシステムは、そのような流動性にも適応し、発生している最中に最も一般的な経路を学習し、それに応じて予測を調整します。また、より大規模で複雑なAIモデルに対しても効果的であり、メモリ要件が大幅に高まった場合でも、そのスピードの優位性を維持しました。システムは、コンピュータを低速化したり、複雑な新しいハードウェアを必要としたりすることなく、これらすべてを実現しています。単にメモリ管理プロセスに少量の知能を加えることで、受動的なストレージ・システムを、次に何が来るかを知っている能動的な参加者へと変貌させたのです。
これらの知見は、効率的なAIサービングの未来が、データそのものだけでなく、作業のコンテキスト(文脈)を理解することにあることを示唆しています。旅行エージェントの後にホテルエージェントが続く可能性が高いことを認識することで、システムはあらゆる瞬間を「新たな始まり」として扱うのをやめ、会話を「継続的な旅」として捉え始めます。過去に対して反応するのではなく、未来に備えるというこの転換により、これらのデジタル・チームはより高速かつ効率的に動作できるようになり、複雑なAIアプリケーションの展開を遅らせていたボトルネックを取り除きます。その結果、より応答性が高く、より有能に感じられ、次世代の人工知能サービスを定義づけるような複雑で多段階のタスクを処理できるシステムが実現するのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。