← 最新の論文
💻 computer science

Leyline: KV Cache Directives for Agentic Inference

本論文は、宣言的なディレクティブと閉形式のRoPE補正を通じて、エージェント的LLMがキャッシュされたコンテンツを動的に編集または削除することを可能にする新しいサービング側のプリミティブであるLeylineを導入し、これによりコストのかかる再プリフィリングを排除し、レイテンシとタスク成功率の両方を大幅に向上させるものである。

原著者: Bole Ma, Jan Eitzinger, Harald Koestler

公開日 2026-06-02
📖 1 分で読めます☕ さくっと読める

原著者: Bole Ma, Jan Eitzinger, Harald Koestler

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、非常にスマートで早口なアシスタント(AI)であり、探偵が謎を解くのを手助けしていると想像してください。その仕事を行うために、アシスタントは自身の思考の中に巨大な「メモ帳」(KVキャッシュと呼ばれます)を持っています。このメモ帳には、探偵がこれまでに行った発言、見つけたすべての手がかり、そして使用したすべての道具が記録されています。

旧来の手法:「追記型」のノート

かつて、AIアシスタントは、消すことができないノートに書き込む人のように機能していました。

  • ルール: 手がかりを一つ書き込み、その下に次の手がかりを書き込みます。ノートは増え続ける一方です。
  • 問題点: もし探偵が「待てよ、さっきの手がかりは間違いだった。あれを捨てて、別の角度から試そう」と気づいたとしても、旧式のシステムではその行を削除することができませんでした。ページ番号を正しく保つために、ページ全体を破り捨てて、最初からすべて書き直さなければならなかったのです。
  • コスト: これは遅く、無駄が多い作業です。真ん中の単語一つを変えるためだけに、本一冊を書き直すようなものです。

新しい問題:「エージェント型」の探偵

現代のAIエージェントは、よりダイナミックです。彼らはただチャットをするだけでなく、行動します。ツールを試し、失敗し、その失敗を削除し、再び試し、そしてスペースを節約するために古いメモを要約します。

  • 課題: エージェントが会話の途中でテキストの塊を削除すると、その後に続くすべてのものの「ページ番号(位置)」がずれてしまいます。
  • 結果: 旧来の「メモ帳」は混乱してしまいます。手がかりが間違った場所に配置されていると判断するため、メモリをすべて破棄して最初からやり直し(再プリフィル)をしなければなりません。これはスピードを著しく損なわせます。

解決策:Leyline(「魔法のハサミ」)

論文では、AIのサービングシステムのための新しいツールとして、Leylineを紹介しています。Leylineを、魔法のハサミと「位置をずらす定規」だと考えてください。

その仕組みは、以下のシンプルな比喩で説明できます:

  1. 指令(ディレクティブ):
    AIエージェントはLeylineにこう命じます。「失敗したツール呼び出しに関する段落(スパン)を切り取り、代わりに『出力省略』という短いメモに置き換えてください(リプレイスメント)」
    エージェントは、その数学的な方法を知る必要はありません。ただ指示を与えるだけでよいのです。

  2. 接合(カット・アンド・ペースト):
    Leylineは、古い段落を物理的に切り取り、その場所に短いメモを貼り付けます。

    • 重要なステップ: テキストが短くなったため、その後のすべてのテキストは、物理的に開始地点へと近づきます。
  3. 「魔法の定規」(δ\delta-回転):
    これが、この論文の秘伝のソースです。AIにおいて、単語の「位置」は秘密のコード(RoPE)のようにエンコードされています。もし単語を位置100から位置90へ移動させた場合、そのコードを変更する必要があります。

    • 旧来の手法: カットされた後のすべての単語に対して、コードを再計算する。(遅い!)
    • Leylineの手法: Leylineは数学的なショートカットを使用します。もしすべてが10ステップ分移動したのなら、その後に続く単語のコードに対して、単純な「回転(素早い数学的な微調整)」を適用するだけでよいということに気づくのです。これは、列に並んでいる人々に「全員、左に10歩動いて」と伝え、彼らが列を歩き直すのではなく、単に新しい場所を反映するようにヘッドバンドを更新するようなものです。

なぜこれが重要なのか(結果)

研究者たちは、この手法を2つの方法でテストしました。

  1. スピードテスト(メカニズム):
    AIが自身のメモリを編集する場合、Leylineは膨大な時間を節着します。

    • 比喩: タイポ(誤字)を直すために50ページの文書を書き直す代わりに、ページを入れ替えて、即座にページ番号を更新するようなものです。
    • 結果: システムはリクエストごとに最大241ミリ秒高速化し、既存のメモリを約11%多く再利用できました。つまり、会話全体を読み直す必要がなくなったのです。
  2. より賢いエージェントのテスト(ポリシー):
    研究者たちは、AIに次のような単純なルールを与えました。「もしツールの出力が古くて役に立たない場合は、それを削除せよ」

    • Leylineなしの場合: AIはテキストを削除しますが、システムはすべてを再計算しなければならず、AIの動作を大幅に遅らせ、タスクの失敗を招く可能性があります。
    • Leylineありの場合: AIは不要な情報を即座に削除します。コンテキストがよりクリーンで短くなるため、AIは重要な手がかりに集中できます。
    • 結果: AIは、古い不要な情報に惑わされることなく、また削除による重いスピードペナルティを受けることもなく、難易度の高いデバッグタスクを14.3%多く解決しました。

総括

Leylineは、AI(エージェント)とコンピュータメモリ(キャッシュ)の関係を変えます。

  • 以前は: コンピュータメモリは、AIが慎重に扱うべき、受動的で硬直したノートでした。
  • 現在は: メモリはプログラマブルなツールです。AIは「これを切り取り、あれを貼り付け、番号を修正して」と言うことができ、システムは位置を見失うことなく、即座に従います。

論文は、AIに明示的に編集を指示させることで、AIが考えを変え続けているときでも、AIを高速かつスマートで、集中力を維持した状態にできることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →