← 最新の論文
💬 NLP

Don't Break the Cache: An Evaluation of Prompt Caching for Long-Horizon Agentic Tasks

本論文は、長期的なエージェントタスクにおける主要な3つのLLMプロバイダーにわたるプロンプトキャッシュの包括的な評価を提示しており、動的なツール実行結果の除外やプロンプト構造の管理といった戦略的なキャッシュ技術が、ナイーブなフルコンテキストキャッシュと比較して、APIコストを41〜80%削減し、最初のトークン生成までの時間を13〜31%改善できることを実証している。

原著者: Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

公開日 2026-02-03
📖 1 分で読めます☕ さくっと読める

原著者: Elias Lumer, Faheem Nizar, Akshaya Jangiti, Kevin Frank, Anmol Gulati, Mandar Phadate, Vamse Kumar Subbiah

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、複雑な謎を解くために、非常に優秀だが高価なリサーチアシスタントを雇ったと想像してください。このアシスタントは、仕事を始める前に膨大な取扱説明書(「システムプロンプト」)を読まなければなりません。仕事を進める中で、彼らはさまざまな情報源に数十回の電話をかけ、回答を得て、それをノートに書き留めていきます。

新しい電話をするたびに、彼らは何をすべきかを思い出すために、説明書の最初から最後まで読み直さなければなりません。これには多大な時間がかかり、アシスタントは読んだページ数に応じて料金を請求するため、多くの費用がかかります。

**「プロンプト・キャッシュ(Prompt Caching)」**は、そのアシスタントに魔法の蛍光ペンを与えるようなものです。もし取扱説明書の内容が変わっていないのであれば、アシスタントは本の最初の90%を読み飛ばして、新しい電話の結果が書かれている部分から直接読み始めることができます。これにより、時間と費用の両方を節約できます。

しかし、この論文はトリッキーな問いを投げかけています。その魔法の蛍光ペンは常にうまく機能するのか、それとも使い道を誤ると台無しになってしまうのか?

研究者たちは、3つの主要な「アシスタント企業」(OpenAI、Anthropic、Google)を用いて、エージェントが難しい質問に答えるために長いステップのウェブ検索を行うベンチマーク「DeepResearch Bench」でテストを行いました。彼らは、この蛍光ペンの使い方として3つの異なる方法を試しました。

  1. 「ナイーブ(素朴)」なアプローチ(フルコンテキスト): 新しい電話の結果も含めて、すべてにハイライトを引く方法。
  2. 「付箋」アプローチ(システムプロンプトのみ): 取扱説明書だけにハイライトを引き、新しい電話の結果にはハイライトを引かない方法。
  3. 「クリーン・ブレイク」アプローチ(ツール結果を除外): 取扱説明書と電話の内容にハイライトを引きますが、各結果の後に特別な「ストップ」サインを置き、次の人の乱雑なメモを誤って取り込まないようにする方法。

彼らが発見したこと

1. 大量の費用を節約できる(「財布」の勝利)
どの方法を用いても、魔法の蛍光ペンは莫大な金額を節約できました。企業によって異なりますが、請求額を**41%から80%**削減できました。

  • 例え: 図書館に入るたびに新しい図書カードを買う必要はなく、今持っているカードを使えばよいと気づくようなものです。

2. スピードは一筋縄ではいかない(「交通」の問題)
お金を節約するのは簡単でしたが、時間を節約するのはより困難でした。

  • 驚きの事実: 時には、すべてにハイライトを引く(ナイーブなアプローチ)方が、実際にはアシスタントを遅くさせてしまうことがありました。
  • 例え: 配達ドライバーが、届けるすべての荷物の住所を暗記しようとしている場面を想像してください。もし、一度きりで二度と配送されない荷物の住所を暗記しようとしたら、それは時間の無駄です。次の荷物が来たとき、新しいものを作るために古いものを「忘れる(記憶から消去する)」作業が必要になります。この「記憶への書き込み」がスピードを低下させます。
  • 研究の結果、安定した部分(取扱説明書)だけにハイライトを引き、変化する部分(電話の結果)にはハイライトを引かないようにすれば、アシスタントの速度は維持されることがわかりました。

3. 「キャッシュを壊さない」ためのルール
最大の教訓は、**「どこで線を引くか」**についてです。

  • 動的に変化する情報(例:「現在時刻:午後2時」や「ユーザーID:123」)を取扱説明書の中に含めてしまうと、魔法の蛍光ペンは機能しなくなります。システムは説明書が変更されたと判断し、最初から読み直し始めてしまいます。
  • 解決策: 取扱説明書を純粋で静的な状態に保つことです。もし変化する情報を含める必要がある場合は、取扱説明書の最後のページに付箋を貼るように、一番最後に配置してください。そうすれば、説明書の最初の99%は依然としてハイライトされ、再利用可能です。

結論

AIエージェントが長く複雑なタスクを実行する企業にとって:

  • はい、プロンプト・キャッシュを使用してください。 それはコストを劇的に削減します。
  • ただし、賢明に。 すべてに対して単にオンにするだけではいけません。
  • 最善の戦略: 安定した「取扱説明書(システムプロンプト)」のみをキャッシュしてください。変化する部分(ツールの結果)は、キャッシュせずに自由に流れるようにします。これが、低コストと高速スピードの最高の組み合わせをもたらします。

もし変化する部分までキャッシュしようとすると、キャッシュを「読み取る」恩恵を受ける代わりに、キャッシュを「書き込む」ためのコストを支払うことになり、結果としてシステムを遅くしてしまう可能性があります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →