← 最新の論文
💬 NLP

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

本論文は、エージェント検索システムにおいて grep ベースの検索がベクトル検索を上回ることを実証する実証研究を提示するとともに、基盤データが一定であっても、全体のパフォーマンスは使用される特定のエージェントハネスおよびツール呼び出しパラダイムに大きく依存することを強調する。

原著者: Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは探偵になりきって謎を解くと想像してください。ただし、単一のファイルフォルダーではなく、数百万ページもの会話ログを含む巨大な図書館を持っているのです。クライアントの質問に答えるために、特定の事実(「会議は何時に始まったか?」や「ユーザーのお気に入りの色は何か?」など)を見つける必要があります。

この論文は、PwC のチームが、AI の「探偵」(大規模言語モデル)がこの図書館を検索する 2 つの異なる方法をテストした報告書です。AI は、司書に「赤い車についての物語」を尋ねるような「賢い意味検索(セマンティック検索)」を使うべきか、それとも「赤い車!」と叫び、正確な単語を探してすべてのページをスキャンするような「文字通りのキーワード検索」を使うべきか、を明らかにしたかったのです。

以下に、彼らの発見を簡単な比喩を用いて解説します。

2 つの検索方法

  1. ベクトル検索(「賢い司書」): この方法は、質問の「意味」を理解します。「速い乗り物」について尋ねれば、「速度違反をしたスポーツカー」に言及しているページを見つけるかもしれません。「乗り物」という言葉がそこにない場合でもです。概念の理解には優れていますが、時には正確な答えが含まれていなくても、そのトピックについて書かれたページに気を取られてしまうことがあります。
  2. Grep 検索(「キーワードスキャナー」): これは blunt な道具です。正確な単語やパターンを探します。「速い乗り物」と尋ねれば、その正確な単語が含まれているページのみを見つけます。意味を理解はしませんが、必要な正確な文を見つける点では驚くほど正確です。

実験:「ハネス」が重要

研究者たちは単に検索方法をテストしただけでなく、それらを異なる「作業空間」(「ハネス」と呼ばれる)の中でテストしました。

  • カスタムハネス(Chronos): これはカスタムメイドの探偵事務所だと考えてください。AI には、ファイルを整理し、AI に質問の仕方を正確に指示し、回答を完璧にフォーマットするマネージャーがいます。
  • プロバイダー CLI ハネス(Claude Code、Codex、Gemini CLI): これらはテック巨人が提供する市販のツールキットだと考えてください。AI にはコマンドライン(ターミナルのようなもの)が与えられ、grep のような標準ツールを自分でどのように使うかを判断しなければなりません。

大きな驚き

1. 「文字通り」のスキャナーがしばしば勝利する
「賢い」意味検索が常に優れているという一般的な信念に反し、この研究では、文字通りのキーワードスキャナー(Grep)が、特に日付、名前、数値などの具体的な事実を求める場合、より正確であることが多く見つかりました

  • 比喩: 本の中から特定の電話番号を探す場合、「連絡先情報」を司書に頼む(ベクトル)よりも、正確な数字を叫ぶ(Grep)方が信頼できることが多いです。なぜなら、司書はトピックに関連する別の電話番号が載ったページを持ってくる可能性があるからです。

2. 検索結果を AI に渡す方法がすべてを変える
研究者たちは、検索結果を AI に渡す 2 つの方法をテストしました。

  • インライン(「開かれた本」): 検索結果がチャットウィンドウに直接貼り付けられます。AI は即座にそれらを読み取ります。
    • 結果: Grep がここで優勢でした。正確な単語が AI の目の前に直接貼り付けられた場合、AI は回答を完璧に当てました。
  • ファイルベース(「書類棚」): 検索結果がファイルに保存され、AI はそのファイルを開いて読むために 2 段目のステップを踏む必要があります。
    • 結果: 優位性が逆転しました。時には、ファイルを開くという追加のステップで AI が混乱しました。これらの場合、より関連性の高く、読みやすい結果の少ないセットをもたらす「賢い」ベクトル検索の方が優れることがありました。しかし、一部の AI モデルでは、ファイルベースの方法が Grep の優位性を消し去ったり、逆にしたりしました。

3. 「職場」が「道具」よりも重要
最も驚くべき発見は、検索ツールそのものよりも、環境(ハネス)の方が重要だったことです。

  • 比喩: 熟練したシェフに包丁を与えるようなものです。シェフを、見習いシェフがいるプロのキッチン(カスタムハネス)に置けば、完璧な料理を作ります。しかし、指示も何もない無秩序で見知らぬキッチン(プロバイダー CLI)に置けば、同じ包丁を持っていても苦労するかもしれません。
  • 同じ AI モデル(Claude Opus など)でも、カスタムハネスでは 93% のスコアを獲得しましたが、プロバイダーの CLI では 76% しか得られませんでした。これは、同じ検索データを使用していたにもかかわらずです。「マネージャー」と「指示」が、検索方法よりも結果を大きく変えました。

4. 「ノイズ」テスト
研究者たちは、図書館に無関係な会話(ノイズ)を徐々に追加し、検索方法がどのように耐えうるかを確認しました。

  • 彼らは、図書館が混雑するにつれて結果が予測不能になることを発見しました。時には「賢い司書」(ベクトル)が早期にノイズをフィルタリングする方が優れていました。他の時には、「キーワードスキャナー」(Grep)が AI が正しいパターンを見つけると、ノイズを無視する方が優れていました。
  • すべて状況に通用する単一の「最良」の方法はありませんでした。それは、どの AI モデルを使用し、どの「職場」設定を使用するかによって完全に依存していました。

結論

この論文は、AI 検索に対する単一の「魔法の弾丸」はないと結論付けています。

  • 「意味検索」が未来だと仮定しないこと。正確な事実を必要とするタスクでは、単純なキーワード検索の方が優れていることが多いです。
  • 設定がすべてです。検索結果を AI に提示する方法(チャットに直接か、ファイル内か)と、AI のワークフローを管理する方法(カスタム指示か、生ツールか)は、検索アルゴリズムそのものよりも結果を変えます。

要するに:AI が何を検索するかだけでなく、検索を行うように AI がどのように設定され、結果がどのように AI に渡されるかが重要なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →