← 最新论文
💬 NLP

Is Grep All You Need? How Agent Harnesses Reshape Agentic Search

本文提出了一项实证研究,表明基于 grep 的检索在智能体搜索系统中往往优于向量检索,同时强调即使底层数据保持不变,整体性能仍显著受具体智能体框架和工具调用范式的影响。

原作者: Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Sahil Sen, Akhil Kasturi, Elias Lumer, Anmol Gulati, Vamse Kumar Subbiah

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象你是一名侦探,试图解开一个谜团,但你的手中不是单个文件文件夹,而是一座藏有数百万页对话日志的庞大图书馆。你需要找出特定事实(例如“会议几点开始?”或“用户最喜欢的颜色是什么?”),以回答客户的问题。

本文是普华永道(PwC)一个团队的报告,他们测试了两种让 AI“侦探”(大语言模型)搜索这座图书馆的不同方法。他们想看看 AI 究竟应该使用智能的语义搜索(就像向图书管理员询问“关于红色汽车的故事”),还是使用字面的关键词搜索(就像大喊“红色汽车!”并扫描每一页寻找这些确切的单词)。

以下是他们研究发现的简要说明,使用了简单的类比:

两种搜索方法

  1. 向量搜索(“聪明的图书管理员”):这种方法理解你问题的含义。如果你询问“快速交通工具”,它可能会找到提到“超速跑车”的页面,即使页面中没有出现“交通工具”这个词。它非常擅长理解概念,但有时会被那些关于该主题却未包含确切答案的页面所干扰。
  2. Grep 搜索(“关键词扫描器”):这是一种直截了当的工具。它寻找确切的单词或模式。如果你询问“快速交通工具”,它只会找到包含这些确切单词的页面。它不理解含义,但在寻找你需要的确切句子方面极其精准。

实验:“工作空间”(Harness)至关重要

研究人员不仅测试了搜索方法,还在不同的“工作空间”(称为Harness)中进行了测试。

  • 自定义 Harness(Chronos):将其想象为一个定制建造的侦探事务所。AI 有一位经理来整理文件,明确指示 AI 如何提问,并完美地格式化答案。
  • 提供商 CLI Harness(Claude Code、Codex、Gemini CLI):将其想象为科技巨头提供的现成工具包。AI 被赋予一个命令行(如终端),必须自行决定如何使用 grep 等标准工具。

重大发现

1. “字面”扫描器往往胜出
与“智能”语义搜索总是更好的普遍看法相反,研究发现字面关键词扫描器(Grep)通常更准确,特别是在答案是需要具体事实(如日期、姓名或数字)时。

  • 类比:如果你要在书中查找一个特定的电话号码,直接喊出确切的数字(Grep)通常比请图书管理员查找“联系方式”(向量搜索)更可靠,因为图书管理员可能会给你一页包含与主题相关但却是不同电话号码的页面。

2. 你将结果交给 AI 的方式改变了一切
研究人员测试了两种将搜索结果交给 AI 的方式:

  • 内联(“打开的书”):搜索结果直接粘贴到聊天窗口中。AI 立即阅读它们。
    • 结果Grep 在此占主导地位。当确切的单词直接粘贴在 AI 面前时,它能精准地给出答案。
  • 基于文件(“文件柜”):搜索结果被保存到文件中,AI 必须进行第二步操作来打开并读取该文件。
    • 结果优势发生了逆转。有时,AI 会因为打开文件的额外步骤而感到困惑。在这些情况下,“智能”的向量搜索有时表现更好,因为它带回了一组更小、更相关且更易于阅读的结果。然而,对于某些 AI 模型,基于文件的方法导致 Grep 的优势消失甚至反转。

3. “工作场所”比“工具”更重要
最令人惊讶的发现是,环境(Harness)比搜索工具本身更重要

  • 类比:这就像给一位主厨一把刀。如果你把他们放在有副厨协助的专业厨房(自定义 Harness)里,他们能做出完美的菜肴。如果你把他们放在一个杂乱无章、陌生的厨房,且没有任何指示(提供商 CLI),即使拿着同一把刀,他们也可能举步维艰。
  • 同一个 AI 模型(如 Claude Opus)在自定义 Harness 中获得了 93% 的分数,而在提供商的 CLI 中仅获得 76% 的分数,即使使用的是完全相同的搜索数据。“经理”和“指示”对结果的影响比搜索方法本身更大。

4. “噪音”测试
研究人员在图书馆中添加了越来越多的无关对话(噪音),以观察搜索方法如何应对。

  • 他们发现,随着图书馆变得混乱,结果变得不可预测。有时,“智能图书管理员”(向量搜索)能更好地在早期过滤掉噪音。有时,“关键词扫描器”(Grep)在 AI 找到正确模式后,能更好地忽略噪音。
  • 不存在一种适用于所有情况的“最佳”方法;这完全取决于使用的是哪种 AI 模型以及哪种“工作场所”设置。

结论

该论文得出结论,AI 搜索没有单一的“灵丹妙药”。

  • 不要仅仅假设“语义搜索”是未来。对于需要确切事实的任务,简单的关键词搜索通常更优越。
  • 设置决定一切。你如何将搜索结果呈现给 AI(直接在聊天中 vs. 在文件中)以及你如何管理 AI 的工作流程(自定义指令 vs. 原始工具)对结果的影响比搜索算法本身更大。

简而言之:关键不仅在于 AI 搜索 什么,更在于 AI 被设置成如何进行搜索,以及结果是如何交付给它的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →