Equal Accuracy, Unequal Evidence: Search APIs as Decision Surfaces for Tool-Using Agents
本文认为,评估商业搜索 API 不应仅看答案的准确性,而应将其视为“决策面”,其独特的片段(snippet)和排序特征会显著影响智能体的检索预算和探索策略,即便各供应商在最终答案表现上保持相当。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图破解谜团的侦探,但你无法亲自观察犯罪现场。相反,你必须依靠一个“搜索引擎”递给你一叠索引卡。每张卡片都有一个 URL(地址)、一个标题和一段微小的文本片段。基于这些卡片,你决定:“我现在是否有足够的信息来解决它?”还是“我是否需要花费额外的时间和金钱去阅读那个地址下的全文?”
这篇论文讨论的是,即便最终解决的谜团数量相同,这些索引卡的设计是如何改变你的侦探工作的。
巨大的误解
长期以来,人们认为如果两个搜索引擎能为你提供相同数量的正确答案,那么它们基本上就是同一种工具。论文指出,这就像是说两张不同的地图是完全一样的,仅仅因为它们都能带你到达同一个目的地。这忽略了旅程本身。
作者认为,搜索引擎不仅仅是一个链接列表;它是一个**“决策面”(decision surface)**。它是那一套特定的线索(片段、标题和排名),迫使你的 AI 智能体做出选择:是停止并回答,还是继续挖掘?
实验:一场受控的侦探游戏
为了测试这一点,研究人员设置了一个严格的游戏。他们冻结了侦探(AI 智能体)、规则和工具。他们唯一改变的是递出卡片的搜索引擎供应商。他们测试了三个:Brave、Tavily 和 Firecrawl。
他们提出了 100 个非常难的问题(来自一个名为 SEALQA-HARD 的数据集)。这里有一个转折:这三个搜索引擎获得最终正确答案的次数几乎相同(在 100 个问题中分别为 25 次、25 次和 26 次)。如果你只看计分板,你会认为它们是完全一样的。
但当研究人员深入观察侦探的工作方式时,故事发生了变化。
三种不同的“卡片组”
尽管最终得分持平,但每个供应商提供的“证据经济学”却完全不同:
Brave(“富矿型”卡片组):
Brave 递出的卡片中,答案往往就隐藏在微小的片段文本里。侦探只需阅读卡片就能看到“黄金答案”。然而,由于卡片过于“好用”,侦探有时会因为信息过多而感到困惑,或者错过那张真正重要的卡片。- 统计数据: 在 Brave 中,答案在预取支持(即在阅读全文前可见的线索)方面,在 30 个问题中得到了体现。
- 代价: 尽管线索就在那里,但智能体仅在 101 个“含金量支持行”中的 13 行(约 13%)里利用这些线索立即解决了案例。
Tavily(“头重脚轻型”卡片组):
Tavily 则不同。它提供的片段中包含的答案不多,但一旦它拥有正确答案,它就会把那张卡片放在第 1 位(最顶端)。- 统计数据: 在那些答案可见于片段的问题中,17/34(50%)都位于最顶端的位置。
- 启示: 如果你的侦探有一条规则是“始终阅读第一张卡片”,那么 Tavily 是一个极其高效的伙伴。
Firecrawl(“探险家型”卡片组):
Firecrawl 的卡片不太可能在正面就直接给出答案。这迫使侦探变得更加具有冒险精神。在同样的规则下,使用 Firecrawl 的智能体最终点击“获取全文页面”的频率更高。- 统计数据: 智能体在 Firecrawl 下对 81% 的问题执行了页面抓取,而在 Brave 下为 65%。
- 代价: 这意味着即使最终准确率相同,智能体也花费了更多的 Token(数字货币)和时间来进行探索。
“矛盾”陷阱
论文还发现了一些可怕的事情:有时候卡片会撒谎。研究人员测量了片段与真实答案发生矛盾的频率。
- Brave: 每 1 个正确线索对应 0.92 个矛盾。
- Firecrawl: 每 1 个正确线索对应 2.59 个矛盾。
这意味着在使用 Firecrawl 时,侦探必须在大量的混乱或冲突噪音中艰难跋涉,才能找到真相。
结论
论文得出结论:选择搜索引擎是一个政策性决策,而不单纯是质量问题。
如果你选择 Brave,你会得到很多前置信息,但你可能需要一套过滤策略。
如果你选择 Tavily,你应该信任顶部的结果,因为好东西都藏在那里。
如果你选择 Firecrawl,你需要做好投入更多资源进行深挖的准备。
作者建议,我们不应再将搜索 API 视为简单的“列表生成器”,而应将其视为决策面。正确的选择取决于你的智能体是如何被编程去行动的。不存在“一劳永逸”的方法,因为正如这项研究所示,相等的准确率可能会掩盖非常不同、甚至有时非常昂贵的内部旅程。
所以,下次当你看到两个 AI 智能体给出相同的答案时,不要假设它们采取了相同的路径。一个可能是在第一张地图上就找到了宝藏,而另一个可能不得不挖掘了一整座山头才找到它。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。