✨ 要点🔬 技术摘要
想象一下,你正在雇佣一位才华横溢、知识渊博的助手(即 LLM )来回答你的问题。有时,这位助手需要通过互联网查找最新的事实,才能给你一个好的答案。
目前,大多数公司使用的是“原生搜索”(Native Search)方法。这就像是雇佣了一位同时也拥有自己私人图书馆和搜索引擎的助手。他们去图书馆取书,然后带回来给你。这很方便,但你完全不知道他们使用了哪个图书馆,也不知道为了取这些书花了多少钱,或者花了多长时间。更糟糕的是,有时助手会对他们找到的书籍感到过于兴奋,以至于在回答时开始写长篇大论、喋喋不休的故事,而不是仅仅给出你要求的简单答案。
该论文的作者提出了一种名为**解耦搜索接地(Decoupled Search Grounding, DSG)**的新方法。以下是它的工作原理,我们使用简单的类比来解释:
1. “中间人”经理(网关)
与其让助手拥有自己的图书馆,不如你雇佣一位专门的经理 (DSG 网关)。
工作原理: 当助手需要信息时,他们向经理寻求帮助。经理随后会去挑选最适合访问的图书馆(也许某一个更便宜,或者某一个提供的新闻更即时)。
益处: 你可以瞬间更换图书馆,而无需解雇助手。如果图书馆 A 变得太贵,经理只需切换到图书馆 B。助手甚至察觉不到这种变化。
2. “严厉的管家”(具备来源意识的格式化)
“原生搜索”型助手的一个主要问题是他们太爱说话了。如果你问:“法国的首都是哪里?”他们可能会说:“嗯,我查了一下,根据搜索结果,我发现巴黎是首都……”
DSG 的解决方法: 经理充当了一位严厉的管家 。他们从图书馆获取原始信息,进行清理,并以一种整洁、标准化的包形式交给助手。
结果: 助手被迫只给出你要求的精确内容(例如,仅输出“巴黎”),而没有多余的闲聊。这至关重要,因为在现实世界中,计算机通常需要自动读取这些答案,而多余的文字会破坏计算机的代码。
3. “智能文件柜”(缓存)
想象一下,你连续两次问了同一个问题。
原生搜索: 助手去了一趟图书馆,支付了费用,然后再次把书拿回来。你付了两次钱。
DSG: 经理拥有一个智能文件柜 。如果你问了一个他们之前见过的题目,他们会立即从文件柜中取出答案。
结果: 在测试中,这个文件柜表现得非常出色,99.4% 的重复问题都能通过文件柜瞬间完成回答,这使得搜索成本几乎降为零,并使响应速度提高了 68%。
4. “预算旋钮”(可调控控制)
使用旧方法时,你支付的是固定的图书馆服务费。有了 DSG,你拥有了一个预算旋钮 。
你可以告诉经理:“对于这个问题,请花费 0.01 美元并获取 3 条结果。”或者,“对于这个重要的问题,请花费 0.50 美元并获取 10 条结果。”
这让公司能够节省大量资金,因为他们只有在真正需要深度研究时才会支付高额费用。
他们发现了什么?
作者使用五种不同的智能助手和各种类型的问题,将这种新系统与旧有的“原生搜索”方法进行了对比测试:
成本: 他们发现,对于标准问题,他们可以用极低的成本获得与昂贵的原生搜索几乎同等质量的答案,成本降低了 91% ;而在他们的现实世界电子商务测试中,成本降低了超过 98% 。
速度: 由于有了“智能文件柜”,当重复提问时,答案返回的速度更快。
可靠性: “严厉的管家”式的方法阻止了助手在需要简短、简单答案时编写冗长、混乱的段落。这防止了依赖干净数据的系统出现错误。
核心结论
该论文认为,搜索互联网不应该是特定 AI 公司的一个隐藏且封闭的功能。相反,它应该是一个独立的、可控的工具,你可以对其进行管理、优化和切换。通过将“搜索”部分与“思考”部分分离,公司可以节省资金、提高速度,并保持答案的简洁与可靠。通过将“搜索”部分与“思考”部分分离,公司可以节省资金、提高速度,并保持答案的简洁与可靠。
技术摘要:解耦搜索与推理 (DSG)
1. 问题陈述
生产级大语言模型 (LLM) 智能体日益依赖实时搜索,以使其推理过程能够基于新鲜证据进行落地。然而,目前的部署主要采用原生搜索落地 (native search grounding) ,这是一种由模型提供商管理的、将搜索栈完全封装在模型 API 边界内的功能。这种架构构建了一个“耦合”系统,存在以下几个关键局限性:
缺乏控制权: 团队无法显式控制提供商选择、检索深度、上下文渲染或缓存策略。
供应商锁定: 由于检索策略被硬编码在特定模型提供商的实现中,迁移到不同的推理模型或搜索提供商变得非常困难。
搜索诱发的冗余 (Search-Induced Verbosity): 这是一种特定的失效模式,即原生搜索会导致模型违反严格的输出契约。即使有明确指令要求“仅提供最终答案”,原生搜索也常会触发解释性文字(例如,“根据搜索结果...”),从而破坏期望接收 JSON、布尔值或精确实体的下游解析器。
操作不透明: 延迟、成本结构和失效面是隐藏的,难以针对特定的生产约束(如成本或延迟)进行优化。
2. 方法论:解耦搜索落地 (DSG)
作者提出了解耦搜索落地 (Decoupled Search Grounding, DSG) ,这是一种与供应商无关的架构,它将搜索接口从推理模型中外部化。DSG 被实现为一个 MCP 兼容的网关 ,位于智能体应用与外部搜索后端之间。
核心架构组件
结构化工具层: 搜索不再是模糊的模型功能,而是作为一个结构化工具暴露出来。网关将异构的提供商输出(例如 Serper, BrightData, Firecrawl)归一化为包含片段 (snippets) 和来源 URL 的一致内部结果对象。
提供商抽象与回退 (Fallback): “提供商注册表”允许工程师配置回退链(例如 p 1 → p 2 → p k p_1 \to p_2 \to p_k p 1 → p 2 → p k )。如果主提供商超时或失败,请求会自动路由到下一个提供商,而不会中断智能体的工作流。
搜索智能层: 该层为每个查询 q q q 实现分层决策策略:
精确缓存查找: 检查缓存中是否存在精确匹配。
语义缓存复用: 使用嵌入 (embeddings) 寻找语义相似的查询(s j ∗ ≥ τ s_{j^*} \geq \tau s j ∗ ≥ τ )并复用缓存结果。
配置的回退机制: 如果没有缓存命中,系统将通过配置的提供商链执行搜索。
注: 缓存条目是基于提供商作用域的,并包含生存时间 (TTL) 限制,以确保对时效性敏感的查询不会因数据陈旧而失效。
来源感知上下文渲染: 网关渲染的工具上下文将证据与明确的来源 URL 配对,在为推理模型提供溯源线索的同时,保持稳定的输出边界。
3. 主要贡献
本文将搜索落地形式化为一个解耦的、供应商无关的层,提供了三个主要贡献:
落地的系统边界: DSG 保持了推理模型的可互换性,同时将检索策略、缓存和提供商选择作为显式的、一等公民的系统控制变量暴露出来。
搜索智能与标准化框架: 该 MCP 兼容的网关提供了一个稳定的接口,实现了异构输出的归一化,并支持带有可配置回退机制的缓存门控检索。
关于行为、质量与运营的证据: 作者将搜索诱发的冗余 识别为一种关键的提示词合规风险,并证明了 DSG 的结构化工具边界如何缓解这一问题。他们在公开基准测试和生产工作负载中量化了在准确性、成本、延迟和缓存复用方面的权衡。
4. 实证结果
评估涵盖了五种前沿模型(GPT-4o, GPT-4o-mini, Gemini 2.5 Flash/Pro, Claude Sonnet 4),测试集包括 SimpleQA, FreshQA, HotpotQA 以及一个专有的电子商务查询意图理解 (QIU) 数据集。
准确性 vs. 成本
SimpleQA: 使用 BrightData 的 DSG 实现了 86.1% 的准确率 (相比之下,原生搜索为 87.7%),同时降低了 91% 的搜索成本 (每 1K 次查询分别为 $1.80 vs. $20.00)。使用 Serper 的 DSG 实现了 83.3% 的准确率,成本为每 1K 次查询 $0.67。
FreshQA: 原生搜索在时效性敏感问题上保持领先(72.6% 对比 DSG+BrightData 的 68.0%),这进一步证实了解耦允许团队在以新鲜度为主要约束时路由至原生提供商。
生产级 QIU(电子商务): 在零售意图理解工作负载中,DSG+Serper 的准确率与原生搜索持平或略高(93.90% vs. 93.40%),同时将搜索成本降低了超过 98% (每 1K 次查询为 $0.110 vs. $7.90)。
运营指标
延迟: 在热缓存场景下,DSG 将平均延迟从 4,570ms 降低至 1,465ms (减少了 68%)。
缓存效率: 系统实现了 99.4% 的热缓存命中率 ,使边际搜索成本趋近于零。
提示词合规性: 在 HotpotQA 上,原生搜索在 78.1% 的案例中导致了“格式漂移”(产生了解释性段落而非精确答案),而 DSG 则保持了下游解析器所需的严格“仅答案”接口。
5. 意义与主张
论文认为,实时落地应被视为一个可优化的接口边界 ,而非固定的模型功能。
解耦的价值: 通过将落地过程移出推理模型,DSG 将成本、延迟、新鲜度和准确性之间的权衡转化为可控变量。
缓解失效模式: 该架构专门解决了“搜索诱发的冗余”问题,确保正确的语义答案不会违反生产流水线中严格的输出契约(如 JSON、实体、布尔值)。
可扩展性: 共享网关允许为一个应用检索到的证据被另一个应用复用,从而提高整体缓存命中率并降低系统总成本。
作者总结道,虽然原生搜索提供了便利性和特定的新鲜度优势,但在成本、延迟、输出契约可靠性和提供商灵活性至关重要的生产系统中,DSG 提供了更优的运营边界。未来的工作建议聚焦于该解耦接口上的自适应路由和多跳策略。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。