SearchOS-V1: Towards Robust Open-Domain Information-Seeking Agent Collaboration
本文介绍了 SearchOS,这是一个鲁棒的多智能体框架,它通过面向搜索的上下文管理将任务进度外部化到共享状态中,采用流水线并行调度以最大化效率,并利用带有层级化技能的中间件控制架来防止重复搜索循环并提高证据覆盖率,从而增强了开放领域的信息寻求能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名试图破解巨大谜团的侦探,但你没有一个笔记本,而是拥有一支初级侦探团队。在人工智能的世界里,这些“侦探”被称为智能体(Agents)。它们是聪明的计算机程序,可以与互联网对话、阅读网站并收集信息来回答你的问题。长期以来,这些智能体就像是会忘记自己已经发现了什么的侦探。随着谜团变得越来越大,它们会变得混乱,重复问同样的问题,或者陷入循环,浪费时间和精力。因为它们没有一种方式来保存一份共享且有序的进度记录。
为了解决这个问题,研究人员正在构建更好的协作方式。他们使用大语言模型(可以理解为能够阅读和写作的超级大脑)的概念,并赋予它们搜索网络工具的能力。面临的巨大挑战是长程任务(long-horizon tasks):这些是复杂的任务,需要收集数百个事实,检查它们是否匹配,并将它们完美地组织起来。如果智能体失去了对“大局”的掌控,最终的答案就会变得混乱或不完整。这篇论文正是在解决这个问题的:我们如何阻止这些数字侦探在自己的工作中迷失方向,并帮助它们像运转良好的机器一样协同工作?
问题所在:“健忘侦探”的循环
想象一下,你和你的朋友们正试图根据一本模糊的说明书搭建一座巨大的乐高城堡。你们都开始抓取积木,但没有人记录已经找到了什么。一个朋友一直在寻找红色的 2x4 积木,尽管另一个朋友十分钟前就已经找到了它。另一个朋友则卡在尝试打开一扇锁着的门上,反复撞门,而不是尝试另一扇门。
这就是目前的 AI 搜索智能体所面临的情况。当它们试图回答复杂问题时,会丢失对进度的追踪。它们会陷入重复循环,将它们的“搜索预算”(时间与计算能力)浪费在死胡同里。由于信息被埋没在冗长的聊天历史中,它们可能会错过重要的事实,或者因为没有共享的已知与缺失地图而互相争论。仅仅增加更多的智能体并不能解决问题;这只会制造更多的混乱,让大家都在互相踩脚。
解决方案:SearchOS,“搜索操作系统”
作者们推出了 SearchOS,这是一个全新的框架,它就像是这些搜索智能体的中央指挥部或“操作系统”。SearchOS 不再让智能体依赖于它们逐渐消退的记忆,而是强制要求它们将所有内容记录在一个共享且有序的笔记本中,确保信息永不丢失。
以下是它的工作原理,使用了几个有趣的类比:
1. 主蓝图(关系模式/Relational Schema)
与其只是提出一个模糊的问题,比如“告诉我关于公司的信息”,SearchOS 会将任务转化为填写一张巨大的结构化表格。想象一个侦探看板,你拥有专门的列,如“公司名称”、“CEO”、“营收”和“成立年份”。智能体的任务不仅仅是“寻找信息”,而是要填满每一个空白单元格。如果某个单元格是空的,系统就能精确知道缺失了什么。这把混乱、开放式的搜索变成了一场清晰、可衡量的“填空游戏”。
2. 共享指挥中心(SOCM)
这是 SearchOS 的核心。它是一个**面向搜索的上下文管理(Search-Oriented Context Management)**系统,充当整个团队的共享大脑。它实时更新四个关键要素:
- 前沿任务列表(The Frontier Task List): 一个待办事项清单,明确列出了哪些表格单元格仍然是空白的。
- 证据图谱(The Evidence Graph): 一张记录了每个事实及其来源网站的地图(以便你可以核实来源)。
- 覆盖范围图(The Coverage Map): 一个可视化仪表盘,显示表格的哪些部分已填充、哪些部分不确定以及哪些部分缺失。
- 失败记忆(Failure Memory): 一个“不要再试这个”的清单。如果一个智能体尝试了一次搜索但失败了(例如遇到了失效的网站),这个记忆会告诉其他智能体:“别白费力气再试了,那是条死路。”
3. 流水线(流水线并行调度/Pipeline-Parallel Scheduling)
旧系统通常会让智能体互相等待,就像人们排队等候单一收银员一样。SearchOS 使用了流水线并行调度。想象一个工厂的流水线:一旦一个智能体完成了一项任务并释放了一个位置,系统会立即将新任务交给下一个可用的智能体。没有人会闲置。如果一个智能体动作慢,其他智能体会继续处理表格的其他部分。这使得整个团队更快、更高效。
4. 裁判(中间件护栏/Middleware Harness)
有时智能体会陷入循环或耗尽时间。SearchOS 有一个搜索工具中间件护栏,它扮演着严格裁判的角色。它监视着智能体的每一个动作。如果它看到一个智能体在撞一扇锁着的门(搜索失败)或重复同一个问题,裁判就会介入,停止该智能体,并给它一个新的策略。它还确保智能体找到的每一个事实在写入最终报告之前都是“有据可查”(链接到真实来源)的。
5. 工具箱(层级技能/Hierarchical Skills)
SearchOS 拥有一个预制技能库。把这些想象成侦探工具包里的专业工具。有些工具用于通用搜索(如“如何提出好问题”),而另一些则针对特定网站(如“如何导航政府数据库”)。系统教会智能体如何使用这些工具,这样它们在访问新网站时就不必每次都重新发明轮子。
研究发现:结果
研究人员在两个困难的基准测试 WideSearch 和 GISA 上测试了 SearchOS。这些测试涉及需要从不同来源收集大量事实的复杂问题。
结果令人印象深刻。SearchOS 打败了所有测试过的其他方法,包括单智能体系统和其他多智能体团队。
- 在 WideSearch 测试中,它实现了 80.3 的项目级 F1 分数(Item-level F1 score),是所有方法中最高的。
- 在 GISA 测试中,它在 Set F1 指标上取得了 76.5 的分数,以巨大的优势领先于第二名 13.4 个百分点。
论文指出,通过迫使智能体基于一个共享的、显式的状态(即表格和地图)而非依赖其内部记忆来工作,系统变得更加可靠。它能找到更多事实(更高的召回率),同时不会出错(保持高精确度)。
为什么这很重要
这不仅仅是为了让 AI 更快,更是为了让 AI 值得信赖。当 AI 进行深度研究时,你需要知道它没有遗漏关键事实,也没有编造数字。SearchOS 提供了一种方式,让你能看清 AI 知道什么、不知道什么,以及它可能在哪里卡住了。它将互联网搜索的混乱过程转变为一个结构化的、可观察的、协作的过程。
作者认为,这种方法——将搜索视为一个带有共享“操作系统”的有状态协作过程——是构建能够处理复杂现实研究任务、且不会在噪音中迷失方向的智能体的重要一步。他们不仅构建了一个更好的搜索引擎,还构建了一种让 AI 智能体作为团队协作的更好方式。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。