Spine-Branch Coordination for Multi-agent Computer Use
该论文提出了“脊柱-分支协同”(Spine-Branch Coordination)机制,这是一种将计算机使用任务分解为连续的“脊柱”与并行的“分支”的多智能体框架,旨在避免合并虚拟机状态在物理上的不可行性,从而显著提高长程任务的成功率并降低成本。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代办公室静谧的喧嚣中,一种新型的员工已经出现:计算机使用智能体(computer-use agent)。这些人工智能系统不仅旨在阅读文本或生成图像,而是旨在真正坐在虚拟办公桌前,注视着屏幕,并移动鼠标或在键盘上打字以完成现实世界的任务。它们可以预订机票、整理电子表格或浏览复杂的网站。随着这些智能体变得越来越强大,研究人员正试图让它们在团队中协作,就像人类项目经理将工作的不同部分分配给不同的专家一样。其希望在于,通过将一个大型且复杂的任务拆分为较小的部分,并让多个智能体同时进行工作,团队可以比单个智能体独立工作时更快、更准确地完成任务。然而,这些数字员工在共享进度方面存在一个基本的物理限制。虽然智能体可以轻松地复制一个文件或一条文本笔记并交给队友,但它无法轻易地复制其整个工作环境。如果一个智能体登录了一个安全账户,打开了十几个浏览器标签页,并且正在填写一个复杂的表单,那么该计算机的具体状态是无法被复制并与另一个智能体的状态合并的。一旦两个智能体开始处理问题的不同部分,它们的数字环境就会发生分歧,并且之后无法简单地缝合在一起。
这种约束为AI智能体团队制造了一个显著的瓶颈。如果一项任务需要一个智能体在线停留数小时,而另一个智能体在后台收集数据,那么团队必须决定如何处理计算机中实时演进的状态。以往解决此类问题的尝试通常依赖于权宜之计,即系统会尝试猜测如何合并状态,或者丢弃有价值的进度并重新开始,从而导致时间的浪费和错误的产生。来自 Scale AI、德克萨斯大学达拉斯分校和约翰斯·霍普金斯大学的研究人员提出了一种组织这些团队的新方法,称为“脊柱-分支协调”(Spine-Branch Coordination)。该框架并没有试图强行合并不兼容的环境,而是接受了这一限制作为游戏的核心规则。他们设计了一个系统,其中一个智能体——“脊柱”(spine)——承载任务的主要连续线程,使实时的计算机状态从始至终保持完整。与此同时,其他智能体——“分支”(branches)——在全新的、可丢弃的计算机上并行运行,以收集信息或执行孤立的任务。一旦分支智能体完成了它的工作并产生了切实的结果,例如下载的文件或文本摘要,它的计算机就会被直接关闭并丢弃。它找到的信息随后会被传递给脊柱智能体,后者继续执行主工作流,而无需经历合并两个不同计算机状态的过程。
研究人员在两百个涉及多步骤工作流的长且复杂的任务(如规划旅行或跨多个网站研究产品)上测试了这种方法。他们将这种“脊柱-分支”系统与一种试图在没有这种严格分离的情况下管理多个智能体的基准方法,以及一个单独工作的单个智能体进行了对比。结果在不同类型的AI模型中表现得清晰且一致。“脊柱-分支”系统的成功率显著提高,与之前的最佳多智能体方法相比,成功率提升了6.0%至16.5%。或许更令人惊讶的是,它的运行成本也变得更加低廉。通过避免不断重启或重建丢失的计算机状态,该系统将单项任务的成本降低了34%至70%。研究表明,这种方法对于最困难的任务特别有效,在这些任务中,维持一条连续、不间断的工作线的能力使得智能体能够导航复杂的序列,而不会迷失方向或犯下代价高昂的错误。
该系统的成功依赖于一种尊重计算机工作物理现实的明确分工。“脊柱”智能体是唯一保持主会话活跃的智能体,它保留了诸如登录会话和打开窗口等难以或无法重建的内容。它循序渐进地向前推进,继承前一步的状态。而“分支”智能体则可以自由地并行运行,探索不同的网站或分析数据,但它们被视为临时的。它们不需要维持长期状态;它们只需要产生一个可以保存为文件或文本的结果。当一个分支结束时,其计算机被丢弃,其结果被移交给脊柱。这种设计消除了中央管理器不断尝试调和冲突计算机状态的需求,而这一过程在以往的系统中经常导致错误。相反,信息的流动结构化为:实时状态沿着脊柱单向移动,而静态信息则在任何需要的智能体之间自由流动。
在实验中,研究人员发现这种结构使智能体团队的工作效率更高,错误更少。在那些工作流跨越许多步骤的最难任务中,“脊柱-分支”系统保持了其性能,而其他方法则出现了成功率大幅下降的情况。该系统还减少了AI需要重启或重新规划行动的次数,从而节省了时间和金钱。研究人员指出,这种方法在不同规模的模型(从较小、较弱的智能体到较大、更强大的智能体)中都表现良好。即使中央规划智能体的能力较弱,“脊柱-分支”结构依然稳健,这表明任务的组织方式比管理者的原始智能水平更为重要。研究还强调,并非所有任务都受益于拆分;对于非常简单的任务,协调多个智能体的开销实际上会使事情变得更慢、更贵。然而,对于代表了AI工作未来的复杂、长程任务,“脊柱-分支”法提供了一种可靠的扩展方式,而不会撞上不兼容计算机状态的墙。
这项工作的意义不仅在于让AI智能体变得更快。它暗示了一种构建与现实世界交互系统的新思维方式。通过将“无法合并计算机状态”视为一个基本约束而非一个待修复的漏洞,研究人员创建了一个既简单又有效的框架。该系统并不试图强求不可能之事;它在技术的限制内运作,以寻找最高效的路径。这种方法允许多个智能体进行协作而不互相干扰,确保了计算机会话中宝贵的实时状态得以保留,同时仍能利用并行工作的速度和广度。随着计算机使用智能体不断进化,有效地协调它们的能力将与它们的个体智能同样重要,而“脊柱-分支”法为实现这种协调提供了一个清晰且具有实践意义且可扩展的蓝图。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。