AgentRadio: Passive Awareness for Long-Horizon Multi-Agent Collaboration
AgentRadio 引入了一个异步消息传递层,通过允许智能体在执行过程中保持对队友发现的被动感知,实现了长程多智能体代码理解,从而在 SWE-Atlas QnA 基准测试中达到了 62.1% 的成功率——通过持续的中途协调,显著超越了单智能体基线模型及更新的模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图解开一个巨大的、不可能完成的拼图,但你每次只能看极其微小的一块。这就是现代“AI智能体”(AI agents)的日常挣扎——这些旨在像人类一样思考和行动以解决复杂问题的计算机程序。这些智能体非常聪明,但它们的注意力持续时间很短。如果你要求它们理解一个庞大的软件项目(比如某个流行应用背后的代码),它们就会感到不知所措。它们试图一次性在“大脑”中处理的信息越多,就越容易忘记故事的开头,或者错过隐藏在中间的关键线索。
为了解决这个问题,科学家们尝试将工作分配给一个智能体团队,就像把不同的任务分配给不同房间里的不同人一样。但问题在于:如果厨房里的人发现了一个会改变卧室里那个人行动方式的线索,他们直到两人都完成当前任务并在门口碰头时才能互相告知。在现实世界中,我们不会等到预定的会议才大喊:“嘿,我发现了一些重要的东西!”我们会边工作边交流。直到现在,AI团队一直受困于只能在预定的休息时间进行交流,这使得它们在忙于工作时,会对队友新发现的情况视而不见。这篇论文探讨了一种让AI团队在工作过程中进行交流的新方法,将一群孤立的工人转变为一个真正的协作团队。
问题所在:“沉默工作者”陷阱
研究人员从一个艰巨的挑战开始:回答关于现实世界软件代码库的深度问题。他们在名为 SWE-Atlas QnA 的基准测试上进行了测试,该测试包含关于 11 个不同软件项目的 124 个难题。当他们要求单个非常聪明的 AI 智能体(使用名为 Claude Code Opus 4.6 的模型)来解决这些问题时,它只答对了 32.3%。该智能体在海量信息面前迷失了方向。
显而易见的解决方法似乎是雇佣一个团队。如果你将工作分配给四个智能体,每个人的工作就会变得更小、更清晰。但研究人员发现,这些团队通常运作方式中存在一个隐藏缺陷。大多数系统都强迫智能体在特定阶段结束前保持“沉默”。这就像一群侦探在破案:侦探 A 正在搜查车库,侦探 B 正在检查阁楼。如果侦探 A 发现了一只沾满泥泞的鞋子,证明嫌疑人从未去过阁楼,那么在他们完成搜索并聚在一起进行汇报之前,侦探 A 无法告诉侦探 B。到那时,侦探 B 可能已经浪费了数小时去寻找根本不存在的线索。
论文认为,这种“停止并交谈”的方法就是问题所在。在现实世界中,我们拥有“被动感知能力”——我们可以听到同事的警告或分享发现,而无需停止正在做的事情。作者想看看,如果赋予 AI 智能体同样的能力,是否会改变局面。
解决方案:AgentRadio
于是有了 AgentRadio。研究人员构建了一个新的软件“层”,充当 AI 智能体的对讲机系统。它为它们提供了三个简单的工具:
- 线程(Threads): 用于不同话题的专用聊天室。
- 消息(Messages): 向群体发送便条的能力。
- 等待提及(Wait for Mentions): 这是神奇之处。智能体不是通过停止工作来检查消息,而是运行一个微小的后台任务,监听自己的名字是否被呼叫。如果队友说,“嘿,看看这个,”这条消息会在智能体执行工作步骤之间弹出,就像手机上的通知一样,而不会中断智能体当前的任务。
把它想象成一名正在听广播的司机。司机双手握住方向盘,眼睛盯着路面(进行主要工作),但仍然可以听到交通报告(队友的消息),并能立即调整路线。他们不需要停车去听。
实验:五阶段之舞
为了测试这一点,团队为四个协同工作的智能体设定了一个严格的五阶段协议:
- 探索(Explore): 每个人独立观察代码库。
- 划分(Divide): 他们见面并商定各自的任务。
- 执行(Execute): 他们回到工作中。这是 AgentRadio 发挥作用的地方。 如果一个智能体发现了改变计划的东西,他们会立即大声喊出来。
- 审查(Review): 他们互相检查彼此的工作。
- 提交(Submit): 他们将所有内容整合为一个最终答案。
研究人员比较了三种设置:
- 单体智能体(The Solo Agent): 一个智能体独自完成所有工作。
- 沉默团队(The Silent Team): 四个智能体并行工作,但仅在每个阶段结束时进行交谈(旧方法)。
- AgentRadio 团队: 四个拥有这种“被动感知”系统的智能体。
结果:巨大的飞跃
结果非常显著。当单个智能体尝试解决这 124 个任务时,它的成功率仅为 32.3%。
当他们使用“沉默团队”方法(划分工作并进行协商,但在任务执行期间不交谈)时,成功率跳升至 51.6%。这证明了拆分工作是有帮助的,但智能体仍然错过了彼此的线索。
然后,他们开启了 AgentRadio。通过能够即时分享发现,团队的准确率飙升至 62.1%。
这不仅仅是一个小幅度的提升。使用 AgentRadio 的团队甚至超越了公开排行榜上最强大的单体智能体(一个更新、更强大的模型,名为 Opus 4.8,其准确率为 57.2%)。换句话说,四个使用良好通信系统的旧智能体,击败了一个正在独自工作的全新超级智能体。
为什么这很重要:“中途修正”的力量
研究人员进行了深入研究,以了解 为什么 这会奏效。他们发现,最大的收益发生在最困难的任务上。当任务很棘手时,“沉默团队”往往会沿着错误的路径走太久,因为他们无法在太晚之前听到队友的纠正。
有了 AgentRadio,如果一个智能体意识到:“等等,计划错了,”他们可以立即提醒其他人。这使得团队能够进行“中途修正”。这就像一群徒步旅行者:如果一个人看到了悬崖边缘,他们不会等到所有人聚集在营火旁才说:“别往那边走。”他们会大声喊出来,所有人都会立即停下。
研究还表明,这不仅仅是关于拥有更多的计算能力。即使给单个智能体六倍的预算,让它尝试该任务六次并挑选最佳结果,它的准确率也仅为 37.9%。带有 AgentRadio 的团队方法要高效且有效得多。
局限性:它并非万能灵药
论文谨慎地指出,AgentRadio 并不是解决一切的魔杖。在一个涉及 Grafana 任务的具体案例研究中,智能体在沉默版本和启用无线电的版本中都未能解决问题。原因何在?因为解决方案需要一个特定的否定结论(“这个功能不存在”),而没有任何单个智能体能自己发现这一点。AgentRadio 只能分享一个智能体已经发现的内容;它无法凭空创造新的想法。如果房间里没有人知道答案,大声喊出来也是没用的。
总结
这篇论文证明了,对于复杂的长期任务,团队如何沟通与个体成员有多聪明同样重要。通过赋予 AI 智能体在工作时倾听彼此的能力——创造一种“被动感知”状态——团队可以及早发现错误,即时分享关键线索,并解决以前无法解决的问题。这表明,AI 的未来不仅在于构建更大、更聪明的“大脑”,还在于构建更好的方式,让这些大脑能够相互交流。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。