← 最新论文
💻 computer science

AgentCo-op: Retrieval-Based Synthesis of Interoperable Multi-Agent Workflows

AgentCo-op 是一个基于检索的框架,它通过类型化工件交接和局部自我修复,将可复用的工具与智能体组合成可互操作的多智能体工作流,从而在开放式科学领域实现高效协同探索,同时在各类基准测试中以更低的成本超越基线方法。

原作者: Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Shuaike Shen, Wenduo Cheng, Shike Wang, Mingqian Ma, Jian Ma

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图制造一台复杂的机器,比如一台既能 sorts 邮件又能写每日日记的高科技咖啡机。在过去,若要借助人工智能实现这一目标,研究人员会尝试“搜索”完美的设计方案。他们会生成成千上万种不同的蓝图,逐一测试,并寄希望于其中一种能奏效。但这就像每次寻找 haystack 中的特定针时,都要先建造一座新的制针工厂。这种方法既缓慢又昂贵,而且当面对像现实世界科学那样新颖且杂乱的任务时往往行不通,因为这类任务根本没有可供批改作业的“标准答案”。

AGENTCO-OP 是一种构建这些人工智能团队的新方法。它不再从零开始搜索新设计,而是像一位总包工头:走进一个堆满预制专用工具和工人的仓库,挑选合适的组件,将它们组装成一台可运行的机器。

以下是其工作原理,辅以简单的类比:

1. “仓库”与“搜索”

大多数现有的人工智能系统试图通过搜索来寻找最佳工作流。这就像试图通过随机混合食材并不断品尝,直到做出正确的蛋糕。
AGENTCO-OP 则采用检索机制。想象你是一位需要烤蛋糕的厨师。你不必发明新食谱,而是前往一个组织有序的仓库(即技能与工具库)。你取用现成的“混合技能”、“烘焙工具”和“糖霜代理”。你无需重复造轮子,只需组装所需的部件。

2. “类型化交接”(安全包裹)

当你把一张便条递给朋友时,你可能会写在餐巾纸上。如果下一个人需要特定格式,这张餐巾纸可能会丢失或被误解。
在 AGENTCO-OP 中,每当一个 AI 代理将结果传递给另一个代理时,它会将数据放入一个严格标记、安全封装的盒子(称为“类型化工件”)。

  • 示例:如果代理 A 找到了一份基因列表,它不会直接把列表喊给代理 B,而是将列表放入一个标记为“基因列表:53 项,已验证”的盒子中。代理 B 打开盒子,检查标签,确切知道该如何处理。这防止了代理之间各说各话,或因杂乱数据而产生混淆。

3. “局部修复”(快速修补)

有时,即便计划再完美,机器也会出故障。

  • 旧方法:如果某个部件失效,整个工厂就会停工,工程师们不得不回到绘图板前,从头设计一台全新的机器。
  • AGENTCO-OP 方法:如果某个特定部件失效,一位“审查员”(一位智能主管)会查看错误并执行局部修复。这就像一名机械师看到发动机上有一颗松动的螺栓,只需拧紧那颗螺栓,而无需重建整辆汽车。系统仅修复损坏的部分,然后继续运行。

4. “Docker"(通用适配器)

科学家们的工具往往构建于不同的环境中(例如,一个工具在 Mac 上运行,另一个在 Linux 服务器上)。通常,它们无法相互通信。
AGENTCO-OP 将这些不同的工具封装在 Docker 容器中。这就像将每个工具都放入一个通用集装箱中。无论工具是什么,或在何处构建,一旦装入容器,它就能无缝接入工作流。这使得由不同人在不同时间构建的“基因代理”和“组织代理”能够完美协同工作。

他们实际做了什么?

该论文通过两种主要方式测试了该系统:

A. “现实世界”科学测试(开放世界)
他们没有使用标准的测试题,而是采用了真实且杂乱的科学问题:

  1. 心脏研究:他们连接了两个独立的 AI 代理(一个观察心脏组织,一个分析基因),以探究为何某些心脏细胞表现出不同的行为。该系统构建了工作流,在两者之间传递数据,并成功识别出一种特定的生物学模式。
  2. 细胞研究:他们结合了两种不同的分析方法(观察 RNA 和观察 DNA 可及性),以寻找更优的细胞类型标记物。该系统并行运行两项分析,比较结果,并生成了一份比单独使用任一方法更准确的报告。
  3. “复用”测试:他们利用 AGENTCO-OP 的方法,对另一个 AI 已设计的工作流进行了“修复”,使其更加完善。

B. 标准测试(基准测试)
他们还在标准的数学、编程和问答测试(即用于评估 AI 模型的测试)中测试了该系统。

  • 结果:AGENTCO-OP 在六项测试中的四项取得了最高分。
  • 成本:其运行成本也得多。其他方法花费大量资金“搜索”正确答案,而 AGENTCO-OP 只需组装合适的工具,并在错误发生时进行小修小补,从而节省了大量的计算时间和资金。

核心结论

该论文声称,AGENTCO-OP 是一种为复杂任务构建 AI 团队的更智能的方法。它不再试图从零开始“搜索”完美解决方案,而是检索现有工具,通过严格规则将它们组装在一起,并即时修复小错误。这使得它在处理没有标准答案的现实世界科学任务时表现更佳,并且与旧方法相比节省了资金。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →