← 最新论文
🤖 AI

EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems

EvoMAS 是一个新颖的框架,它通过元级顺序决策过程学习动态构建和适应执行时工作流,从而解决了静态、一次性多智能体设计的局限性,显著提升了在复杂长程任务上的性能。

原作者: Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Chengdong Xu, Kaiqiang Ke, Ziheng Liu, Jiaqi Wei, Zibo Shao, Weile Guo, Chao Yu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在尝试解决一个庞大且多步骤的谜题,比如规划一次复杂的旅行,其中涉及预订航班、寻找酒店、检查签证要求以及规划每日活动。

旧方法(“一次性”计划)
大多数当前的人工智能系统就像一个在离家前就写下严格行程的人。他们会决定:“首先,我将搜索网络。然后,我将撰写一封电子邮件。接着,我将计算预算。”他们从头到尾都坚持这一既定计划,即使在中途意识到需要更改目的地或发现航班已取消,也依然如此。如果计划在一开始就略有偏差,整个行程就会失败,因为他们无法适应变化。

新方法:EvoMAS
这篇论文介绍了EvoMAS,这是一个更像灵活的探险队长而非僵化规划者的系统。EvoMAS 不是在事前编写固定脚本,而是在任务进行过程中做出决策。

以下是其工作原理,分解为简单部分:

1. “任务控制中心”(任务状态构建)

想象一群探险者在洞穴中。每走一步,他们不会只是继续前行,而是会停下来更新地图。

  • 规划者:观察他们所在的位置并决定:“好吧,我们找到了第一个线索,但我们需要深入。让我们改变下一步行动。”
  • 评估者:充当质量检查员。“我们真的找到了线索,还是只是找到了一块看起来像线索的石头?”
  • 更新者:结合地图、新发现和检查员的笔记,撰写一份关于当前情况的最新摘要。

这份摘要就是任务状态。它告诉系统确切发生了什么、缺少什么,以及此刻需要修正什么。

2. “工具箱”(智能体池)

EvoMAS 拥有一个固定的工具箱,包含不同的“智能体”(专用人工智能助手)。有些擅长搜索网络,有些擅长编写代码,有些擅长复核事实,还有些擅长快速给出答案。

  • 旧方法:团队在开始时挑选三个工具,并在整个行程中仅使用这三个工具。
  • EvoMAS 方法:在旅程的每一步,任务控制中心都会查看更新后的地图(任务状态),并询问:“我们此刻需要谁?”
    • 旅程初期? “我们需要网络搜索智能体来收集信息。”
    • 旅程中期? “我们需要自我优化智能体来修正我们犯下的错误。”
    • 旅程末期? “我们需要集成智能体将所有笔记整合成最终答案。”

3. “学习教练”(工作流适配器)

系统如何知道该选择哪些工具?它通过试错来学习,类似于视频游戏角色学习如何通关。

  • 系统尝试不同的智能体组合(工作流)。
  • 如果该组合导致了成功的解决方案,“教练”(工作流适配器)就会获得奖励并记住:“嘿,先选择搜索智能体再选择优化智能体效果很好!”
  • 如果失败,教练就会学会下次避免这种特定组合。
  • 关键在于,系统主要从最终结果中学习(我们解决谜题了吗?是/否)。它不需要人类对每一步进行评分,这使得它非常高效。

为什么这更好?

该论文在需要多步骤的困难任务上测试了 EvoMAS,例如复杂的研究或解决多部分数学问题。

  • 静态系统(旧方法)经常陷入困境,因为当事情出错时,它们无法改变计划。
  • EvoMAS 具有适应性。如果第一次尝试失败,它会更新其“任务状态”,意识到计划已失效,并立即重组团队以尝试不同的方法。

结果

在实验中,EvoMAS 击败了:

  1. 单一人工智能智能体(仅靠一个聪明的机器人独自完成所有事情)。
  2. 其他自动化系统,这些系统试图在开始前设计一个完美的计划。

该论文表明,通过不断检查“地图”(任务状态)并根据那一刻的需求重新组装“团队”(工作流),该系统能够解决比以往更困难的问题。

简而言之:EvoMAS 不仅仅是遵循脚本;它是根据前一场景的结局,为电影的每一幕编写新的脚本。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →