EvoMAS: Learning Execution-Time Workflows for Multi-Agent Systems
EvoMAS 是一个新颖的框架,它通过元级顺序决策过程学习动态构建和适应执行时工作流,从而解决了静态、一次性多智能体设计的局限性,显著提升了在复杂长程任务上的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在尝试解决一个庞大且多步骤的谜题,比如规划一次复杂的旅行,其中涉及预订航班、寻找酒店、检查签证要求以及规划每日活动。
旧方法(“一次性”计划)
大多数当前的人工智能系统就像一个在离家前就写下严格行程的人。他们会决定:“首先,我将搜索网络。然后,我将撰写一封电子邮件。接着,我将计算预算。”他们从头到尾都坚持这一既定计划,即使在中途意识到需要更改目的地或发现航班已取消,也依然如此。如果计划在一开始就略有偏差,整个行程就会失败,因为他们无法适应变化。
新方法:EvoMAS
这篇论文介绍了EvoMAS,这是一个更像灵活的探险队长而非僵化规划者的系统。EvoMAS 不是在事前编写固定脚本,而是在任务进行过程中做出决策。
以下是其工作原理,分解为简单部分:
1. “任务控制中心”(任务状态构建)
想象一群探险者在洞穴中。每走一步,他们不会只是继续前行,而是会停下来更新地图。
- 规划者:观察他们所在的位置并决定:“好吧,我们找到了第一个线索,但我们需要深入。让我们改变下一步行动。”
- 评估者:充当质量检查员。“我们真的找到了线索,还是只是找到了一块看起来像线索的石头?”
- 更新者:结合地图、新发现和检查员的笔记,撰写一份关于当前情况的最新摘要。
这份摘要就是任务状态。它告诉系统确切发生了什么、缺少什么,以及此刻需要修正什么。
2. “工具箱”(智能体池)
EvoMAS 拥有一个固定的工具箱,包含不同的“智能体”(专用人工智能助手)。有些擅长搜索网络,有些擅长编写代码,有些擅长复核事实,还有些擅长快速给出答案。
- 旧方法:团队在开始时挑选三个工具,并在整个行程中仅使用这三个工具。
- EvoMAS 方法:在旅程的每一步,任务控制中心都会查看更新后的地图(任务状态),并询问:“我们此刻需要谁?”
- 旅程初期? “我们需要网络搜索智能体来收集信息。”
- 旅程中期? “我们需要自我优化智能体来修正我们犯下的错误。”
- 旅程末期? “我们需要集成智能体将所有笔记整合成最终答案。”
3. “学习教练”(工作流适配器)
系统如何知道该选择哪些工具?它通过试错来学习,类似于视频游戏角色学习如何通关。
- 系统尝试不同的智能体组合(工作流)。
- 如果该组合导致了成功的解决方案,“教练”(工作流适配器)就会获得奖励并记住:“嘿,先选择搜索智能体再选择优化智能体效果很好!”
- 如果失败,教练就会学会下次避免这种特定组合。
- 关键在于,系统主要从最终结果中学习(我们解决谜题了吗?是/否)。它不需要人类对每一步进行评分,这使得它非常高效。
为什么这更好?
该论文在需要多步骤的困难任务上测试了 EvoMAS,例如复杂的研究或解决多部分数学问题。
- 静态系统(旧方法)经常陷入困境,因为当事情出错时,它们无法改变计划。
- EvoMAS 具有适应性。如果第一次尝试失败,它会更新其“任务状态”,意识到计划已失效,并立即重组团队以尝试不同的方法。
结果
在实验中,EvoMAS 击败了:
- 单一人工智能智能体(仅靠一个聪明的机器人独自完成所有事情)。
- 其他自动化系统,这些系统试图在开始前设计一个完美的计划。
该论文表明,通过不断检查“地图”(任务状态)并根据那一刻的需求重新组装“团队”(工作流),该系统能够解决比以往更困难的问题。
简而言之:EvoMAS 不仅仅是遵循脚本;它是根据前一场景的结局,为电影的每一幕编写新的脚本。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。