← 最新论文
📊 statistics

AgensFlow: A Coordination-Policy Substrate for Multi-Agent Systems

本文介绍了 AgensFlow,这是一个开源框架,它将多智能体协调视为部分可观测条件下的在线策略学习问题,证明了通过学习获得的、可审计的路由在复杂工作流中通过动态优化技能、角色、模型和拓扑的决策,优于静态流水线。

原作者: Nicole Koenigstein

发布于 2026-05-28
📖 1 分钟阅读☕ 轻松阅读

原作者: Nicole Koenigstein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你是一家繁忙且高风险厨房的经理。你拥有一支厨师团队(即智能体),一个存放各种食材和工具的储藏室(即技能),以及几台烹饪速度和成本各不相同的烤箱(即模型)。

在旧有的运作方式(即静态流水线)中,你会为每一道菜编写一张僵硬的食谱卡。“做汤时,务必使用厨师 A,检查储藏室,然后使用烤箱 1。”“做沙拉时,务必使用厨师 B,跳过储藏室检查,使用烤箱 2。”

问题在于,现实生活并非如此简单。有时汤的食材很奇特,或者烤箱坏了,又或者你需要做一道实际上需要汤锅的沙拉。如果你固守僵硬的食谱,可能会浪费时间、金钱,或者端出一顿糟糕的饭菜。

AgensFlow 是一种运营这家厨房的新方式。它不是固定的食谱,而是一位智能且善于学习的经理,它会观察每一次烹饪过程,并实时调整计划。

以下是其工作原理,分解为几个简单的概念:

1. “折叠签名”(识别情境)

经理不会查看每一个订单的每一个细节(那会令人应接不暇)。相反,它将订单归类为“签名”。

  • 类比:这就像交通信号灯系统。经理不会问“这是一辆红色的丰田还是蓝色的福特?”,而是问“这是高峰时段的情况(高风险,需要速度)吗?”或者“这是周二的闲时(低风险,可以谨慎处理)吗?”
  • 在论文中:它会审视任务,判断其是否模棱两可、具有风险或需要大量证据。它将相似的任务归为一组,以便学习处理该类型情境的最佳方式,而不是死记硬背每一个单独的订单。

2. “跳过”按钮(拓扑学习)

在僵硬的厨房中,你可能不得不为每一道菜都洗碗、切洋葱和搅拌锅,即使这道菜并不需要这些步骤。

  • 类比:AgensFlow 赋予经理一个"跳过"按钮。如果经理看到一个简单的订单(比如一杯水),它会学会跳过切菜和精致的摆盘。如果订单很复杂(比如五道菜的盛宴),它会学会增加额外步骤,例如让两名厨师双重检查工作。
  • 在论文中:这被称为skip:X。系统学会对于某些类型的任务,可以完全跳过昂贵的步骤(如搜索网络或验证事实),从而在不破坏结果的前提下节省时间和金钱。

3. “学习循环”(策略图)

系统不仅仅是猜测;它会保留一份记分卡。

  • 类比:想象经理有一个笔记本。每顿饭结束后,一位美食评论家(即评判者)会对菜肴进行评分。经理会记下:“当我们遇到‘高峰时段’订单时,使用厨师 B 并跳过装饰,获得了 9/10 的评分且成本更低;而使用厨师 A 获得了 7/10 但成本更高。”
  • 在论文中:这就是策略图。它为每一个“签名”(情境)学习一套“策略”(规则集)。它使用一种称为UCB1的数学技巧,在尝试新事物(探索)与坚持行之有效的方法(利用)之间取得平衡。

4. “双重检查”(奖励审计)

人工智能面临的最大问题之一是,“评论家”可能存在偏见。也许一位评论家喜欢辛辣食物,而另一位则讨厌它。

  • 类比:AgensFlow 不只询问一位美食评论家。它会邀请三位来自不同背景的评论家对菜肴进行评分。如果他们达成一致,经理就会信任该评分。如果他们意见不一,经理就知道评分不可靠,不会据此更改规则。
  • 在论文中:这就是跨评判者审计。论文发现,仅依赖一位评判者可能会欺骗系统,使其误以为自己的表现优于实际水平。使用多位评判者能更真实地反映成功情况。

他们发现了什么?

研究人员在两种截然不同的任务类型上测试了这位“智能经理”:

  1. 修复计算机系统崩溃(分布式系统)。
  2. 分析安全警告(安全公告)。

结果

  • 更擅长处理难题:对于需要协调的复杂任务(如整合来自多个来源的信息),这位学习型经理比僵硬的食谱表现优异得多。它显著提高了这些高难度任务的答案质量。
  • 擅长处理简单任务:对于非常简单的任务,学习型经理与僵硬的食谱表现相当(它没有让情况变糟,但也无需花哨)。
  • “热启动”技巧:他们尝试利用经理已有的关于计算机崩溃的知识,来教导它处理安全警告。这奏效了!经理更快地学会了新工作,并减少了“猜测”(探索)的时间,尽管主题截然不同。

核心结论

AgensFlow 证明,对于复杂的人工智能团队,你不应该硬编码规则。相反,你应该构建一个能够观察、学习并适应的系统。它将“谁在何时做什么,以及我们是否甚至需要这样做”这一决策视为一种可以习得的技能,而非固定的设置。

最重要的是,它表明你需要谨慎对待如何衡量成功。如果你的“评判者”存在偏见,你的“学习”就会出错。通过审计评判者本身,系统得以保持诚实和高效。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →