← 最新论文
💻 computer science

SkillFlow: Flow-Driven Recursive Skill Evolution for Agentic Orchestration

SkillFlow 是一个基于流的框架,它采用退火轨迹平衡机制,使一个可训练的监督智能体能够利用多样化策略和透明的信用分配来自动化任务编排,同时借助递归机制自主演化其技能库,以提升在各类复杂任务中的性能。

原作者: Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

发布于 2026-05-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Mingda Zhang, Tiesunlong Shen, Haoran Luo, Wenjin Liu, Zikai Xiao, Erik Cambria, Xiaoying Tang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位非常聪明但略显笨拙的机器人助手如何解决复杂的谜题,比如修复一个损坏的网站、在虚拟房屋中导航,或解决一道棘手的数学题。

过去,我们尝试用两种主要方法来训练这些机器人,但这两种方法都存在重大问题:

  1. “僵化手册”方式:我们给机器人一份固定的规则和工具清单。如果机器人陷入困境,它无法发明新工具,只能失败。
  2. “试错”方式:我们让机器人尝试数百万种随机操作。如果它成功了,我们只在最后给予它一次“击掌”奖励。但由于“击掌”只在终点线才出现,机器人并不知道哪一个具体动作起了关键作用。它往往只学会了一条幸运路径,而忘记了如何处理稍有变化的情况(这被称为“策略坍塌”)。

SkillFlow 是一种训练这些机器人的新方法,它解决了上述问题。以下是其工作原理,使用简单的类比来说明:

1. “流”地图(而非单一路径)

将机器人的决策过程想象成一个巨大的、分叉的河流系统(即所有可能选择构成的地图)。

  • 旧方法:机器人试图找到唯一一条通往海洋的最快河流。如果那条河流干涸,机器人就会陷入困境。
  • SkillFlow:SkillFlow 不强迫机器人只选择一条河流,而是教导它理解整个河流系统的流动。它认识到许多不同的路径都能通向海洋,并保持所有优质路径畅通。这被称为“奖励成比例采样”。这就像在说:“不要只死记硬背一条幸运路线;要学会在任何通往成功的河流中都能游得好。”

2. “时间旅行”教练(零成本归因)

通常,当机器人犯错时,我们直到最后才知道它何时出了错。

  • 问题:如果机器人花了 10 步来解决一个谜题却失败了,它是第 1 步就错了,还是第 9 步才出错?
  • SkillFlow 的解决方案:SkillFlow 使用一位特殊的“教练”,这位教练可以展望未来。在机器人完成任务后,教练会回顾每一步,并指出:“啊,在第 4 步,你做出了一个导致成功的好选择”,或者“在第 7 步,你浪费了时间”。
  • 神奇之处:论文声称,这位“教练”不需要任何额外的计算能力。这就像机器人能够在完成任务的瞬间自行批改作业,而无需第二位老师进来检查。这被称为“零成本单步归因”。

3. “自我提升的工具箱”(递归技能进化)

这是最独特的部分。大多数机器人的工具箱是固定不变的。如果它们需要新工具,就无法自行制造。

  • SkillFlow 的解决方案:SkillFlow 会观察机器人的“流动”及其“教练”的反馈。当它发现机器人因缺乏特定工具而挣扎时,它会自动创建新工具(即一项“技能”)来填补这一空白。
  • 它如何决定
    • 何时添加工具? 当机器人停止进步(“流动”达到平台期)时。
    • 添加什么工具? 它会查看机器人感到困惑的确切时刻,并编写一条新指令(即一条“提示”)来提供帮助。
    • 丢弃什么工具? 它会移除那些很少使用或导致困惑的工具。
  • 结果:机器人的工具箱会自动增减,变得完美适配它所面对的任务。这就像一位厨师在烹饪了上千顿饭之后,意识到需要一把特定的新刀,于是发明了它,并扔掉了那些从未使用过的钝刀。

全局视角

该论文在 14 种不同类型的挑战上测试了此系统,范围从回答常识性问题到编写代码以及在虚拟世界中导航。

结果

  • 更高的准确性:SkillFlow 机器人比采用旧方法训练的机器人解决了更多正确的问题。
  • 更强的灵活性:因为它保持多条路径开放(即“流动”),所以当任务发生轻微变化时,它不会感到困惑。
  • 更低的成本:它学习得更快,使用的计算资源更少,因为它没有浪费时间重复学习同样的错误,也不需要额外的“教练”环节。

简而言之,SkillFlow 教导 AI 智能体不仅仅是找到一个正确答案,而是理解所有可能答案的全貌,即时评估自己的每一步,并自动构建完美的工具箱以应对任何即将到来的挑战。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →