← 最新论文
🤖 AI

SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems

SkillSmith 是一个新颖的框架,它通过一个由生态效用模型和反模式学习引导的协同感知过程,使自我改进型智能体能够共同演化技能与工具,从而在复杂的多技能任务上超越现有基准。

原作者: Yangbo Wei, Zhen Huang, Shaoqiang Lu, Junhong Qian, Qifan Wang, Chen Wu, Lei He

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yangbo Wei, Zhen Huang, Shaoqiang Lu, Junhong Qian, Qifan Wang, Chen Wu, Lei He

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你拥有一个非常聪明的机器人助手。这个机器人擅长思考和规划,但要真正执行现实世界中的任务(比如搜索网页、阅读 PDF 或发送电子邮件),它需要一套工具和一套使用这些工具的指令。

在过去,研究人员试图通过仅升级其“指令”(称为“技能/Skills”)来让这些机器人变得更好。他们会说:“如果这项任务失败了,请重写你的计划。”但他们让“工具”(比如搜索引擎或 PDF 阅读器)保持原样,即使这些工具已经损坏或过时了。

SkillSmith 是一个改变这种做法的新系统。它不仅仅是修复指令,而是同时修复指令和工具,并保留一份关于哪里出错的日记,以免犯同样的错误。

以下是 SkillSmith 的工作原理,我们使用简单的类比来解释:

1. “原子捆绑包” (Atomic Bundle):同时修复食谱与菜刀

想象一位厨师正在尝试做汤。

  • 旧方法: 如果汤的味道不好,厨师只会重写食谱。但如果他用的菜刀很钝呢?无论食谱多么完美,蔬菜都无法切好。厨师可能会写出一个复杂的食谱,比如“因为刀钝,所以要非常缓慢地切菜”,这会让整个过程变得混乱且容易出错。
  • SkillSmith 的方法: 当汤的味道不好时,SkillSmith 会观察全局。它意识到菜刀钝了。因此,它会创建一个统一的“修复包”(即原子捆绑包)。这个包同时做两件事:
    1. 磨利工具(菜刀)。
    2. 更新技能(食谱),以便能正确使用这把锋利的菜刀。

这确保了机器人不会仅仅通过复杂的变通方法来掩盖工具损坏的问题,而是从根源上解决问题。

2. “生态系统” (Ecosystem):作为丛林中动物的技能

想象机器人的技能就像生活在丛林中的动物。

  • 旧方法: 研究人员单独观察每种动物(技能)。他们会问:“这头狮子擅长狩猎吗?”他们并不关心这头狮子是否正在和旁边的老虎争斗。
  • SkillSmith 的方法: SkillSmith 将技能视为一个活生生的生态系统。它使用一种数学模型(灵感来自自然界中动物之间的竞争或协作)来观察技能如何相互作用。
    • 竞争: 如果两个技能做完全相同的事情,它们就会浪费能量。SkillSmith 可能会让其中一个退役。
    • 冲突: 如果两个技能试图做互相抵消的事情(例如,一个试图进行广泛搜索,而另一个试图屏蔽所有搜索),SkillSmith 会识别出这种“负能量”并修复冲突。
    • 协作: 如果两个技能结合在一起比分开工作效果更好,SkillSmith 会鼓励它们组队。

这让机器人的大脑保持井然有序,防止被无用或冲突的指令所填塞。

3. “反模式记忆” (Anti-Pattern Memory):一份“不要这样做”的清单

想象你正在学习开车。

  • 旧方法: 如果你出了车祸,你会从中吸取教训,但如果你忘了,下周你可能还会以同样的方式出车祸。
  • SkillSmith 的方法: SkillSmith 记录着一份详细的失败日记。当机器人发生故障时,它不仅修复故障,还会记录下为什么会发生故障以及是什么原因导致的。
    • 它会为错误创建一个“指纹”(例如,“尝试打开一个不存在的文件”)。
    • 在机器人尝试新计划之前,它会检查这份日记。如果新计划看起来像过去的错误,SkillSmith 会说:“停!我们以前试过这个,但失败了。”
    • 这阻止了机器人反复尝试那些注定失败的想法,从而避免浪费时间。

为什么这很重要?

研究人员在三种不同类型的困难任务上测试了 SkillSmith(例如阅读复杂的财务文档、回答棘手的问题以及执行多步骤的数字杂务)。

  • 它随着机器人变得更聪明而变得更好: 当他们使用更大、更强大的 AI 模型时,SkillSmith 的优势也随之增长。机器人越聪明,它协同使用这些新工具和技能的能力就越强。
  • 它能处理复杂性: 当任务变得更难、需要同时使用许多技能时,SkillSmith 仍在持续改进,而其他方法则停止了进步(遇到了瓶颈)。
  • 它更高效: 通过直接修复工具,SkillSmith 比那些只尝试重写指令的方法能更快、尝试次数更少地解决问题。

简而言之: SkillSmith 就像一位高级技师,他不仅告诉汽车如何开得更好,还会调校引擎、修理轮胎,并记录每一次故障,以便汽车永远不会以同样的方式坏掉。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →