← 最新论文
🤖 AI

SkillAlchemy: Open-World Agent Skill Creation

SkillAlchemy 是一个新颖的框架,它通过对比证据识别隐式需求,并编译基于源依据的程序,从而实现开放世界智能体技能的自动化创建,其性能可与人工策划的技能相媲美,并在 SkillsBench 上显著优于现有基准。

原作者: Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Hengjun Wang, Shuyue Wei, Boyi Liu, Jun Yang, Yongxin Tong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能飞速发展的世界中,计算机模型所“知道”的内容与其“能够做”的内容之间正出现日益明显的区别。大型语言模型是在海量的文本库上进行训练的,这赋予了它们对世界广泛而通用的理解。然而,当被要求执行一项特定的、多步骤的任务时——例如分析一个复杂的数据集或在一个专门的软件环境中进行操作——它们往往会出错,因为它们缺乏完成该特定工作所需的精确、循序渐进的指令。为了弥补这一差距,研究人员开发了“技能”(skills)的概念。可以将技能视为一种可重复使用的工具或一份预先编写的手册,而非一段新的知识,智能体可以通过加载它来处理特定的工作流。这些技能让 AI 能够超越其通用训练,去执行专门的程序,就像木匠拿起一把特定的凿子来进行精细切割,而不是试图用螺丝刀去钉钉子一样。为了使这些工具发挥作用,它们必须是可靠、准确且适用于广泛情况的,而不仅仅是针对构建它们时的那个单一案例。

然而,挑战在于当任务是陌生的时候,该如何创建这些技能。传统上,创建技能需要人类专家从零开始编写手册,或者让 AI 从过去成功尝试的记录中学习。但如果任务是全新的,既没有人类专家可用,也没有过去的尝试可以研究,该怎么办?在这种情况下,必要的信息通常以文档、代码仓库和论坛讨论的形式散落在开放的网络中。问题在于,这些信息是杂乱无章的。它们通常是为特定的人、特定的时刻或特定的计算机设置而编写的。它们包含了不适用于当前通用任务的隐藏假设和局部细节。如果 AI 只是简单地复制这些指令,它创造出的工具往往过于僵化,一旦情况发生微小变化就会失效。

一组研究人员提出了一种解决此问题的新方法,称之为 SkillAlchemy。他们不将互联网视为现成答案的图书馆,而是将其视为必须经过仔细检查和测试才能成为可用工具的原始证据来源。他们的方法始于一个简单、通常很模糊的技能请求,例如“规划一次旅行”或“校准一个模型”。系统并不会立即寻找解决方案,而是首先询问该请求中缺失了什么。它会识别出人类提示词中未说明的隐藏需求,例如需要检查预算限制,或验证特定文件格式是否与所使用的软件兼容。通过将这些缺失的部分转化为具体的问题,系统便知道要在浩瀚的网络信息海洋中寻找什么。

一旦系统知道要寻找什么,它就会从各种来源收集信息,但它并不会全盘接受所发现的一切。研究人员设计了一个严密的流程,以决定哪些信息足够值得信赖并可以被纳入最终的技能中。系统会寻找在不同情况下都能支持某一程序的证据。如果一种方法仅适用于某种特定类型的计算机或特定的数据集,系统会将其识别为局部案例,并将其与主指令分开。只有当证据显示该程序在多种语境下都能可靠运行时,系统才会将其提升为通用规则。这个过程起到了过滤器的作用,将普遍原则与临时细节区分开来。随后,系统将经过批准的指令汇编成一个结构化的包,其中包含清晰的步骤、安全检查以及支持每项决策的证据引用。

研究人员在 87 项不同的任务上测试了这种方法,涵盖了从软件工程、办公事务到财务分析和科学计算的各个领域。他们将该系统与几种其他方法进行了对比,包括依赖人类编写技能的方法,以及利用自动化工具直接从互联网生成指令的方法。结果显示,这种新方法显著优于自动化基准方法。当智能体使用该系统创建的技能时,其任务完成率比完全没有技能时提高了近 20 个百分点。更重要的是,该系统的表现与被视为“金标准”的人类策划技能相当。总的来看,该自动化系统的成功率比人类策划的技能高出 1.5 个百分点,尽管统计分析表明两者的结果非常接近。此外,在测试的四种智能体-模型配置中,该系统在三种配置下都取得了最高的整体性能。

研究还揭示了以往尝试失败的原因。当系统在没有检查范围的情况下直接抓取网络信息时,经常会包含过于具体或基于冲突证据的指令。例如,某个技能可能包含一条仅适用于特定版本软件的规则,导致智能体在版本不符时失败。新方法通过明确检查某一程序是否得到不同场景下证据的支持,成功避开了这些陷阱。它还证明了在面对混乱或误导性信息时的鲁棒性。当研究人员在搜索中引入冲突或无关的文档时,该系统能正确忽略它们,而其他方法往往会将这些错误建议纳入最终的技能中。

这项工作表明,我们构建智能体的方式正在发生根本性的转变。我们不再寄希望于 AI 能奇迹般地学会如何胜任一项新工作,也不再依赖人类为每一份手册撰写内容,而是可以教导 AI 像一名严谨的研究员一样行动。它学会了提出正确的问题,搜集证据,并区分通用规则与局部例外。通过将技能的创建建立在经过验证的证据而非直接复制之上,该系统产生的工具既灵活又可靠。研究人员发现,这种方法使智能体能够以一种此前只有通过人工干预才能实现的熟练程度来处理陌生的任务。虽然该系统并不完美,在处理某些高度专业化的媒体任务时仍有困难,但结果证明,即使在初始信息不完整且来源杂乱的情况下,可靠的技能创建也是可能的。关键不在于立即找到完美的答案,而在于通过严谨的过程去验证什么是真实的,什么是仅仅属于局部的细节。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →