Anything2Skill: Compiling External Knowledge into Reusable Skills for Agents
该论文提出了 Anything2Skill,这是一个将异构外部知识编译为存储在技能库(SkillBank)中可复用的结构化程序化技能的框架,通过将声明式证据与可执行的领域专业知识相结合,使智能体能够实现比标准 RAG 方法显著更高的成功率。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个才华横溢但缺乏经验的助手(一个 AI 智能体),他非常擅长阅读书籍和寻找事实。当你要求他修理一台复杂的机器时,他可以迅速找到手册,阅读零件清单,并告诉你这台机器是由什么组成的。这就是当前 AI 系统的工作方式,这种方法被称为 RAG(检索增强生成)。他们擅长寻找“陈述性证据”——即事实和描述。
但问题在于:手册会告诉助手什么是螺丝刀,但并不总是能清晰地说明如何使用它来修复特定的损坏齿轮以及正确的先后顺序。助手必须阅读手册,猜测步骤,尝试修理,失败,再次阅读手册,再次猜测。这就像仅仅通过阅读一份食材清单和描述,而从未见过食谱或厨师烹饪的过程,就试图学习如何烹饪一道复杂的菜肴。
ANYTHING2SKILL 是一个旨在解决这一问题的全新系统。你可以将其视为一个 “技能编译器” 或 “食谱创建器”。
核心思想:将手册转化为食谱
ANYTHING2SKILL 不仅仅是让 AI 在每次面对任务时去阅读原始的手册、日志和文档,而是将所有这些杂乱的信息编译成可重用的“技能”。
以下是它的工作原理,使用一个简单的类比:
- 原材料(知识库): 想象一个巨大的图书馆,里面充满了散乱的笔记、旧的维修日志、聊天记录和官方手册。现在,AI 每次需要做某事时都必须搜索这个图书馆。
- 厨师的准备工作(提取): ANYTHING2SKILL 扮演着一位大师级厨师的角色,阅读所有这些散乱的笔记。它不仅仅是做摘要;它在寻找程序(procedures)。它会问:“执行此操作的具体步骤是什么?需要哪些工具?应该避免哪些错误?”
- 技能树(组织): 系统将这些程序组织成一个结构化的“技能树”。这就像是任务的家族谱系。
- 宏观协议(Macro-protocols): 大局观策略(例如,“如何管理一个软件项目”)。
- 微观技能(Micro-skills): 特定的、微小的动作(例如,“如何运行这条特定的命令来删除一个文件”)。
- 安全规则(Safety Rules): 警告(例如,“如果发生 Y 情况,绝不要做 X”)。
- 技能库(SkillBank,可重用库): 一旦“食谱”写好,它们就会被存储在一个永久且有组织的 SkillBank 中。这不仅仅是一堆文档;它是一个可执行指令的数据库。每个“技能”都有一个契约,规定:“如果你看到情况 X,执行步骤 A、B 和 C,但要避开 D。”
它如何帮助 AI 智能体
当 AI 智能体面临新任务时,它现在拥有两个协同工作的超能力:
- 能力 1:图书管理员(RAG): 它仍然搜索原始图书馆以查找特定事实或最新的更新(即“是什么”)。
- 能力 2:经验丰富的导师(SkillBank): 它从 SkillBank 中提取一个预制好的“技能”。这个技能会根据以往成功经验,一步步告诉智能体“如何做”这项任务。
结果:
论文在两个现实世界的任务上测试了这一点:管理 CSV 数据文件 (qsv) 和管理 GitHub 仓库 (GitHub-CLI)。
- 没有 ANYTHING2SKILL 时: AI 就像一个第一次读手册的聪明学生。它大约完成了 65–82% 的任务。
- 有了 ANYTHING2SKILL 后: AI 拥有了“编译好的食谱”。它完成了大约 82–92% 的任务。
- 两者兼具时: AI 既拥有事实,又拥有食谱。它在 CSV 任务中达到了 98.85% 的成功率,在 GitHub 任务中达到了 94.10% 的成功率。
核心启示
该论文声称,我们不应仅仅将外部知识视为一堆待阅读的事实。我们应该将其视为可以被提取、组织并转化为可重用“技能”的隐藏程序之源。
通过将这些潜在程序编译进 SkillBank,我们正推动 AI 智能体从单纯的“获取知识”(阅读手册)转向“重用能力”(明确知道如何胜任这份工作)。这是给某人一本字典与给某人一份针对其可能需要的每种工作的、组织良好的说明书之间的区别。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。