← 最新论文
🤖 AI

SKILL.nb: Selective Formalization and Gated Execution for Durable Agent Workflows

SKILL.nb 是一个通过在可审计的笔记本中采用选择性形式化和门控执行,来增强可重用 AI 智能体工作流的耐用性与可靠性的框架,从而在应对环境漂移的同时实现动态适应,并在多种 Web 自动化基准测试中获得卓越的性能与稳定性。

原作者: Amine El Hattami, Nicolas Chapados, Christopher Pal

发布于 2026-06-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Amine El Hattami, Nicolas Chapados, Christopher Pal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一个机器人助手完成一项复杂的任务,比如预订机票或在网站上管理项目。在过去,如果机器人学会了一个奏效的小技巧,我们可能只会把这个技巧保存起来,并寄希望于它能永远奏效。但网站是会变化的。按钮会移动,菜单会消失,布局也会发生偏移。如果机器人试图在新的网站上使用旧的技巧,它往往会崩溃或陷入停滞。

这篇论文介绍了一种名为 SKILL.nb 的新方法,用于管理机器人的这些“技巧”,使其在世界发生变化时不会出错。你可以把它想象成一本智能、自动更新的食谱,它清楚地知道何时该遵循严格的指令,以及何时该保持灵活性。

以下是它的工作原理,使用了简单的类比:

1. 问题所在:“设置后即忘”的陷阁 (The "Set-and-Forget" Trap)

想象一下,你写下了一份制作蛋糕的食谱。今天它表现得完美无缺。但下周,商店更换了面粉的品牌,烤箱的温度也略有不同。如果你盲目地遵循旧食谱,蛋糕可能会烧焦。

目前的 AI 智能体(AI agents)就是这样。它们学习一个工作流(一系列步骤)来完成任务。如果网站发生了变化(即“更换了面粉品牌”),智能体就会失败。现有的系统试图通过重新阅读旧指令来修复这个问题,但它们无法很好地判断哪些部分的食谱仍然有效,哪些部分需要重写。

2. 解决方案:“智能笔记本” (SKILL.nb)

作者创建了一个名为 SKILL.nb 的系统。它不仅仅是保存一个包含指令的文本文件,而是保存了一个活性的、具有版本控制的笔记本(就像电子实验室日志一样)。

这个笔记本有三个特殊功能:

  • 选择性形式化(“硬化”的选择):
    想象你正在教机器人点击一个按钮。

    • 灵活的部分: 有些步骤是用纯英文编写的(例如,“找到登录按钮”)。这是灵活的。如果按钮移动了,机器人仍可以通过它的“眼睛”(AI 视觉)来寻找它。
    • 硬化的部分: 其他步骤被转化为严格的计算机代码(例如,“点击元素 ID #login-btn”)。这很快且精确,但很脆弱。如果 ID 改变了,代码就会失效。
    • 神奇之处: SKILL.nb 会决定哪些步骤应该是严格的代码,哪些步骤应该保持灵活的英文。它通过观察结果来学习这一点。如果一个代码步骤频繁出错,系统会自动将其“降级”回灵活的英文,以便机器人能够适应。如果一个英文步骤非常稳定,它会将其“升级”为代码以提高速度。
  • “守门员”(门控执行 - Gated Execution):
    在机器人采取行动之前,它会检查一个门(Gate)

    • 把门想象成夜店的保安。机器人尝试运行严格的代码。保安会检查:“按钮还在原来的位置吗?页面加载好了吗?”
    • 如果门开了: 机器人运行快速代码。
    • 如果门关上了: 机器人不会直接崩溃。它会立即切换到“计划 B”(灵活的英文指令)来尝试不同的方法。
    • 这防止了那种因为一个小小的变化就导致整个流程停滞的“全或无”式的失败。
  • “审计追踪”(基于证据 - Evidence-Based):
    每当机器人尝试一个步骤时,笔记本都会记录结果:一张截图、一条错误消息或一条成功日志。

    • 如果一个步骤经常失败,笔记本会看到证据并表示:“好吧,这段特定的代码太脆弱了。让我们停止使用它,回到灵活的指令模式。”
    • 它记录了什么起作用、什么失效以及为什么,从而让机器人能够从错误中学习,而不需要每次都由人类来修复。

3. 现实世界的结果:GitLab 迁移测试

研究人员在一个真实的场景中测试了它:将任务从旧版本的软件平台(GitLab 15)迁移到新版本(GitLab 16 和 18)。这些版本拥有不同的布局和按钮。

  • 旧方法: 其他 AI 系统试图在新的网站上使用它们的旧“记忆”(旧食谱)。由于它们受困于旧布局,表现得非常糟糕。它们的成功率下降了大约 10–14 个百分点。
  • SKILL.nb 的方法: 由于 SKILL.nb 拥有“守门员”和“灵活/严格”的切换机制,它意识到旧代码不再适用新的网站。它自动退回到灵活的指令模式。
    • 结果: 即使在全新的、发生变化的网站上,它也几乎保持了相同的成功率。它不需要从头开始重新学习;它只是调整了自己的策略。

4. 为什么这很重要

论文指出,为了让 AI 智能体真正具有长期的实用价值,我们不能仅仅将它们的记忆视为静态文件。我们需要将它们视为受管理的制品(managed artifacts)

  • 生命周期管理: 就像软件工程师管理代码更新一样,SKILL.nb 管理着智能体技能的“生命周期”。它知道何时提升一项技能(使其变为严格代码)、何时降级(使其变为灵活)以及何时退役(因为它太脆弱而将其丢弃)。
  • 可靠性: 它使智能体更加耐用。它们不仅能成功一次,而且即使环境发生变化,也能持续成功。

简而言之: SKILL.nb 是一个为 AI 智能体提供“自我修正”食谱的框架。它知道何时该遵循严格的剧本,何时该即兴发挥,从而确保即使在周围世界发生变化时,机器人也能继续工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →