← 最新论文
🤖 AI

Formal Skill: Programmable Runtime Skills for Efficient and Accurate LLM Agents

本文介绍了“形式化技能”,这是一种原生运行时抽象,用可执行的状态机和 JSON 模式取代非正式的自然语言指令,以提升大语言模型代理的效率、准确性和可执行性,开源框架 FairyClaw 在 Harness-Bench 上的卓越性能即证明了这一点。

原作者: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Xi Zhang, Meijun Gao, Yuntian Zhao, Xinyu Tan, Yilun Yao, Feiyu Wang, Yanshu Wang, Dingsiyi, Tong Yang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在雇佣一位非常聪明、速度极快的实习生(AI 智能体)来修复办公室里的一个复杂问题,比如修复一个损坏的软件组件。

旧方法:“文本墙”手册

目前,大多数 AI 智能体的工作方式如下:你给它们一份用纯英语编写的、庞大而详细的操作手册(即“提示技能”)。手册中会写道:“首先,查看错误日志。然后,尝试修复代码。确保不要删除测试文件。如果失败,请重试。完成后,撰写一份报告。”

这篇论文将这种方法称为“非正式技能”。它存在三个主要问题:

  1. 成本高昂:AI 每次执行一步操作时,都必须阅读这份巨大的手册。这会消耗大量的“令牌”(AI 计算能力的货币)。
  2. 模糊不清:AI 必须猜测“重试”或“不要删除”究竟意味着什么。这就像告诉人类“要小心”,却没有定义“小心”具体是什么样子。
  3. 脆弱易碎:如果 AI 犯了错误,它必须回溯整个对话历史以记住自己身处何处。它没有内置的“检查清单”来判断自己是否已完成,或者是否需要回退一步。

新方法:“正式技能”

作者提出了一种名为“正式技能”的新方法。与其给 AI 一份冗长的文本手册,不如给它一个可编程的工具包

这就像将给厨师的 50 页食谱书,升级为配备内置安全功能的智能厨房

  • 食谱即代码,而非文本:AI 不再阅读段落,而是与特定的按钮(工具)进行交互,并遵循严格的流程图(状态机)。
  • “挂钩”系统:想象俱乐部门口的保安(“挂钩”)。根据 AI 当前处于工作的哪个阶段,保安决定哪些门是开放的。
    • 阶段 1(调查):保安只打开通往“搜索工具”的门。“删除”门则被锁住。
    • 阶段 2(修复):保安打开“补丁工具”门,但再次锁住“删除”门。
    • 阶段 3(验证):在 AI 向测试机器出示“通过”证书之前,保安不会让它离开房间。
  • 状态机:AI 无需记住整个故事。它只需持有一个小型的数字徽章,上面写着“我当前处于‘修复’阶段”。如果它在“修复”完成前试图跳到“报告”阶段,系统会自动将其阻止。

"FairyClaw"引擎

为了实现这一构想,作者构建了一个名为FairyClaw的新引擎。你可以将 FairyClaw 视为掌控全局的智能管理者

  • 它不仅仅是与 AI 聊天;它主动管理 AI 的工具和规则。
  • 它将大型任务拆解为更小的子任务,并为每个子任务分配正确的“正式技能”。
  • 它会持续记录 AI 的确切位置、已完成的工作以及仍需完成的任务,确保 AI 永远不会迷失方向。

结果:更快、更便宜、更安全

作者使用一项名为Harness-Bench的严苛测试,将这套系统(FairyClaw)与其他流行的 AI 智能体系统进行了对比。

  • 得分:在实际完成任务方面,FairyClaw 的表现与其他系统相当,甚至更优。
  • 成本:这是最大的胜利。与其他系统的平均水平相比,FairyClaw 使用的令牌数量减少了 48%(即金钱/计算能力)。
    • 类比:如果其他系统就像一辆在城市中穿梭的送货卡车,在每一个转弯处都大声朗读给司机听一张巨大的地图,那么 FairyClaw 就像是一个 GPS,它只向司机显示下一个转弯,并将地图的其余部分隐藏起来,直到需要时才显示。
  • “代码修复”测试:在涉及修复有缺陷代码的特定任务中,FairyClaw 是当之无愧的赢家。由于“正式技能”强制 AI 在完成前验证其工作,因此它避免了其他智能体所犯的那些愚蠢错误。

总结

该论文认为,我们应停止将 AI 技能视为冗长、模糊的操作手册,转而将其视为严格、可执行的软件协议。通过将规则从"AI 阅读的文本”转变为"AI 运行的代码”,我们可以获得运行成本更低、更难被欺骗、且更擅长遵循复杂流程的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →