← 最新论文
💻 computer science

SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision

SkillRevise 是一个以执行为基础的框架,它通过从执行轨迹中诊断缺陷、检索修复原则并进行经验性地选择最优版本,迭代地优化不完美的初始智能体技能,从而显著提高了智能体的成功率和跨模型可迁移性,优于单次生成的生成方法。

原作者: Yuxuan Liu, Zhaochen Su, Lingyun Xie, Yuhao Zhang, Qing Zong, Jiahe Guo, Zhongwei Xie, Yiyan Ji, Yauwai Yim, Hongyu Luo, Xiyu Ren, Ruan Chenyu, Haoran Li, Yangqiu Song

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuxuan Liu, Zhaochen Su, Lingyun Xie, Yuhao Zhang, Qing Zong, Jiahe Guo, Zhongwei Xie, Yiyan Ji, Yauwai Yim, Hongyu Luo, Xiyu Ren, Ruan Chenyu, Haoran Li, Yangqiu Song

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是使用简单语言和日常类比对 SKILLREVISE 论文进行的解释。

大局观:教机器人如何“从错误中学习”

想象你雇佣了一位非常聪明但缺乏经验的实习生(AI Agent)来从事一项复杂的任务,比如组织一个巨大的仓库或调试一段计算机程序。

通常,你会给这个实习生一份手册(称为“技能/Skill”)。

  • 问题在于: 如果手册是由人类专家编写的,成本很高,而且可能并不符合实习生的思维方式。如果你要求实习生一次性写出一份属于自己的手册,他们可能会写出一些在纸面上看起来很完美、但在实际操作时却会崩溃的内容。
  • 旧方法: 以前的方法试图通过让实习生进行大量练习并缓慢“进化”指令来修复手册。但这需要耗费大量时间,而且如果初始手册质量很差(即“冷启动”问题),效果并不理想。

SKILLREVISE 是一个全新的系统,它扮演着一个严厉但乐于助人的教练的角色。它不会等待实习生通过数月的练习来学习,而是拿出一份粗略的手册草案,让实习生尝试执行,观察他们在哪里失败,然后根据该特定失败点立即修改手册


它是如何工作的:“教练循环圈”

论文描述了一个不断重复(通常进行三次)的四步循环,以完善手册:

1. 试运行(执行/Execution)

实习生使用当前版本的手册尝试完成任务。

  • 类比: 实习生尝试组装一个书架。他们遵循指令进行操作,但书架摇晃并倒塌了。

2. 尸检(诊断/Diagnosis)

系统不仅仅是说“你失败了”。它像一名侦探一样工作。它观察证据(摇晃的书架)并询问:

  • 哪里出了错?(我们是不是用了错误的螺丝?)
  • 哪里做得对?(木头切割得很完美,所以不要改动那部分。)
  • 类比: 教练说:“你没有把木头量错,但你跳过了检查地板是否平整的步骤。另外,保留关于打磨木材的部分;那做得很好。”

3. 智慧图书馆(原则记忆/Principle Memory)

系统会检查一个“通用修理规则库”。它寻找的不是针对这个特定书架的答案,而是寻找关于如何修理摇晃书架这类问题的通用规则。

  • 类比: 教练从一副卡片中抽出一张,上面写着:“规则 #4:在搭建框架之前,务必检查地基。”

4. 重写(修订/Revision)

系统结合侦探的报告和通用规则来重写手册。至关重要的一点是,它添加了**“锚点”(Anchors)**。

  • 什么是锚点? 这些是特定的检查点。手册不再只是说“小心建造”,而是改为“在此处暂停,检查地板是否平整,如果地面不平,请停止”。
  • 类比: 新手册现在贴了一个红色的便利贴:“在钉钉子之前,停下来检查地板是否平整。”

5. 最终决策(效用门控/Utility Gate)

实习生尝试使用手册。

  • 如果新手册的效果更好,系统就会保留它。
  • 如果新手册让情况变得更糟,系统会将其丢弃,并回到之前的版本。
  • 类比: 教练尝试新的说明书。如果书架仍然摇晃,他们会说:“好吧,那个新主意很糟糕。让我们回到旧的指令,下次尝试另一种修复方法。”

为什么它很特别?

论文强调了这种方法优于以往方法的三个主要原因:

  1. 它对冷启动友好(容易上手): 你不需要拥有一个包含 1,000 份完美手册的库才能开始。你只需要一份不完美的手册,SKILLREVISE 就能快速修复它。
  2. 它不仅仅是“更多练习”: 旧方法让 AI 进行数千次练习来学习。SKILLREVISE 则像是针对性的手术。它找到指令中的特定缺陷并进行修复,而不是寄希望于 AI 通过偶然尝试来摸索出窍。
  3. 它学习的是通用规则,而非小技巧: 系统非常小心,不会教 AI 为了通过这次特定测试而“作弊”。它教 AI 如何处理这类问题
    • 坏的技能: “如果测试要求按红色按钮,就按红色按钮。”(这只对那一次测试有效)。
    • 好的技能 (SKILLREVISE): “在按下按钮之前,始终对照图表核实按钮颜色。”(这适用于任何测试)。

结果:它有效吗?

作者在三个不同的“考场”(基准测试)上测试了不同的 AI 模型(如 GPT-4o、Qwen 和 DeepSeek)。

  • 得分: 在没有任何帮助的情况下,AI 只能完成约 36% 的任务。使用一次性生成且永不修改的手册(one-shot manual)时,得分约为 39%
  • SKILLREVISE 得分: 经过仅仅 三轮 这样的“教练循环”后,AI 完成了 61% 的任务。
  • 核心结论: 该系统能非常迅速地将一份平庸的手册转化为一份高效的手册。它还证明了这些改进后的手册可以被不同的 AI 模型使用,而不仅仅是编写它们的那个模型,这证明了所习得的技能是真正的通用知识,而非特定的小技巧。

总结

SKILLREVISE 是一个将 AI “技能”视为动态文档而非静态指令的框架。它利用 尝试 \rightarrow 诊断 \rightarrow 检索通用规则 \rightarrow 重写 \rightarrow 测试 的循环,将一份糟糕的指令变成一份优秀的手册,确保 AI 不仅仅是在死记硬背答案,而是在真正学习如何正确地开展工作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →