← 最新论文
🤖 AI

SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

SkillCoach 是一个自我进化的评估框架,通过从实际运行中推导出面向过程的标准,来评估技能选择、遵循、组合与反思,从而通过改进 LLM 智能体的评估与训练,将真正的过程质量与偶然的任务成功区分开来。

原作者: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

发布于 2026-07-03
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiayin Zhu, Kelong Mao, Yudong Guo, Dengbo He, Sulong Xu, Simiu Gu, Yutao Yue

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在招聘一名新员工来操作工厂里的一台复杂机器。你拥有一个庞大的说明书库(即“技能”),涵盖了每一种可能的工作。其中一些手册是金标准(完成工作的正确方法),而另一些则是干扰项(看起来很像但错误或属于其他机器的手册)。

问题在于,即使员工完成了工作且机器运转正常(“最终结果”),他们也可能用错了方法:也许他们选错了手册,跳过了某个安全步骤,或者仅仅是靠运气猜对了整个过程。如果你只检查机器是否正常工作,你可能会雇佣到一个实际上很危险或效率极低的人。

SkillCoach 是一个旨在解决这一问题的全新系统。它不再仅仅检查最终结果,而是像一个自我进化的监督员一样,全程观察员工的每一个操作步骤。

以下是它的工作原理,分为几个简单的概念:

1. 问题所在:“运气” vs. “技能”

在过去,AI 智能体仅根据它们是否得到了正确答案来被评判。

  • 缺陷: 一个智能体可能会选错工具,跳过三个安全检查,然后偶然猜中了正确答案。
  • 类比: 想象一个学生在做数学测试。他得到了正确答案,但他写错了公式,擦掉了正确的公式,然后最后猜出了那个数字。如果你只看最终答案,你会认为他是天才;但如果你看他的草稿纸(过程),你会发现他其实很困惑。

2. 解决方案: “自我进化的评分标准”

SkillCoach 创建了一个评分标准(一份详细的评分清单),它不仅仅关注答案,而是将工作分解为四个特定的习惯:

  1. 选择 (Selection): 他们是从库中挑选了正确的手册,还是随手抓了一个长得很像的干扰项?
  2. 遵循 (Following): 他们是否完全按照手册中的步骤操作,还是跳过了部分内容?
  3. 组合 (Composition): 如果他们使用了两本手册,他们是否按正确的顺序将它们组合在一起?
  4. 反思 (Reflection): 在点击“提交”之前,他们是否根据规则对自己的工作进行了复核?

“自我进化”的部分:
起初,系统的清单只是一个草案。随着 AI 尝试执行任务,SkillCoach 会观察它在哪里失败。然后,它会更新自己的清单,以便下次能更好地捕捉到这些特定的错误。

  • 类比: 想象一位老师在出卷子。在批改完第一批学生的试卷后,老师意识到:“噢,有一半的学生漏掉了这个特定的规则。”于是,老师会重新编写评分标准,使该规则在下一批学生面前更加清晰。系统通过这种方式变得更擅长自我评分。

3. “干扰项”挑战

现实世界的工厂(或企业级软件)并非一尘不染。它们拥有成千上万的手册,其中许多看起来非常相似。

  • SkillCoach 在一个“嘈杂”的环境中测试 AI,在这个环境中,正确的手册混杂在 1 本无关手册和 3 本极其相似但错误的干扰项之中。
  • 发现: 即便是非常聪明的 AI 模型,在手册库变大时也经常会抓错手册。它们最终可能完成工作,但却浪费了时间或承担了风险。SkillCoach 能够捕捉到这种“不良行为”,即便最终结果看起来还不错。

4. 为什么这很重要:更好的训练

论文表明,如果你使用 SkillCoach 来过滤训练数据,你会得到一个更优秀的 AI。

  • 旧方法: 基于任何得到正确答案的尝试来训练 AI。(结果:AI 学会了如何通过猜测和跳过步骤来完成任务)。
  • SkillCoach 方法: 仅在那些既得到了正确答案、又遵循了完美流程的尝试上进行训练。
  • 结果: AI 学会成为一名可靠的工人,严格遵守规则,而不仅仅是一个靠运气的猜题者。

总结

SkillCoach 是一个不再仅仅判断 AI 智能体“是否赢了”,而是开始询问“他们是否公平竞争并遵守了规则”的系统。它构建了一个会随着学习而进化的更智能的评分系统,确保 AI 智能体不仅是碰巧成功,而是真正学会了如何在工具库混乱且充满陷阱的情况下,正确地使用它们的工具。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →