← 最新论文
🤖 machine learning

Skill-R1: Agent Skill Evolution via Reinforcement Learning

Skill-R1 是一种强化学习框架,它通过一个采用双层目标训练的轻量级生成器来优化可复用的自然语言技能,从而在不更新底层冻结模型的前提下,以低成本且与模型无关的方式提升智能体大语言模型在复杂任务上的表现。

原作者: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

发布于 2026-05-12
📖 1 分钟阅读☕ 轻松阅读

原作者: Yash Vishe, Rohan Surana, Xunyi Jiang, Zihan Huang, Xintong Li, Nikki Lijing Kuang, Tong Yu, Ryan A. Rossi, Jingbo Shang, Julian McAuley, Junda Wu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你有一位才华横溢但固执己见的厨师(即任务大语言模型),他精通烹饪,却拒绝更改食谱或学习新技法。他“固守”着自己的方式。你希望他能烹制出一顿完美而复杂的盛宴,但由于缺乏正确的指令,他频频出错。

通常,要解决这一问题,你可能会尝试从头重新培训这位厨师(既昂贵又困难),或者在他每次出错时,用新的提示语对他大声呵斥(效率低下)。

Skill-R1 是一种全新的解决方案。与其改变厨师,不如雇佣一位轻量级的副厨师(即技能生成器)。这位副厨师的唯一职责,就是撰写和重写主厨师所遵循的食谱卡片(即技能)。

以下是该系统的运作方式,分解为简单步骤:

1. 设置:厨师与副厨师

  • 厨师(冻结的任务模型): 这是大型人工智能模型。它负责实际工作(烹饪盛宴/解决问题)。它从不改变自己的“大脑”,只是遵循指令。
  • 副厨师(技能生成器): 这是一个小型、可训练的人工智能。它负责撰写指令。如果厨师失败,副厨师会分析出错原因,并为下一次尝试编写一份更好的食谱。

2. 过程:“尝试、失败、修正、重复”的循环

想象副厨师正在教厨师如何烘焙一款特定的蛋糕。

  1. 第 1 代: 副厨师写出一份食谱。厨师尝试烘焙,结果有些杂乱。
  2. 评分表: 一位“评判者”(即验证器)品尝蛋糕并给出分数。
  3. 进化: 副厨师查看分数和杂乱的蛋糕。它不只是说“再试一次”,而是为下一轮编写一份新的、改进后的食谱。
  4. 第 2 代: 厨师使用新食谱。蛋糕变得更好了。
  5. 重复: 这一过程反复进行(多轮“代际”)。副厨师根据过往成功与失败的历史,越来越擅长编写食谱。

3. 秘诀:两种类型的“表扬”

该论文提出了一种巧妙的方法来教导副厨师如何编写更好的食谱。它使用两种反馈类型,就像教练给予建议一样:

  • 代内反馈(“同行评审”):
    想象副厨师要求厨师同时同一份食谱烘焙 5 个蛋糕。有些做得很好,有些则烤焦了。副厨师从中学习:“好吧,这份特定食谱比那份更好。”这有助于在当前想法中选出最佳版本。
  • 代际反馈(“进度报告”):
    这着眼于大局。第 5 代的食谱是否比第 1 代的食谱做出了更好的蛋糕?如果新食谱比旧食谱有所改进,副厨师就会获得巨大的奖励。这确保了系统实际上在不断进化并随时间变得更好,而不是原地打转。

4. 为何这至关重要

  • 成本低廉: 你无需重新培训那个庞大而昂贵的厨师。你只需训练那个小型、廉价的副厨师。
  • 适用于“上锁”的模型: 因为你没有改变厨师,所以即使厨师是“闭源”模型(例如你无法触及的专有 AI),该方法依然有效。你只需改变给予它的指令即可。
  • 解决难题: 论文发现,对于简单任务,这种方法尚可。但对于复杂的多步骤任务(如浏览网站或解决包含多个步骤的数学问题),这种方法具有变革性。标准方法往往会放弃或陷入停滞,而 Skill-R1 会不断细化指令,直到问题解决。

结果

研究人员在两个具有挑战性的任务上测试了该方法:

  1. GAIA: 涉及阅读 PDF、电子表格和网页的真实世界任务。
  2. WebWalker: 一个 AI 必须浏览互联网以查找特定信息的游戏。

结果:

  • 没有任何特殊指令时,厨师正确完成的任务极少(在 GAIA 上约为 6%)。
  • 使用标准技巧后,表现有所提升(约为 30%)。
  • 使用Skill-R1后,厨师的表现显著提升(在 GAIA 上约为 42%,在 WebWalker 上约为 26%)。

论文指出,最大的进步发生在早期(第 1 代到第 3 代),此时副厨师修正了主要错误。随后的代际(第 4 代和第 5 代)并未赋予新的超能力,但使厨师的表现变得更加一致和可靠,确保厨师不会在简单步骤上意外失败。

简而言之: Skill-R1 是一个系统,它通过让一个小型、可训练的助手根据成功与失败的经验不断重写指令,从而保持“冻结”的 AI 不偏离轨道,从而在无需重建 AI 本身的情况下,创造出更智能、更可靠的智能体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →