想象一下,你有一位才华横溢但固执己见的厨师(即任务大语言模型),他精通烹饪,却拒绝更改食谱或学习新技法。他“固守”着自己的方式。你希望他能烹制出一顿完美而复杂的盛宴,但由于缺乏正确的指令,他频频出错。
通常,要解决这一问题,你可能会尝试从头重新培训这位厨师(既昂贵又困难),或者在他每次出错时,用新的提示语对他大声呵斥(效率低下)。
Skill-R1 是一种全新的解决方案。与其改变厨师,不如雇佣一位轻量级的副厨师(即技能生成器)。这位副厨师的唯一职责,就是撰写和重写主厨师所遵循的食谱卡片(即技能)。
以下是该系统的运作方式,分解为简单步骤:
1. 设置:厨师与副厨师
- 厨师(冻结的任务模型): 这是大型人工智能模型。它负责实际工作(烹饪盛宴/解决问题)。它从不改变自己的“大脑”,只是遵循指令。
- 副厨师(技能生成器): 这是一个小型、可训练的人工智能。它负责撰写指令。如果厨师失败,副厨师会分析出错原因,并为下一次尝试编写一份更好的食谱。
2. 过程:“尝试、失败、修正、重复”的循环
想象副厨师正在教厨师如何烘焙一款特定的蛋糕。
- 第 1 代: 副厨师写出一份食谱。厨师尝试烘焙,结果有些杂乱。
- 评分表: 一位“评判者”(即验证器)品尝蛋糕并给出分数。
- 进化: 副厨师查看分数和杂乱的蛋糕。它不只是说“再试一次”,而是为下一轮编写一份新的、改进后的食谱。
- 第 2 代: 厨师使用新食谱。蛋糕变得更好了。
- 重复: 这一过程反复进行(多轮“代际”)。副厨师根据过往成功与失败的历史,越来越擅长编写食谱。
3. 秘诀:两种类型的“表扬”
该论文提出了一种巧妙的方法来教导副厨师如何编写更好的食谱。它使用两种反馈类型,就像教练给予建议一样:
- 代内反馈(“同行评审”):
想象副厨师要求厨师同时用同一份食谱烘焙 5 个蛋糕。有些做得很好,有些则烤焦了。副厨师从中学习:“好吧,这份特定食谱比那份更好。”这有助于在当前想法中选出最佳版本。
- 代际反馈(“进度报告”):
这着眼于大局。第 5 代的食谱是否比第 1 代的食谱做出了更好的蛋糕?如果新食谱比旧食谱有所改进,副厨师就会获得巨大的奖励。这确保了系统实际上在不断进化并随时间变得更好,而不是原地打转。
4. 为何这至关重要
- 成本低廉: 你无需重新培训那个庞大而昂贵的厨师。你只需训练那个小型、廉价的副厨师。
- 适用于“上锁”的模型: 因为你没有改变厨师,所以即使厨师是“闭源”模型(例如你无法触及的专有 AI),该方法依然有效。你只需改变给予它的指令即可。
- 解决难题: 论文发现,对于简单任务,这种方法尚可。但对于复杂的多步骤任务(如浏览网站或解决包含多个步骤的数学问题),这种方法具有变革性。标准方法往往会放弃或陷入停滞,而 Skill-R1 会不断细化指令,直到问题解决。
结果
研究人员在两个具有挑战性的任务上测试了该方法:
- GAIA: 涉及阅读 PDF、电子表格和网页的真实世界任务。
- WebWalker: 一个 AI 必须浏览互联网以查找特定信息的游戏。
结果:
- 没有任何特殊指令时,厨师正确完成的任务极少(在 GAIA 上约为 6%)。
- 使用标准技巧后,表现有所提升(约为 30%)。
- 使用Skill-R1后,厨师的表现显著提升(在 GAIA 上约为 42%,在 WebWalker 上约为 26%)。
论文指出,最大的进步发生在早期(第 1 代到第 3 代),此时副厨师修正了主要错误。随后的代际(第 4 代和第 5 代)并未赋予新的超能力,但使厨师的表现变得更加一致和可靠,确保厨师不会在简单步骤上意外失败。
简而言之: Skill-R1 是一个系统,它通过让一个小型、可训练的助手根据成功与失败的经验不断重写指令,从而保持“冻结”的 AI 不偏离轨道,从而在无需重建 AI 本身的情况下,创造出更智能、更可靠的智能体。
技术摘要:Skill-R1:通过强化学习实现代理技能演进
问题陈述
代理大语言模型(LLM)日益依赖技能——即可复用的自然语言过程,用于指导规划、工具使用和动作验证。然而,当前改进这些技能的方法面临显著局限:
- 成本与不可行性:优化技能通常需要进行提示工程(prompt engineering)或对任务 LLM 本身进行微调。后者计算成本高昂、依赖特定模型,且对于闭源或专有模型往往不可行。
- 当前方法的低效性:许多系统将技能优化视为单次提示编辑问题,或依赖单轮自我修正。这些策略往往无法与下游奖励保持一致,且未能利用技能改进的循环特性。
- 信用分配复杂性:有效的技能优化是一个耦合的双层问题。一个有用的技能必须提高当前条件执行(rollout)的质量,而一个有用的修订必须成功地将观察到的成功与失败转化为下一轮更优的技能。
现有方法难以将此作为一个循环决策问题来处理,往往缺乏跨多代定向演进的 principled 目标。
方法论:Skill-R1
作者提出了Skill-R1,这是一个旨在从可验证奖励中进行实例级循环技能优化的强化学习框架。其核心创新在于将任务执行与技能改进解耦。
核心架构
- 冻结的任务 LLM:主要任务求解模型(πtask)保持冻结状态。它根据当前技能生成执行轨迹。这确保了与开源和闭源模型的兼容性,并消除了对任务模型梯度的需求。
- 轻量级技能生成器:一个独立的、可训练的策略(πθ)充当技能编辑器。它接收任务上下文、先前的执行轨迹及其验证结果作为输入,以生成修订后的技能。
- 多代循环:该过程在多个代(g)上运行。在每一代中,当前技能诱导冻结的任务模型生成一组执行轨迹。验证器对这些轨迹进行评分,并将试验、错误和奖励的历史记录追加,以指导下一轮技能修订。
双层组相对策略优化(GRPO)
为了训练技能生成器,作者引入了一个双层 GRPO 目标,在两个层级上分配信用:
- 代内优势(Aintra):比较在同一代中、基于相同技能采样的执行轨迹。这类似于标准 GRPO,将执行质量与技能质量隔离开来。
- 代际优势(Ainter):衡量执行群体平均验证性能相对于上一代的改进程度。这奖励那些将分布推向更高奖励的修订。
最终的优势信号是加权组合:
A(yg(i))=Aintra(yg(i))+λAinter(g)
其中 λ 在纯粹的代内优化与跨代改进之间进行插值。技能生成器被优化以最大化这一双层优势,鼓励生成不仅即时表现良好,而且随时间定向演进的技能。
主要贡献
- 形式化:本文将循环实例级技能演进形式化为一个双层组相对策略优化问题,明确耦合了代内的执行质量与代际的技能改进。
- 框架:提出了Skill-R1,这是一个与模型无关的框架,它在保持任务 LLM 冻结的同时训练轻量级技能生成器,使其适用于专有模型。
- 算法:引入了一种循环多代执行过程,并配合双层 GRPO 目标,该目标结合了代内和代际优势以指导定向演进。
- 实证验证:该框架在具有可验证奖励的代理任务上进行了评估,证明了其优于无技能基线和标准 GRPO 的性能。
实验结果
作者在两个需要多步推理和工具使用的基准测试上评估了 Skill-R1:GAIA(异构来源)和WebWalker(多跳网页导航)。
GAIA 基准:
- 基线:无技能的 GPT-4o-mini 仅达到 6.1% 的准确率。
- 普通 GRPO:在不进行双层分解的情况下训练编辑器,准确率提升至 29.7%。
- Skill-R1(推理):使用多代框架且不对编辑器进行基于梯度的训练,达到了 30.9%,表明执行轨迹结构本身即提供了益处。
- Skill-R1(GRPO):包含训练后编辑器的完整系统达到了 41.8% 的准确率,比普通 GRPO 高出 +12.1 个百分点。在复杂的 Level 3 任务上增益最为显著(38.5% 对比无技能基线的 0.0%)。
WebWalker 基准:
- 基线:2.0% 准确率。
- 普通 GRPO:22.0% 准确率。
- Skill-R1(GRPO):达到 26.0% 的准确率,在中等难度和多来源任务上均有显著提升(分别为 29.4% 和 28.6%)。
演进分析:
- 代际进展:性能提升大致呈单调递增,最显著的跃升发生在第 1 代和第 3 代之间。后续代(第 4 和第 5 代)主要提高了执行轨迹的一致性和可靠性,而非发现全新的能力。
- 训练与推理:训练后的编辑器(GRPO)始终优于仅推理的编辑器,特别是在 WebWalker 任务上。定性分析显示,训练后的编辑器保留了核心可执行结构并增加了安全机制,而仅推理的编辑器倾向于过拟合虚假细节,导致脆弱的产物。
意义与主张
本文主张,Skill-R1 提供了一种实用且高效的模型级适应替代方案。通过将技能优化视为一个循环的双层问题,该框架实现了:
- 黑盒兼容性:它适用于无法微调的闭源模型。
- 定向演进:它超越了启发式自我修正,转向一种原则性的、由奖励驱动的过程,随时间改进技能。
- 鲁棒性:循环结构允许系统基于聚合证据(成功与失败)而非孤立的尝试来 refine 技能。
作者得出结论,技能演进是改进代理行为的一种可行机制,特别是对于那些单次修正方法难以应对的复杂多步任务。结果表明,少数几轮编辑即可捕捉大部分能力提升,而随后的迭代则增强了可靠性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。