← 最新论文
🤖 AI

ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL

ReSkill 是一种新颖的智能体强化学习(agentic RL)框架,它通过将断言驱动的技能修订、组内展开采样以及汤普森采样嵌入到 GRPO 算法中,从而将技能创建与策略优化相统一,实现了可重用策略与策略的自动协同演化,以在未见任务上达到卓越的泛化性能。

原作者: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

发布于 2026-06-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Zelin He, Haotian Lin, Boran Han, Wei Zhu, Haoyang Fang, Bernie Wang, Xuan Zhu, Runze Li, Matthew Reimherr

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

以下是关于 RESKILL 论文的解释,已将其转化为通俗易懂的语言,并采用了创意类比。

核心理念:教机器人如何在学习的过程中“学习”

想象一下,你正在教一个机器人玩一款复杂的电子游戏。

  • 传统方式: 你教机器人规则,让它去玩;当它失败时,你手动写下一条新的规则(即“技能”)让它下次遵循。但问题在于:随着机器人变得越来越厉害,它的游戏风格也在不断变化。如果你根据它昨天的表现写下一条新规则,这条规则在今天可能会让它感到困惑,因为它已经进化了。这就像是用一本为成年人编写的手册来教蹒跚学步的幼儿系鞋带;幼儿已经超越了旧的指令,而新的指令尚未经过测试。
  • RESKILL 的方式: RESKILL 不再是在单独的笔记本上写规则,而是将“编写规则”的过程变成了游戏本身的一部分。它创建了一个在训练循环内运行的“规则制造工厂”。机器人在学习的过程中尝试新规则,观察它们是否有帮助,保留好的规则,同时丢弃糟糕的规则,这一切都是实时发生的。

核心问题:“不匹配”现象

论文指出,现有方法普遍存在 技能与策略冲突(Skill-Policy Conflict)

  • 策略(Policy): 这是机器人的大脑(它的游戏策略)。随着学习的进行,它在不断变化。
  • 技能(Skills): 这些是可重用的技巧或捷径(例如“总是先检查冰箱”或“在猜测前先搜索”)。
  • 冲突点: 现有方法将技能的创建与大脑的训练分开进行。它们可能会创造出一个适用于“旧”大脑的技能,但这个技能却与“新”大脑发生冲突。这就像教练在球员比赛中途给他们发了一本新的战术手册,却完全没有检查球员是否真的理解了这些新动作。

RESKILL 如何运作:“试吃”厨房

RESKILL 通过将技能创建直接集成到训练过程中来解决这个问题,主要使用了三个机制,作者称之为 “协调技能创建与策略优化”

1. “小组试吃” (组内采样/Within-Group Sampling)

想象一场烹饪比赛,厨师(AI)必须制作一道菜。

  • 标准方法: 厨师使用同一种食谱制作 10 道菜。然后,评论家写下一份新食谱。厨师稍后才会尝试新食谱。
  • RESKILL 方法: 厨师接到 10 个订单。对于其中的 5 个订单,他们使用旧食谱;对于另外 5 个订单,他们使用新食谱(即时生成的)。
  • 为什么有效: 因为厨师在处理这 10 个订单时的情绪和状态是完全相同的,唯一的变量就是食谱。系统可以立即看出:“这个新食谱是否让厨师在当下获得了更高的分数?”这实现了一种公平、受控的对比,无需额外的资源或时间。

2. “自我修复”的规则书 (基于断言的创建器/Assertion-Driven Creator)

当厨师做砸了一道菜时,通常需要人类介入并说:“你忘了给汤加盐了。”RESKILL 将这一过程自动化了。

  • 它维护着一个储水池(Reservoir),记录了厨师每一次成功和失败的时刻。
  • 它使用一个“侦探”(大语言模型/LLM)来观察这个储水池并询问:“哪里出错了?我们是不是忘了检查烤箱?还是找错了食材?”
  • 基于这些模式,系统会自动写下一条新的“技能”(规则,如:如果你看到锅,在搅拌前先检查温度)。
  • 至关重要的一点是: 它不仅仅是靠猜。它会利用上述的“小组试吃”机制,立即将这条新规则与旧规则进行对比测试。

3. “聪明的赌徒” (汤普森采样/Thompson Sampling)

系统如何决定尝试“新食谱”与“旧食谱”的次数比例?

  • 如果新食谱看起来很有前景,系统就会增加尝试它的频率。
  • 如果新食谱看起来很糟,系统就会减少尝试它的频率。
  • 转折点: 机器人的大脑每秒都在进化。十分钟前有效的规则现在可能已经过时了。RESKILL 使用了一种被称为 “带有自适应折扣的汤普森采样” 的数学技巧。
    • 这就像一个赌徒知道昨天的中奖号码对今天毫无意义。
    • 如果机器人最近尝试过这个新食谱很多次,系统就会信任最新的数据,并忽略旧数据(即“折扣化”处理)。
    • 如果机器人尝试的次数很少,它就会保留旧数据,以避免仅凭一次糟糕的尝试就做出草率的决定。
    • 这确保了系统始终在为机器人当前的大脑下注,而不是为过去的大脑下注。

结果:为什么这很重要

论文在多个“游戏”(任务)上测试了 RESKILL:

  1. 家务琐事 (ALFWorld): 在虚拟房屋中移动物体。
  2. 搜索引擎: 通过搜索网络来回答复杂问题。
  3. 科学与编程: 解决物理问题并编写 SQL 代码。

研究发现:

  • 擅长处理难题: RESKILL 不仅仅是表现稍好,它在未见过的任务(从未接触过的任务)上彻底碾压了竞争对手。这是因为它学到的技能是灵活且通用的,而非死记硬背的答案。
  • 无额外成本: 它不需要机器人把游戏玩两遍。它是在正常的训练步骤中进行技能测试的。
  • 自我修正: 系统会自动“修剪”(删除)那些随着机器人变得更聪明而不再起作用的技能。这是一个会随着需求自动增长或缩减的动态技能库。

总结类比

想象一支足球队

  • 旧方法: 教练观察比赛,在白板上写下一个新战术,并告诉球队下周再试。与此同时,球员们的阵型已经变了,所以新战术并不适用。
  • RESKILL: 教练在比赛进行时就在场上。每当球队发起进攻时,一半的球员尝试旧战术,另一半则尝试根据刚才的失误即时发明的针对性新战术。教练能瞬间看到哪种战术在当下能进球,并告诉球队坚持使用它。球队的策略演进与其战术手册的更新同步进行,达到了完美的和谐。

简而言之,RESKILL 停止了将“学习如何玩游戏”和“学习规则”视为两项独立工作的做法。它将两者合二为一,让 AI 能够同时构建更好的大脑和更好的规则书。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →