🤖 AI
ReSkill: Reconciling Skill Creation with Policy Optimization in Agentic RL
ReSkill 是一种新颖的智能体强化学习(agentic RL)框架,它通过将断言驱动的技能修订、组内展开采样以及汤普森采样嵌入到 GRPO 算法中,从而将技能创建与策略优化相统一,实现了可重用策略与策略的自动协同演化,以在未见任务上达到卓越的泛化性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
以下是关于 RESKILL 论文的解释,已将其转化为通俗易懂的语言,并采用了创意类比。
核心理念:教机器人如何在学习的过程中“学习”
想象一下,你正在教一个机器人玩一款复杂的电子游戏。
- 传统方式: 你教机器人规则,让它去玩;当它失败时,你手动写下一条新的规则(即“技能”)让它下次遵循。但问题在于:随着机器人变得越来越厉害,它的游戏风格也在不断变化。如果你根据它昨天的表现写下一条新规则,这条规则在今天可能会让它感到困惑,因为它已经进化了。这就像是用一本为成年人编写的手册来教蹒跚学步的幼儿系鞋带;幼儿已经超越了旧的指令,而新的指令尚未经过测试。
- RESKILL 的方式: RESKILL 不再是在单独的笔记本上写规则,而是将“编写规则”的过程变成了游戏本身的一部分。它创建了一个在训练循环内运行的“规则制造工厂”。机器人在学习的过程中尝试新规则,观察它们是否有帮助,保留好的规则,同时丢弃糟糕的规则,这一切都是实时发生的。
核心问题:“不匹配”现象
论文指出,现有方法普遍存在 技能与策略冲突(Skill-Policy Conflict)。
- 策略(Policy): 这是机器人的大脑(它的游戏策略)。随着学习的进行,它在不断变化。
- 技能(Skills): 这些是可重用的技巧或捷径(例如“总是先检查冰箱”或“在猜测前先搜索”)。
- 冲突点: 现有方法将技能的创建与大脑的训练分开进行。它们可能会创造出一个适用于“旧”大脑的技能,但这个技能却与“新”大脑发生冲突。这就像教练在球员比赛中途给他们发了一本新的战术手册,却完全没有检查球员是否真的理解了这些新动作。
RESKILL 如何运作:“试吃”厨房
RESKILL 通过将技能创建直接集成到训练过程中来解决这个问题,主要使用了三个机制,作者称之为 “协调技能创建与策略优化”。
1. “小组试吃” (组内采样/Within-Group Sampling)
想象一场烹饪比赛,厨师(AI)必须制作一道菜。
- 标准方法: 厨师使用同一种食谱制作 10 道菜。然后,评论家写下一份新食谱。厨师稍后才会尝试新食谱。
- RESKILL 方法: 厨师接到 10 个订单。对于其中的 5 个订单,他们使用旧食谱;对于另外 5 个订单,他们使用新食谱(即时生成的)。
- 为什么有效: 因为厨师在处理这 10 个订单时的情绪和状态是完全相同的,唯一的变量就是食谱。系统可以立即看出:“这个新食谱是否让厨师在当下获得了更高的分数?”这实现了一种公平、受控的对比,无需额外的资源或时间。
2. “自我修复”的规则书 (基于断言的创建器/Assertion-Driven Creator)
当厨师做砸了一道菜时,通常需要人类介入并说:“你忘了给汤加盐了。”RESKILL 将这一过程自动化了。
- 它维护着一个储水池(Reservoir),记录了厨师每一次成功和失败的时刻。
- 它使用一个“侦探”(大语言模型/LLM)来观察这个储水池并询问:“哪里出错了?我们是不是忘了检查烤箱?还是找错了食材?”
- 基于这些模式,系统会自动写下一条新的“技能”(规则,如:如果你看到锅,在搅拌前先检查温度)。
- 至关重要的一点是: 它不仅仅是靠猜。它会利用上述的“小组试吃”机制,立即将这条新规则与旧规则进行对比测试。
3. “聪明的赌徒” (汤普森采样/Thompson Sampling)
系统如何决定尝试“新食谱”与“旧食谱”的次数比例?
- 如果新食谱看起来很有前景,系统就会增加尝试它的频率。
- 如果新食谱看起来很糟,系统就会减少尝试它的频率。
- 转折点: 机器人的大脑每秒都在进化。十分钟前有效的规则现在可能已经过时了。RESKILL 使用了一种被称为 “带有自适应折扣的汤普森采样” 的数学技巧。
- 这就像一个赌徒知道昨天的中奖号码对今天毫无意义。
- 如果机器人最近尝试过这个新食谱很多次,系统就会信任最新的数据,并忽略旧数据(即“折扣化”处理)。
- 如果机器人尝试的次数很少,它就会保留旧数据,以避免仅凭一次糟糕的尝试就做出草率的决定。
- 这确保了系统始终在为机器人当前的大脑下注,而不是为过去的大脑下注。
结果:为什么这很重要
论文在多个“游戏”(任务)上测试了 RESKILL:
- 家务琐事 (ALFWorld): 在虚拟房屋中移动物体。
- 搜索引擎: 通过搜索网络来回答复杂问题。
- 科学与编程: 解决物理问题并编写 SQL 代码。
研究发现:
- 擅长处理难题: RESKILL 不仅仅是表现稍好,它在未见过的任务(从未接触过的任务)上彻底碾压了竞争对手。这是因为它学到的技能是灵活且通用的,而非死记硬背的答案。
- 无额外成本: 它不需要机器人把游戏玩两遍。它是在正常的训练步骤中进行技能测试的。
- 自我修正: 系统会自动“修剪”(删除)那些随着机器人变得更聪明而不再起作用的技能。这是一个会随着需求自动增长或缩减的动态技能库。
总结类比
想象一支足球队:
- 旧方法: 教练观察比赛,在白板上写下一个新战术,并告诉球队下周再试。与此同时,球员们的阵型已经变了,所以新战术并不适用。
- RESKILL: 教练在比赛进行时就在场上。每当球队发起进攻时,一半的球员尝试旧战术,另一半则尝试根据刚才的失误即时发明的针对性新战术。教练能瞬间看到哪种战术在当下能进球,并告诉球队坚持使用它。球队的策略演进与其战术手册的更新同步进行,达到了完美的和谐。
简而言之,RESKILL 停止了将“学习如何玩游戏”和“学习规则”视为两项独立工作的做法。它将两者合二为一,让 AI 能够同时构建更好的大脑和更好的规则书。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。