想象一下,你正在教一个机器人把一只沉重的箱子推过房间。大多数标准的机器人训练师会教机器人找到一种完美的方法来完成它:“从左边推,向前滑动,搞定。”如果地板变滑了或者箱子移位了,这种单一的策略可能会失败,机器人就会卡住。
这篇论文认为,一个聪明的机器人应该学会多种不同的方法来解决同一个问题。也许一种策略是从左边推,另一种是从右边推,第三种则是把它抬起来搬运。拥有一个策略“工具箱”会让机器人更加稳健。
然而,教机器人保持多样性是极其困难的。如果你只是告诉机器人“要与众不同”,它往往会感到困惑。它可能会通过在空中挥舞手臂来试图变得不同(这确实不同但毫无用处),或者它可能会在试图寻找新方法时陷入困境,甚至意外撞到其他东西。
作者提出了一种名为“轨迹优先”(Trajectory First)的新训练方法。这就像一位大厨培训新学徒时的两步课程。
第一步:“飞行模拟器”阶段(探索)
作者并没有立即教机器人一步步地做出反应,而是首先将机器人带出“现实世界”,将其放入一个飞行模拟器中,让它能够一次性规划整个动作。
- 类比:想象你试图在一个巨大、迷雾笼罩的迷宫中找到最佳路线。如果你只是像往常一样一步接一步地走并四处张望,你可能会被困死胡同里。
- 论文的技巧:作者使用了一种名为B 样条的数学工具。把这想象成在迷宫中画一根平滑、灵活的导线。机器人不是一步步移动,而是仅仅调整这根导线的形状。
- 目标:他们使用一种“搜索引擎”(一种进化策略)来扭动这些导线,直到找到许多不同的路径,这些路径都能成功地将机器人带到目标点。他们此时并不寻找完美的路径;他们只想要一大堆不同的成功路径。
- 为何有效:因为他们是一次性移动整根“导线”,机器人可以瞬间从迷宫的一边跳到另一边,发现那些步步为营的机器人永远无法找到的路线,因为后者会因为害怕迈出第一步而止步不前。
第二步:“现实世界”阶段(蒸馏)
现在,机器人已经拥有了一个由成功的、多样化的“导线”(轨迹)组成的库,是时候教它如何在现实生活中驾驶了。
- 类比:你利用所有那些完美的飞行模拟器路线,教学徒如何反应式地驾驶汽车。学徒学会了:“如果我看到左边有墙,我就向右转。如果我看到右边有墙,我就向左转。”
- 挑战:通常,当你从模拟器切换到现实生活时,机器人会忘记它的多样性,退回到只有一种安全、枯燥的做事方式。
- 论文的解决方案:他们引入了三种“稳定器”来保持机器人的多样性:
- 对称采样:他们将旧的模拟器数据与新现实世界数据按 50/50 的比例混合。这就像告诉学徒:“记住我们在模拟器中发现的那些酷路线吗?在学习新道路的同时,继续练习这些路线。”
- “迄今为止最佳”技巧:他们不断更新“成功”的定义。与其说“你必须完美”,不如说“你必须至少达到我们迄今为止所见到的最好水平”。这防止了机器人过早变得过于贪婪,从而扼杀其自身的多样性。
- 快速更新:他们让机器人以比平时快得多的速度从错误中学习。由于“多样性”的定义随着机器人的学习而变化,机器人需要快速更新其“大脑”以跟上不断变化的目标。
结果
作者在必须推方块、按按钮和穿越迷宫的机器人上测试了这种方法。
- 旧方法:机器人找到了一两种完成任务的方法,通常被困在同一个“局部最优解”(即同一个安全但枯燥的解决方案)中。
- 新方法:机器人发现了各种各样富有创意的解决方案。对于按按钮的任务,有些机器人用手肘,有些用手腕,还有些用整个身体去按按钮。它们都完成了工作,但方式截然不同。
总结
该论文声称,要让机器人真正具备多样性和稳健性,你不能在它一步步学习时仅仅要求它“与众不同”。你首先需要让它在安全、灵活的空间中构想出许多不同的成功计划(即“轨迹优先”阶段),然后仔细教导它如何在现实世界中执行这些计划,同时不丧失其创造力。
这种方法解决了机器人陷入局部循环的问题,并确保它们拥有一个丰富的策略“工具箱”,以应对环境中意想不到的变化。
技术摘要:轨迹优先:一种发现多样化策略的课程
问题陈述
强化学习(RL)方法通常假设动作分布是单峰的,从而产生单一策略,这种策略对环境扰动可能较为脆弱,且容易陷入局部最优。虽然发现一组多样化的策略可以最大化鲁棒性,但现有的约束多样性优化方法在机器人操作等复杂、接触丰富的任务中经常失败。
identified 的核心挑战是探索不足。在机器人操作等领域,物体状态由间歇性接触介导,导致动作与状态之间的映射是非平滑的,且主要由接触不连续性主导。因此,追求多样性的目标往往坍缩为少数几个模式,因为替代策略被发现得过于稀少而无法得到强化。标准的局部探索方法(例如策略空间中的高斯噪声)不足以在这些环境中跨越不连通的高奖励流形。
方法论:两阶段课程
作者提出了“轨迹优先”(Trajectory First),这是一种旨在通过将全局轨迹探索与反应式策略学习解耦来克服探索瓶颈的课程。该方法包含两个 distinct 阶段:
阶段 1:轨迹空间中的约束新颖性搜索(CNS)
第一阶段不直接优化神经网络参数,而是使用进化策略(ES)探索开环轨迹空间。
- 基于样条的参数化:轨迹 τ 被参数化为由控制点 ω 定义的 B 样条。与原始动作序列相比,这提供了平滑的归纳偏置,并降低了搜索空间的维度。
- 优化目标:目标是找到一组轨迹参数 Ωn,在满足近最优性约束(vωi≥αv∗)的前提下最大化多样性。
- 约束新颖性搜索:作者引入了一个拉格朗日目标,平衡了基于轨迹集熵(通过 k-NN 距离估计)的内在新颖性奖励和外在任务奖励。
- 优化算法:控制点 ω 使用 CMA-ES 进行优化,该方法对于 B 样条中等规模的参数空间非常高效。这使得算法能够“跳跃”不同模式,发现局部策略空间搜索会错过的多样化高奖励锚点。
阶段 2:蒸馏为反应式策略
在阶段 1 中发现的多样化轨迹,通过约束离线策略学习被蒸馏为一组 n 个反应式、技能条件的策略 Πn。
- 框架:作者采用 Domino 框架,将多样性目标的梯度视为内在奖励。
- 稳定化技术:为了确保在接触丰富的任务中从离线轨迹数据到在线反应式策略的稳定蒸馏,引入了三个关键修改:
- 对称采样:训练批次由 50% 的在线数据和 50% 的过滤后的 CNS 轨迹(从回报最高的前 25% 中选取)组成。这防止了在过渡到在线强化学习期间的多样性坍缩。
- vmax-技巧:作者不依赖单一专家策略来估计最优值 v∗,而是将 v∗ 更新为所有技能及整个训练历史中达到的最大性能(v∗←max{v∗,maxivi})。这为非最优性约束提供了一个单调递增的稳定目标,防止多样性目标被过早的最优性压力所扼杀。
- 高策略更新 - 数据比(UTD):与标准离线到在线强化学习中频繁更新评论家而低频更新策略不同,该方法增加了策略更新频率(例如,每个环境步更新 4 次)。这是必要的,因为内在奖励依赖于当前策略集的状态占用;频繁的策略更新使智能体能够跟上不断变化的内在景观。
主要贡献
- 探索瓶颈的经验识别:该工作证明,现有的约束多样性优化方法(如 Domino)在机器人操作任务中无法发现多样化策略,原因是局部探索无法跨越不连通的高奖励区域。
- 轨迹优先课程:一种新颖的两阶段方法,利用基于样条的轨迹上的进化搜索来生成多样化的高奖励锚点,随后将其蒸馏为反应式策略。
- 稳定化配方:一组技术(对称采样、vmax-技巧、高策略 UTD),实现了多样性目标的稳定离线到在线学习,解决了约束设置中内在奖励的非平稳性问题。
实验结果
该方法在四个机器人任务上进行了评估:迷宫导航、方块推挤、按钮按压和方块翻转。
- 多样性与性能:与最强基线(Domino)相比,所提出的课程实现了1.5 倍的行为多样性提升,同时保持了相当的任务性能。
- 特定任务发现:
- 在迷宫导航中,该方法发现了数量最多的不同路径,而基线倾向于聚集在安全、无碰撞的路线周围。
- 在按钮按压中,基线往往坍缩为对所有技能使用相同的机器人连杆。所提出的方法成功发现了使用不同机器人连杆的全身操作策略。
- 在方块翻转中,该方法发现了多样化的接触模式和力分布,而基于噪声探索的基线由于频繁碰撞和负奖励而失败。
- 鲁棒性:该方法在对抗性奖励设定(例如高碰撞惩罚)下保持鲁棒,而基线则完全无法与物体交互,因为 CNS 阶段提供了高奖励区域内的预热启动。
意义与主张
该论文声称,机器人约束多样性优化的主要瓶颈并非学习目标本身,而是对局部探索的依赖。通过引入基于样条的轨迹先验作为归纳偏置,作者使得发现多样化接触模式成为可能,而这些模式通常是标准策略空间搜索无法触及的。
作者将这项工作定位为多样性优化中“探索 - 利用”权衡的解决方案。他们认为,虽然先前的工作假设多样化的高奖励行为在在线策略优化下很容易达到,但这一假设在复杂的操作任务中并不成立。所提出的课程弥合了全局轨迹级探索与反应式控制之间的差距,为训练鲁棒、多样化的智能体提供了一套实用的方案。作者谦逊地指出了局限性,例如依赖手动定义的状态特征来衡量多样性,以及阶段之间的固定转换,并建议未来的工作可以探索自适应切换和从原始观测中学习表示。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。