想象一下,你正在教一个机器人打结、画一个"8"字形,或者倒一杯豆子。你向机器人演示了几次,希望它能学会这项技能,以至于即使你碰了它的手臂,或者它从一个略有不同的位置开始,它也能完成动作。
本文介绍了一种教机器人的新方法,称为相位变化神经势函数(PNPF)。为了理解其工作原理,让我们使用几个日常生活中的类比。
问题:"十字路口"的困惑
目前大多数机器人学习方法就像GPS 导航应用。
- 优点: 如果你直线行驶,GPS 会准确告诉你该去哪里。
- 缺点: 想象你在一条像"8"字形那样绕回自身的道路上行驶。在交叉路口,你两次处于完全相同的位置,但第一次你需要左转,第二次你需要右转。
- 失败之处: 标准 GPS(或标准机器人模型)会感到困惑。它查看你的位置和速度,发现你处于交叉路口,却不知道该往哪边走。如果你撞了车(受到干扰),GPS 可能会迷路,因为它依赖你的速度来判断你处于循环的哪一部分。如果你的速度不对,方向也就错了。
其他方法试图通过使用计时器(如音乐播放列表)来解决这个问题。它们会说:"5 秒时左转;10 秒时右转。"
- 失败之处: 如果你撞了车,车子停了一秒,计时器仍在走动。当车子再次启动时,计时器显示"右转!",但车子仍停留在"左转"的位置。机器人错过了指令并发生碰撞。
解决方案:"智能徒步小径"
作者提出了一种新方法,它就像一条带有特殊地图的智能徒步小径。
1. "能量景观"(地形)
与其使用 GPS 或计时器,不如想象机器人是一个沿着山坡行走的徒步者。
- 目标位于山谷底部(低能量处)。
- 机器人自然地滚向目标。这是标称能量。它告诉机器人:"沿着路径继续前进。"
2. "安全围栏"(边界)
有时,强风可能会将徒步者吹离小径。
- 系统拥有一种安全能量,它像一道温柔而看不见的围栏。如果机器人偏离了它学习的路径太远,这道围栏会温柔地将其推回安全的、经过演示的区域。它不会强迫机器人停留在单一线上;它只是确保机器人保持在人类向它展示的"安全区域"内。
3. "相位变量"(进度条)
这是关键所在。如果机器人两次处于相同的位置,它如何知道自己在"8"字形的哪一部分?
- 机器人不使用计时器,而是使用基于它沿山坡向下移动距离的进度条。
- 随着机器人移动,能量景观的"高度"会发生变化。机器人通过查看到达目标还剩下多少"能量"来计算其进度。
- 为何更好: 如果你撞了机器人,它不会在时间上迷失位置。它只需查看地形并说:"我仍然在山坡的高处,所以我需要继续向下走。"它根据当前位置而非时钟,自动确定自己在任务中的位置。
现实生活中的运作方式
研究人员在真实机器人(UR10 机械臂)上测试了这项技术,涉及三项任务:
- 打结: 机器人必须将绳子绕在圆柱体上并塞进去。这很棘手,因为绳子会交叉。
- 倒豆子: 将一杯豆子移动到容器中。
- 擦拭: 一个"8"字形动作(周期性任务)。
结果:
- 鲁棒性: 当研究人员在机器人工作时物理推动其手臂或移动桌子时,机器人并未感到困惑。它只是根据所在位置重新计算其"进度",并流畅地继续任务。
- 无跳过: 与其他在受撞击时可能会跳过步骤或重复动作的方法不同,该机器人保持了任务的连贯性。
- 障碍物: 他们在机器人的路径上放置了立方体。机器人成功地绕过了它们,而没有中断任务。
核心结论
本文提出了一种教机器人的方法,结合了双方的最佳优势:
- 它具有反应性,不依赖时钟(因此可以从撞击中恢复)。
- 它具有复杂性,能够处理自身交叉的任务(如打结或画"8"字形),而不会搞错方向。
作者指出了一个小小的局限性:机器人有时会将运动中的非常尖锐的拐角平滑化,使其比人类演示的更圆润一些。但总体而言,这是制造能够学习复杂技能并应对现实世界混乱的机器人的重要一步。
以下是论文《基于相位变化神经势函数的反应式运动生成》(PNPF)的详细技术总结。
1. 问题陈述
本文探讨了机器人运动生成中“从演示学习”(LfD)的一个基本权衡:在反应性(从干扰中恢复的能力)与建模能力(处理具有交叉点或重复状态的复杂轨迹的能力)之间取得平衡。
- 仅状态动力学系统(DS): 一阶 DS 模型仅基于当前状态(位置)生成运动。它们具有高度的反应性,但在处理交叉点任务(例如绘制"8"字或打结)时会失败,因为同一位置在不同时间需要不同的速度矢量。
- 二阶/基于速度的 DS: 这些模型引入速度来消除交叉点处的运动歧义。然而,它们对干扰非常敏感;如果扰动改变了交叉点附近的速度矢量,机器人可能会选择错误的路径。此外,如果两个不同的运动段具有几乎相同的位置 - 速度对,模型会变得模糊不清。
- 时间/相位依赖方法: 运动原语(Movement Primitives)等方法使用开环时间或相位变量来处理交叉点。虽然表达性强,但它们缺乏反应性,因为进程由预定义的调度而非当前状态控制,导致在受到干扰后难以平滑恢复。
核心挑战: 如何创建一个控制策略,使其既是时间不变的(对状态具有反应性),又能处理状态重访(交叉点),同时对速度扰动保持鲁棒性。
2. 方法论:相位变化神经势函数(PNPF)
作者提出了PNPF,这是一个框架,它将神经势函数条件化于一个直接从状态进展中估计的闭环相位变量,而非开环时间。
A. 核心架构
运动通过遵循标量势函数 ϕ(x∣s) 的负梯度生成,其中 x 是状态,s 是相位变量:
x˙=−α∇xϕ(x∣s)
该势函数由两个学习到的能量项组成:
- 标称能量(ϕnominal): 编码期望的任务行为。它源自标称轨迹 x∗(t),并随着任务进展单调递减。它作为估计相位变量 s 的基础。
- 安全能量(ϕsafety): 编码数据驱动的安全集(演示期间访问的状态空间区域)。它充当排斥/吸引场,当机器人因干扰被推离演示区域时,引导其返回该区域,而不会强迫其遵循刚性路径。
B. 关键技术组件
- 闭环相位估计: 不使用时间 t,相位 s 根据当前状态动态估计。随着机器人移动,s 根据标称轨迹的剩余“弧长”或能量进行更新。这确保了系统保持时间不变且具有反应性。
- 生成式轨迹合成: 一个仅解码器的神经网络(使用超网络为演示分配可学习嵌入)生成密集的轨迹集。
- 标称轨迹被选为与演示具有最小动态时间规整(DTW)距离的轨迹。
- 安全集是使用从密集生成的轨迹集中学习到的有符号距离函数(SDF)定义的。
- 带有位置编码的神经场: 能量函数使用神经场(MLP)建模。为了确保平滑梯度(对稳定控制至关重要)并处理尖锐的曲率变化,作者使用了特定的架构:
- 相位变量 s 经过位置编码处理,并输入到一个超网络中,该超网络生成主 MLP 的权重。
- 状态 x 直接输入 MLP(不使用位置编码),以利用 ReLU 网络在空间域中的谱偏差来实现平滑性。
- 处理周期性: 对于周期性任务(例如 8 字形擦拭),相位输入被转换为正弦/余弦坐标,以处理运动的循环特性。
- 6D 运动: 方向通过将四元数映射到切空间中的轴角表示来处理,允许相同的势函数框架同时控制位置和方向。
C. 稳定性
使用李雅普诺夫分析证明该系统是区域渐近稳定的。势函数充当李雅普诺夫候选函数,确保只要演示在局部一致,轨迹就会收敛到目标集(安全集与零标称能量的交集)。
3. 主要贡献
- 反应式运动框架: 一种新颖的 LfD 框架,结合了基于状态的 DS 的反应性与运动原语的表达能力,能够处理具有状态重访(交叉点)的任务。
- 闭环相位变量: 一个直接从状态进展中估计的相位变量,消除了对开环时间或速度的依赖,从而解决了二阶模型的歧义性和敏感性问题。
- 数据驱动的安全集: 一种从演示中学习平滑、非凸安全边界的方法,确保机器人在验证区域内运行,同时保持灵活性。
- 泛化能力: 该方法支持点对点、周期性和完整 6D(位置 + 方向)运动任务。
4. 实验结果
作者在仿真数据集(LASA、LAIR、RoboTasks)和真实机器人实验(UR10)上评估了 PNPF。
仿真基准:
- 数据集: 与 CONDOR(二阶 DS)和 NODE(一阶 DS)进行了比较。
- 性能: PNPF 在所有指标(DTW 距离、Fréchet 距离、最终位置误差)上均取得了最高的平均分数。
- 交叉点处理: 在 CHAR 数据集(设计有由相似段 preceding 的交叉轨迹)上,与 CONDOR 相比,PNPF 将 DTW 距离降低了约 80%。CONDOR 无法消除方向歧义,经常跳过或重复段,而 PNPF 成功导航了交叉点。
- 鲁棒性: 在带有随机扰动的 rollout 测试中,PNPF 在 >99.999% 的情况下保持了稳定性。
真实世界实验:
- 任务: 绳结打结、倒豆子、3D 8 字形擦拭。
- 干扰: 机器人遭受了以下干扰:
- 障碍物: 成功利用排斥势函数避开了静态立方体。
- 空间偏移: 任务框架在任务中途被移动。
- 手动位移: 末端执行器被手动推离轨道。
- 结果: 在所有情况下,机器人都平滑恢复并完成了任务,没有跳过步骤。例如,当绳子被推散开时,机器人正确地重新打结。这与基线方法(CONDOR、LPVDS)形成对比,后者在速度重置后经常发生漂移或重复段。
5. 意义与影响
- 解决交叉点问题: PNPF 为 LfD 中的“交叉点问题”提供了一个鲁棒的解决方案,同时不牺牲反应性。它允许机器人从少量演示中学习复杂的、非单调的任务(如打结或编织)。
- 安全与可靠性: 通过从数据中显式学习安全集,该方法确保机器人在状态空间的“安全”区域内运行,降低了在未见过状态中出现不安全行为的风险。
- 实时适用性: 该方法在真实硬件上以 50 Hz 运行,证明了复杂的神经势场可用于在线、反应式控制。
- 未来方向: 作者指出,由于能量公式的性质,该方法倾向于对尖锐拐角进行“过度平滑”。未来的工作旨在优化能量设计以保留尖锐的方向变化,并整合视觉/力反馈。
总之,PNPF 代表了机器人模仿学习的重要进步,弥合了稳定、反应式控制与从人类演示中学习复杂、交叉轨迹能力之间的差距。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。