想象一下,你正试图教一个非常笨拙、高科技的机器人手去抓取像瓶子、软球或电钻这样精细的物体。如果你只是让机器人自己尝试、失败、再尝试,它会耗费极长的时间,甚至可能会损坏物品。如果你只是给它看一段人类完美操作视频,当现实世界变得复杂多变时,机器人可能会感到困惑。
这篇论文提出了一种巧妙的“三步配方”,能比以往任何时候都更快、更安全地教这些灵巧型机器人手完成任务。以下是其工作原理的拆解,通过简单的概念进行说明:
1. “远程木偶师”(AR 遥操作)
首先,研究人员需要一种方法,在不亲临机器人身边的情况下获取高质量的操作范例。
- 类比: 想象一位木偶操纵者戴着一副特殊的“魔法眼镜”(增强现实或 AR 头显)。操纵者在眼镜中看到的是机器人的虚拟版本。当操ло纵者移动真实的手时,机器人会立即模仿其动作,就像影子一样。
- 结果: 机器人将这些动作记录为“专家数据”。这比让人类站在巨大的机械臂旁边并手动引导它要快得多,也安全得多。
2. 第一步:“考前突击”(行为克隆)
在机器人开始自主学习之前,它会利用从木偶师那里获得的数据进行一次“考前突击”。
- 类比: 想象一名正在参加考试的学生。他不是在靠猜,而是在背诵老师提供的标准答案。这被称为行为克隆(Behavior Cloning)。机器人学习到:“当我看到一个瓶子时,我的手应该看起来完全像人类的手那样。”
- 问题: 如果机器人仅仅这样做,它就会变成一个刻板的模仿者。如果瓶子的位置与老师展示的位置稍有偏差,机器人就会陷入僵局,因为它不知道如何进行调整。
3. 第二步:“带有安全网的教练”(对比学习 + RL)
这是本论文的核心创新。现在,机器人转向了强化学习(Reinforcement Learning, RL),即通过成功获得奖励、失败受到惩罚来摸索最佳动作。但为了防止它忘记老师的教导或犯下危险错误,他们加入了两个特别的工具:
- “投影头”(指南针):
- 类比: 想象机器人正在跑迷宫。“投影头”就像一个指南针,不断检查:“我移动的方向看起来是否与专家的路径一致?”它并不强迫机器人复制每一个精确步骤,而是轻轻地引导机器人保持在与专家相似的“良好路径”上。这防止了机器人脱离轨道(即所谓的“策略崩溃”问题,即机器人放弃尝试并开始做一些随机且无意义的动作)。
- “事件驱动奖励”(安全警报):
- 类比: 机器人因为抓住了物体而获得积分,但如果它撞到了桌子,或者在没有真正拿起物体的情况下触碰了物体,它就会听到响亮的“嗡嗡声”并失去积分。这教会了机器人要小心且精准。
实验结果:为什么这很重要
研究人员在计算机模拟(类似于电子游戏)中测试了这种方法,随后又在现实世界的真实机器人上进行了测试。
- 速度: 机器人的学习速度比其他方法快得多。其他机器人需要数百小时的试错,而这种方法在极短的时间内就完成了任务。
- 成功率: 机器人实际抓取物体的成功率更高。
- 鲁棒性(稳健性): 即使物体处于新的、棘手的方位,机器人也能适应,因为它学习的是任务的“概念”,而不仅仅是一个固定的动作。
简而言之: 本论文表明,通过结合“远程木偶师”来收集数据、“考前突击”来起步,以及“智能指南针”来引导学习,我们可以快速、安全且不损坏物品地教会复杂的机器人手完成精细的任务。
技术摘要:基于增强现实(AR)远程人机交互的可扩展灵巧机器人学习
问题陈述
本文研究了灵巧机器人臂手系统中复杂操纵任务的可扩展学习挑战。这些系统拥有高自由度(DoF),使得控制设计变得异常复杂。虽然模仿学习(如行为克隆,Behavior Cloning)可以快速从专家演示中学习轨迹,但它存在数据失配和复合误差的问题,导致性能下降。相反,强化学习(RL)虽然具有可扩展性,但通常需要极长的训练时间,并面临“策略崩溃”(policy collapse)的风险,即智能体可能会遗忘最初的专家引导。此外,收集高质量的远程操作专家演示数据非常耗时,且现有的集成模仿学习与强化学习的方法往往无法防止策略崩溃,也无法高效利用有限的演示数据。
方法论
所提出的解决方案是一个两阶段学习框架,该框架集成了用于数据采集的增强现实(AR)技术、用于预训练的行为克隆(BC),以及用于策略优化的对比学习增强强化学习(RL)。
1. 基于 AR 的远程人机交互系统
为了解决数据采集的瓶颈,作者开发了一个使用 AR 头显(具体为 HoloLens 2)的远程操作系统。
- 架构: 该系统通过 Unity 平台经由 WiFi 或 5G 连接 AR 头显与灵巧机器人(配备 Inspire 手部的 CGXi-G6 机械臂)。
- 流程: 专家佩戴 AR 头显以追踪手部姿态。这些姿态被映射到机器人的运动学模型中,从而使机器人能够远程复制专家的动作。
- 数据采集: 该设置捕获了专家演示数据(Aexpert={(stE,atE)}),这为学习流水线奠定了基础。
2. 两阶段学习算法
核心算法分为两个截然不同的阶段进行:
第一阶段:行为克隆(BC)预训练
- 策略网络(πθ)通过求解一个回归问题进行预训练,旨在最小化策略动作与专家演示动作之间的均方误差。
- 此阶段将机器人的控制策略与专家偏好对齐,为随后的强化学习阶段提供强大的初始化。
第二阶段:对比学习赋能的强化学习(RL)
- RL 公式化: 将操纵任务建模为软行为者-评论家算法(Soft Actor-Critic, SAC)问题,旨在最大化熵增强奖励的期望总和。
- 奖励设计: 总奖励 r(st,at) 包括:
- 运动平滑度: 惩罚抖动动作。
- 事件驱动奖励: 一个分段函数,为任务成功提供正向奖励,并为碰撞或手部与物体接触失败提供负向奖励(以增强安全性)。
- 手部姿态调整: 鼓励手部与物体之间的几何对齐。
- 对比学习与投影头: 为了防止策略崩溃并提高样本效率,引入了一个投影头(多层感知器,MLP)。
- 该投影头将同一状态下的专家动作(atE)和智能体生成的动作(at)映射到潜空间中。
- 通过最小化对比损失(LCL)来最大化专家动作与智能体动作表示之间的共识(余弦相似度)。
- 这约束了 RL 策略使其保持在专家偏好的状态-动作附近,从而有效地引导探索过程。
- 训练循环: Q 网络、投影头和策略网络进行联合优化。训练完成后,投影头会被丢弃,留下一个鲁棒的策略。
核心贡献
- 基于 AR 的远程操作系统: 作者构建了一个通用的基于 AR 的系统,用于收集专家演示数据,通过基于 Unity 的边缘服务器确保了不同 AR 头显与机器人系统之间的兼容性。
- 模仿与对比学习辅助的强化学习: 本文提出了一种结合了 BC 预训练与对比学习机制的新型算法。与以往可能在 RL 微调期间出现策略崩溃的工作不同,该方法利用投影头强制执行专家偏好约束,显著提高了样本效率和稳定性。
- 全面的验证: 该方法通过广泛的物理仿真(PyBullet)和真实世界实验得到了验证,展示了优于标准基准方法的性能。
实验结果
所提算法针对几种基准方法进行了评估:PPO、SAC、优势加权行为者-评论家算法(AWAC)以及未添加对比学习的改进版方案(BC+SAC)。
- 仿真性能: 在涉及抓取瓶子、变形球和电钻的任务中,所提方法实现了最高的平均奖励和成功率。
- 收敛速度: 与 PPO、SAC 和 AWAC 相比,它所需的迭代次数和收敛时间显著减少。例如,在抓取瓶子任务中,它在 30 次迭代(75 分钟)内收敛,而 PPO 需要 210 次迭代(500 分钟)。
- 成功率: 所提方法实现了 95.70%(瓶子)、91.39%(球)和 85.30%(电钻)的成功率,优于所有基准方法。
- 真实世界表现: 在 50 次真实世界试验中,该算法保持了最高的成功率。由于感知限制和几何复杂性,变形物体的成功率较仿真环境略有下降,但瓶子抓取任务表现出极小的“仿真到现实”(sim-to-real)差距。
- 消融实验: 研究证实,BC 预训练在减少训练时间方面起主导作用,而加入对比学习对于克服策略崩溃并进一步提升性能至关重要。
意义与主张
本文声称,将对比学习与模仿学习相结合用于灵巧机器人操纵是一项新颖的贡献,此前尚未有过此类研究。这项工作的意义在于:
- 可扩展性: 该方法显著加快了训练过程,并降低了对海量专家数据的依赖(实验中仅使用了 15 条专家轨迹进行预训练)。
- 稳定性: 它有效地解决了模仿策略在 RL 微调过程中常见的失效模式——策略崩溃。
- 实用性: 基于 AR 的远程操作系统为收集多样化的专家数据提供了一种可行且低成本的方法,架起了人类专业知识与机器人执行之间的桥梁。
作者总结道,其无模型算法能够快速达到收敛,并实现比现有基准更高的成功率,为通用灵巧系统中的操纵任务提供了鲁棒的解决方案。作者建议的未来工作包括通过高保真几何重建来改进仿真到现实的迁移,以及将该方法扩展到多智能体双臂系统。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。