这篇论文介绍了一个名为 HACTS 的新系统,它的核心思想非常有趣:让机器人学习时,人类不再只是“发号施令的指挥官”,而是变成“随时待命的副驾驶”。
为了让你更容易理解,我们可以把机器人学习的过程想象成教一个刚拿驾照的新手司机开车。
1. 以前的痛点:只有“单向指令”的盲盒
在传统的机器人遥控系统(Teleoperation)中,人类操作员就像坐在副驾上,手里拿着一个没有方向盘反馈的遥控器。
- 怎么操作? 你告诉机器人“向左转”,机器人就向左转。
- 有什么问题? 如果机器人自己正在自动驾驶(比如它想变道),而你突然想干预它,你手里的遥控器是静止不动的。你不知道机器人现在的轮子到底转到了什么角度。
- 后果: 当你强行介入时,就像你突然抢过方向盘猛打,而车子的轮子还在原来的位置,这会导致车子失控、动作僵硬,甚至把任务搞砸。这就好比你想教新手司机,但他不知道车现在的状态,你只能盲目地指挥,效率很低。
2. HACTS 的解决方案:带“力反馈”的副驾驶
HACTS 系统就像给副驾装上了一个智能方向盘,它和机器人的“手”(机械臂)是双向同步的。
- 双向同步(Bilateral Synchronization):
- 你动,它动: 当你移动你的手柄时,机器人跟着动(这是传统的教机器人)。
- 它动,你也动: 当机器人自己在执行任务时,如果它动了,你的手柄会实时跟着动,就像你握着方向盘能感觉到车轮的转动一样。
- 无缝接管(Seamless Intervention):
- 如果机器人快要把杯子打翻了,或者走错了路,你不需要惊慌失措地抢控制权。因为你的手柄已经和机器人的动作同步了,你只需要轻轻推一下手柄,就能平滑地纠正机器人的动作。
- 这就像在自动驾驶汽车里,你不需要猛打方向盘,只需要轻轻扶正方向,车子就能平滑地回到正轨。
3. 这个系统有什么特别之处?
- 便宜又好用(Low-Cost): 以前的这种高级系统需要昂贵的专业设备(像几万美元的机械臂)。HACTS 用的是3D 打印的零件和几百块钱的普通电机,总成本不到 300 美元。就像是用乐高积木搭出了一个能用的原型,谁都能玩。
- 不仅是“教”,更是“纠错”:
- 以前收集数据,主要是收集“成功的案例”(机器人一次做对了)。
- HACTS 能收集**“失败后的纠正数据”。当机器人做错时,人类介入把它拉回来。这些“差点出错但被救回来”的数据,对于教机器人变得更聪明、更稳健极其宝贵**。
4. 实验结果:它真的有用吗?
作者做了一系列实验,把机器人放在各种任务中(比如打开盒子、把馒头放进蒸笼、把倒下的杯子扶正):
总结
HACTS 就像是给机器人学习装上了一个“实时同步的副驾驶座”。
它解决了以前机器人遥控中“人机不同步”的尴尬,让人类能更自然、更精准地介入机器人的操作。更重要的是,它用极低的成本,让机器人不仅能学会“怎么做对”,还能学会“怎么从错误中爬起来”。这为未来让机器人真正进入家庭、工厂,成为我们得力的助手,铺平了道路。
HACTS:一种用于机器人学习的“人机协同”遥操作系统的技术总结
1. 研究背景与问题 (Problem)
在机器人学习领域,特别是涉及操作任务(Manipulation Tasks)时,**遥操作(Teleoperation)**是获取人类演示数据或进行在线修正的关键手段。现有的遥操作系统(如 VR 设备、外骨骼、动捕系统等)主要存在以下局限性:
- 单向控制(Unilateral Control): 大多数系统仅允许人类向机器人发送指令,缺乏机器人状态向操作硬件的实时反馈。
- 缺乏同步性: 当机器人自主执行任务需要人类介入时,由于缺乏力反馈或位置同步,操作者无法感知机器人的实时状态。这类似于自动驾驶汽车中,驾驶员试图接管车辆时,若方向盘无法随车轮转动而反馈,会导致控制冲突甚至失控。
- 现有双向系统的门槛高: 虽然已有研究提出双向控制系统(集成触觉或力反馈),但这些系统通常依赖昂贵的硬件和复杂的算法,难以在通用机器人平台(如 UR5)上普及。
核心痛点: 缺乏一种低成本、可扩展且具备**双向关节同步(Bilateral Joint Synchronization)**能力的遥操作系统,以支持无缝的人机协同干预和数据收集。
2. 方法论 (Methodology)
本文提出了 HACTS (Human-As-Copilot Teleoperation System),一种新型的低成本遥操作系统,旨在实现机器人机械臂与遥操作硬件之间的实时双向关节同步。
2.1 系统架构设计
HACTS 采用“主从(Leader-Follower)”架构,具备双向同步能力:
- 主到从(Leader-to-Follower): 类似于传统的 ALOHA 系统,人类操作主设备,机器人从设备跟随,用于离线收集高质量的人类演示数据。
- 从到主(Follower-to-Leader): 这是 HACTS 的核心创新。当机器人自主运行(由策略模型控制)时,机器人的关节状态会实时反向同步到主设备上。这使得操作者能像驾驶汽车的“副驾驶(Copilot)”一样,实时感知机器人状态,并在必要时进行无缝干预。
2.2 硬件设计 (Hardware)
- 低成本与轻量化: 系统完全由 3D 打印部件和商用现成(COTS)的低成本伺服电机(DYNAMIXEL XL430 和 XL330 系列)构建。
- 成本效益: 整个硬件系统的成本低于 300 美元(约 247 美元),远低于传统力反馈设备。
- 运动学等效性: 主设备的设计基于 Denavit-Hartenberg (D-H) 参数,与目标机器人(如 UR5)保持运动学等效,确保位置同步的直观性和准确性。
2.3 软件设计 (Software)
- 双向数据流: 系统通过 DYNAMIXEL API 实现电机位置监控与调整。在反向同步模式下,机器人位置数据经过偏移补偿后实时传输回主设备电机,维持系统同步。
- 模式切换: 通过外部脚踏板实现“自主模式”与“人工干预模式”的无缝切换。
3. 主要贡献 (Key Contributions)
- 提出 HACTS 系统: 首次实现了低成本、基于运动学等效的双向关节同步遥操作系统,使人类能够作为“副驾驶”实时干预机器人任务。
- 提升模仿学习(IL)性能: 证明了通过 HACTS 收集的“动作修正数据(Action-Correction Data)”能显著优于单纯的演示数据,提高了模型在失败场景下的恢复能力和数据效率。
- 支持复杂的人机协同强化学习(HITL RL): 展示了 HACTS 如何无缝集成到在线强化学习流程中,使机器人能够从人类的实时修正中学习,适应动态环境。
4. 实验结果 (Results)
研究者在 UR5 机器人平台上进行了广泛的实验,涵盖模仿学习(IL)和强化学习(RL)两个范式。
4.1 模仿学习 (Imitation Learning)
实验使用了 ACT (Action Chunking Transformer) 和 Diffusion Policy (DP) 两种算法,在三个任务(OpenBox, SteamBun, UprightMug)上验证了 HACTS 的有效性:
- 数据替代性 (Q1): 在同等数据量下,使用 HACTS 收集的干预数据训练的模型(HACTS-ACT)成功率显著高于仅使用专家演示数据的模型(Full-ACT)。例如,在 OpenBox 任务中,成功率从 60% 提升至 80%。
- 失败修正能力 (Q2): 在分布内(ID)失败场景中,HACTS 数据能有效修正策略。在 UprightMug 任务中,HACTS-ACT 成功率达到 70%,远超基础模型的 10% 和全量数据模型的 40%。
- 泛化能力 (Q3): 在分布外(OOD)静态和动态场景下,基础模型成功率均为 0%,而引入 HACTS 修正数据后,模型成功处理了未见过的物体位置变化和动态干扰(如 CloseBin 任务中动态移动物体)。
4.2 强化学习 (Reinforcement Learning)
- RLPD-HACTS: 结合 HACTS 与 RLPD 算法,实现了人机协同的在线学习。
- 训练效率: 在 CloseBin 任务中,经过 10 分钟离线预训练和 45 分钟在线微调,任务成功率从 50% 提升至 80%。
- 干预长度优化: 随着训练进行,人类干预的平均步数显著下降(从初始的长干预降至 6 步以内),表明机器人策略逐渐成熟,仅需人类进行微调。
5. 意义与影响 (Significance)
- 降低门槛,促进普及: HACTS 以极低的成本(<300 美元)实现了高端的双向遥操作功能,使得大规模部署人机协同数据收集成为可能。
- 提升数据质量: 通过收集“失败 - 修正”数据,解决了传统模仿学习仅依赖成功轨迹的局限性,显著增强了模型的鲁棒性和泛化能力。
- 推动人机协作新范式: HACTS 将遥操作从单纯的“遥控”转变为“协同驾驶(Copilot)”,为 Vision-Language-Action (VLA) 模型和在线强化学习提供了更丰富、更高质量的数据来源。
- 未来展望: 该系统为构建更智能、更安全的机器人学习系统奠定了基础,特别是在需要实时人类反馈的复杂动态环境中。
总结: HACTS 通过简单的双向位置同步机制,巧妙地解决了传统遥操作缺乏反馈的痛点,不仅大幅降低了硬件成本,还显著提升了机器人学习算法在数据效率、失败恢复和动态适应性方面的表现,是机器人学习领域人机交互的重要进步。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。