这篇论文介绍了一个名为 HoMMI 的机器人学习系统。简单来说,它的目标是让机器人像人类一样,通过“看”和“模仿”来学会在复杂环境中移动并操作物体(比如一边走路一边拿东西、一边找东西一边整理),而且不需要人类手把手教机器人,只需要人类自己演示一遍即可。
为了让你更容易理解,我们可以把这篇论文的核心内容想象成**“教一个笨拙的机器人学徒”**的故事。
1. 以前的难题:机器人是个“近视眼”且“学不会”
以前的机器人学习系统(比如 UMI),就像是一个戴着单片眼镜的学徒。
- 视野太窄:它的摄像头只装在手腕上,只能看到手边的一点点东西。这就像你戴着眼罩,只能看到手里的苹果,却看不到前面的桌子、地上的箱子,或者远处的垃圾桶。
- 学不会大动作:因为看不到全局,它不知道该怎么走路去拿东西,也不知道怎么协调两只手和身体一起动。
- 教起来太累:以前教机器人,需要人类像玩遥控游戏一样,用摇杆一点点控制机器人,既慢又累,而且很难教它做复杂的移动任务。
2. HoMMI 的解决方案:给学徒戴上“智能头盔”和“魔法手套”
HoMMI 系统做了三件聪明的事,解决了上述问题:
A. 数据收集:人类戴头盔演示(“上帝视角” + “第一人称”)
研究人员让人类戴上头盔(上面有摄像头)和特制的手套(上面也有摄像头)去演示任务。
- 头盔(第一人称视角):就像你戴着 GoPro 走路,能看到整个房间、远处的目标,以及你如何转头寻找东西。这解决了“视野窄”的问题。
- 手套(局部视角):保留了手腕摄像头,用来看清手和物体接触的细节(比如怎么捏住一块布)。
- 关键点:人类不需要控制机器人,只是自己演示一遍。系统自动记录下人类看到的画面和手的动作。
B. 核心魔法:消除“物种差异”(跨形态学习)
这是论文最精彩的部分。人类和机器人长得完全不一样(人高、脖子灵活;机器人矮、脖子僵硬)。如果直接把人类的动作“复制粘贴”给机器人,机器人可能会摔跟头或撞墙。
HoMMI 用了三个“翻译器”来消除这种差异:
- 3D 视觉翻译(忽略长相):
- 机器人不看人类长什么样(比如手臂的颜色、形状),也不在乎摄像头是装在 1.8 米高还是 1.2 米高。
- 它把看到的画面转换成3D 点云地图。就像把照片变成了乐高积木的搭建图,只关心“物体在哪里”,而不关心“谁在看”。这样,无论人类多高,机器人看到的“世界地图”都是一样的。
- “看哪里”代替“头怎么转”(松弛的头部动作):
- 人类转头很灵活,但机器人的脖子可能只有两个关节,转不过去。
- HoMMI 不教机器人“把头转到 30 度”,而是教它**“盯着那个点看”**(Look-at Point)。
- 比喻:就像你告诉机器人:“盯着那个红色的箱子”。机器人会用自己的方式(哪怕脖子只能转一点点,或者身体扭一扭)去调整视线,直到它能看到那个箱子。这样既学会了“主动寻找”的策略,又不会让机器人因为动作太夸张而摔倒。
- 统一坐标系(以手为中心):
- 所有的指令和观察都以“手”为基准。不管头怎么动,手要抓的东西位置是固定的。这就像不管你怎么转头,你手里的杯子位置是不变的。
C. 身体协调:聪明的“总指挥”(全身控制器)
机器人收到指令后,需要一个“总指挥”来协调全身。
- 这个指挥非常谨慎,它知道机器人的物理限制(比如不能撞到自己、不能摔倒)。
- 它会计算:为了把手伸到那个位置,腿该怎么走?腰该怎么弯?头该怎么看?
- 比喻:就像一位经验丰富的舞蹈教练,虽然学生(机器人)身体僵硬,但教练能指挥学生用最合理的姿势,完美地完成高难度的舞蹈动作。
3. 实际效果:机器人学会了什么?
研究人员让机器人学习了三个高难度任务,效果惊人:
- 洗衣服任务:机器人走到桌子前,双手抓起衣服,主动转头寻找旁边的洗衣篮,走过去把衣服放进去。
- 如果没有头盔视角:机器人根本找不到洗衣篮在哪,或者抓不住衣服。
- 送货任务:机器人拿着箱子,穿过大房间,找到一辆手推车,把箱子放上去。
- 如果没有全身协调:机器人可能会因为手和脚配合不好,把箱子摔了,或者撞到手推车。
- 铺桌布任务:机器人双手抓住桌布边缘,一边后退一边把桌布拉平铺好。
- 如果没有主动感知:机器人不知道桌布有没有铺平,可能会铺歪。
4. 总结:为什么这很重要?
- 以前:教机器人移动和干活,就像教一个没有腿的人去跑步,需要极其复杂的编程和昂贵的遥控训练。
- 现在(HoMMI):就像给机器人请了一位**“人类教练”**。人类只需要像平时一样演示一遍(戴着头盔和手套),机器人就能通过“翻译”和“理解”,学会如何在复杂的世界里灵活移动、主动观察并完成任务。
一句话总结:HoMMI 让机器人学会了像人一样“眼观六路、耳听八方、手脚并用”,而且是通过看人类演示学会的,不需要人类手把手教,大大降低了让机器人进入我们日常生活的门槛。
HoMMI 技术总结:基于人类演示的全身体移动操作学习
1. 研究背景与问题定义 (Problem)
移动操作(Mobile Manipulation)需要机器人协调全身运动(手臂、躯干、底盘、头部)以及多模态感知(如眼在手腕的相机和头戴相机),以完成长视野、复杂空间的任务。
- 现有挑战:
- 数据收集瓶颈:传统的遥操作(Teleoperation)成本高、速度慢且难以在多样化环境中部署。现有的便携式数据收集接口(如 UMI)主要依赖手腕相机,缺乏全局上下文,难以支持导航、双臂协调和主动感知。
- 本体形态鸿沟(Embodiment Gap):引入头戴相机(第一人称视角)虽然能补充全局信息,但直接将其用于机器人学习会引发巨大的视觉鸿沟(人类与机器人外观、身高视角差异)和运动学鸿沟(人类头部自由度与机器人颈部/底盘运动能力的差异)。
- 策略迁移困难:直接模仿人类的 6-DoF 头部姿态和手臂动作往往会导致机器人产生不可行的运动或失败。
核心目标:构建一个系统,能够直接从无机器人的人类演示中学习全身体移动操作技能,同时有效弥合人类与机器人之间的本体形态鸿沟。
2. 方法论 (Methodology)
HoMMI (Whole-Body Mobile Manipulation Interface) 系统由三个核心部分组成:
A. HoMMI 数据收集接口 (Data Collection Interface)
- 硬件设计:基于 UMI 的双手持握器设计,扩展了头戴式相机。使用三部 iPhone(两部安装在夹爪上,一部安装在帽子上),利用 Apple ARKit 实现多设备同步。
- 数据采集:同步记录 RGB 视频、深度图、6-DoF 位姿和夹爪宽度(60Hz)。
- 优势:便携、非侵入式、无需机器人即可在真实环境中收集大规模数据,且避免了 VR 带来的晕动症。
B. 跨本体手眼策略 (Cross-Embodiment Hand-Eye Policy)
为了解决视觉和运动学鸿沟,提出了三种关键算法设计:
- 本体无关的 3D 视觉表示 (Embodiment-Agnostic 3D Visual Representation):
- 不直接输入头部 RGB 图像,而是将第一人称视角提升为3D 点云表示。
- 利用几何感知 Token 编码,将外观特征与 3D 几何绑定,使其对头部姿态和身高变化具有鲁棒性。
- 掩码处理:在点云中过滤掉演示者手臂和身体的点,仅保留环境信息,消除外观不匹配。
- 松弛的头部动作表示 (Relaxed Head Action Representation):
- 不直接回归人类的 6-DoF 头部位姿,而是将机器人的视线抽象为3D 注视点 (3D Look-at Point)。
- 这种松弛表示保留了“主动感知”的意图,允许机器人根据自身的运动学约束(如 2-DoF 颈部)生成可行的头部朝向,而无需严格模仿人类头部运动。
- 以夹爪为中心的坐标系 (Gripper-Centric Frame):
- 将所有观测(包括头部点云)和动作(夹爪位姿、注视点)统一转换到左夹爪坐标系。
- 这消除了因头部运动或身高差异导致的坐标系漂移,确保策略在一致的空间框架下推理。
C. 约束感知全身体控制器 (Constraint-Aware Whole-Body Controller)
- 功能:将策略输出的末端执行器轨迹和注视点转化为机器人的关节运动和底盘运动。
- 优化目标:
- 高精度:高权重跟踪双臂 SE(3) 轨迹。
- 平滑性:通过时间插值和姿态正则化减少抖动。
- 稳定性:显式约束(如躯干直立、质心支撑、自碰撞避免)。
- 类人行为:正则化趋向预设的“人类”姿态,平衡手臂与底盘的运动分配。
- 实现:使用基于 Mink 的差分全身体逆运动学(IK)求解器,异步运行以匹配策略和控制循环的频率。
3. 关键贡献 (Key Contributions)
- HoMMI 数据收集系统:首个将头戴相机集成到 UMI 框架中的系统,实现了同步的多视角视频和位姿采集,支持大规模、无机器人的移动操作数据收集。
- 跨本体策略设计:
- 提出了3D 视觉表示以解决视觉鸿沟。
- 提出了3D 注视点动作表示以解决运动学鸿沟,使得不同身高和关节约束的机器人也能学习主动感知策略。
- 约束感知全身体控制:设计了一个控制器,能够在尊重机器人物理约束(如双足/轮式底盘限制、关节限位)的同时,精确跟踪策略生成的轨迹并实现主动感知。
- 实证验证:证明了直接从无机器人的人类演示中学习长视野、双臂协调的移动操作是可行的,无需任何机器人遥操作数据进行微调。
4. 实验结果 (Results)
作者在真实机器人(Rainbow Robotics RB-Y1,双 7-DoF 臂 + 2-DoF 颈部 + 全向底盘)上进行了三项长视野任务评估:
| 任务 |
描述 |
关键能力 |
HoMMI 成功率 |
主要基线失败原因 |
| 洗衣任务 |
抓取衣物,寻找并放入洗衣篮 |
双臂抓取、全身协调、主动搜索 |
90% |
仅手腕视角无法看到篮子;直接模仿头部动作导致运动不可行。 |
| 配送任务 |
搬运箱子,寻找并放置到推车 |
长视野导航、双臂高度协调 |
85% |
缺乏全局上下文导致导航错误;头部动作受运动学限制无法转向。 |
| 桌布任务 |
抓取并展开桌布 |
精细的双臂协调、全身高度调整 |
80% |
缺乏全局空间感导致抓取位置错误;缺乏主动视角调整导致对齐失败。 |
消融实验发现:
- 仅手腕视角 (Wrist-Only):在需要搜索和导航的任务中表现极差(成功率 0-15%),缺乏全局上下文。
- 仅头部视角 (Head-Only):抓取失败率高(0-5%),缺乏局部接触信息。
- 直接输入 RGB 头部图像 (RGB-Only):由于本体形态不匹配导致策略分布外(OOD),成功率极低(0-45%)。
- 无主动颈部控制 (w/o Neck):成功率显著下降(55-75%),证明主动感知对任务成功至关重要。
5. 意义与影响 (Significance)
- ** democratizing 移动操作学习**:HoMMI 证明了无需昂贵的机器人遥操作,仅通过便携的人类演示即可训练出高性能的移动操作策略,极大地降低了数据收集门槛。
- 解决本体形态鸿沟:提出的"3D 视觉表示”和"3D 注视点”方法为跨本体(Cross-Embodiment)学习提供了新的范式,使得不同形态的机器人(如不同身高、颈部自由度)都能从同一个人演示中学习。
- 主动感知与全身协调:系统成功实现了将“主动感知”(主动转头寻找目标)与“全身运动控制”(底盘移动、手臂操作)的端到端联合学习,这是以往固定基座或简单移动机器人难以实现的。
- 未来方向:为大规模移动操作数据集的构建和通用移动操作策略的研究奠定了基础,推动了机器人从实验室走向真实复杂环境的能力。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。