这篇论文介绍了一个名为 ActiveGlasses(主动眼镜) 的有趣系统。简单来说,它是一套让机器人像人类一样“边看边做”的新技术,而且不需要机器人去模仿人类的手部动作,只需要模仿人类的“观察方式”。
为了让你更容易理解,我们可以把机器人学动作的过程想象成**“教一个笨拙的学徒做菜”**。
1. 以前的痛点:学徒被“绑”住了
在以前,教机器人干活主要有两种笨办法:
- 方法 A(远程遥控): 让操作员像玩电子游戏一样,拿着手柄控制机械臂。这就像让学徒戴着厚重的潜水服,在满是水的房间里学切菜。虽然能学会,但动作僵硬、累死人,而且学不到人类自然的流畅感。
- 方法 B(手持设备): 给操作员发一个像游戏手柄一样的设备,上面装着摄像头。但这就像让学徒手里一直举着一个沉重的摄像机,手都酸了,而且摄像头只能跟着手走(被动视角)。如果手挡住了视线,摄像头就什么都看不见了。
核心问题: 人类在做事时,手是灵活的,但眼睛(头)是主动的。我们会为了看清桌底下的东西而弯腰,为了看清杯子里的水而凑近。以前的系统只记录了手怎么动,却忽略了人是如何主动调整视角去解决问题的。
2. ActiveGlasses 的解决方案:给学徒戴上“智能眼镜”
ActiveGlasses 就像给操作员戴上了一副普通的智能眼镜(类似 AR 眼镜),上面装了一个立体摄像头。
3. 核心黑科技:以“物体”为中心
为什么机器人能直接上手,不用重新训练?
因为系统不教机器人“手怎么动”,而是教机器人**“物体怎么动”**。
- 以前的做法: 教机器人“左手抬 30 度,右手转 10 度”。如果机器人手长得不一样,这就全乱了。
- ActiveGlasses 的做法: 教机器人“把面包插进烤面包机,把水倒进杯子”。
- 系统把人类的动作转化成了3D 点云(一种立体的数字地图)。
- 它预测的是物体在空间中的轨迹。
- 比喻: 就像你教人开车,不是教他“脚踩多深、手转多少度”,而是教他“车要开到哪里去”。只要车(机器人)能开到那个位置,不管它有几个轮子、方向盘在哪,都能完成任务。这就是所谓的**“零样本迁移”**(Zero-shot transfer),换个机器人也能直接用。
4. 实验效果:为什么它这么强?
论文测试了三个很难的任务:
- 放书: 书架侧面有墙挡住,需要凑近看才能把书插进缝隙。
- 倒水: 杯子被屏风挡住,需要绕过去看才能倒准。
- 插面包: 烤面包机的槽一开始看不见,需要调整角度才能插进去。
结果:
- 没有主动视角(死板): 机器人如果头不动,一旦视线被挡住,就彻底瞎了,任务失败率很高。
- ActiveGlasses(主动): 机器人会像人一样,主动移动“头”去观察盲区,成功率比之前的顶尖方法(Pi0.5)高出 25%~35%。
总结
ActiveGlasses 的核心思想就是:“别只盯着手,要看头。”
它通过让真人戴着眼镜空手演示,捕捉人类**“为了看清而主动移动”**的智慧,然后让机器人通过一只专门的机械臂来模仿这种“观察行为”,同时用另一只机械臂去执行任务。
这就好比,以前我们教机器人是教它“怎么模仿人的手”,现在我们教机器人“怎么像人一样去看世界”。只要学会了“看”,机器人就能自己解决“怎么动”的问题,从而真正走进我们的日常生活。
1. 研究背景与问题 (Problem)
随着数据驱动机器人学习的发展,大规模、多样化的真实世界机器人数据成为实现通用操作的关键。然而,现有的数据采集流程面临以下严峻挑战:
- 数据收集效率低且成本高:现有的物理数据采集通常依赖遥操作(Teleoperation)或笨重的手持设备,导致数据收集极其缓慢、劳动密集且昂贵。据估计,积累相当于现代基础 AI 数据集规模的机器人操作数据可能需要 10 万年。
- 人机形态与感知的错位 (Embodiment & Perception Gap):
- 操作层面:现有系统常要求操作员模仿机器人手臂运动(如遥操作)或使用手持设备,这违背了人类“徒手”操作的自然本能,导致数据缺乏人类运动的平滑性和自然性,且操作员负担重。
- 感知层面:现有方案多依赖固定第三人称相机(易受遮挡)或被动的手腕相机(视角完全受限于末端执行器)。人类在执行复杂任务时,会本能地通过主动移动头部来调整视角、绕过遮挡或聚焦细节(即“主动视觉”),而现有系统往往忽略了这一关键的意图驱动感知信号。
- 零样本迁移困难:直接从人类演示(五根手指、移动头部)迁移到机器人(机械臂、固定或受限视角)存在巨大的形态差异,传统的重映射(Retargeting)方法往往误差大且泛化性差。
2. 方法论 (Methodology)
为了解决上述问题,作者提出了 ActiveGlasses 系统,包含硬件设计、数据处理流水线以及基于对象中心的策略网络。
A. 硬件与数据采集系统
- 核心设备:使用 XREAL Air 2 Ultra 智能眼镜,并在其上挂载 ZED Mini 立体相机。
- 采集方式:操作员佩戴眼镜,徒手 (Bare-hand) 完成日常任务。
- 感知:ZED Mini 作为唯一的感知设备,记录第一人称立体视频流。
- 主动视觉:利用 XREAL 内置的 6-DoF 头部追踪模块,记录操作员头部的运动轨迹(模拟机器人的“头部”或感知臂运动)。
- 交互:通过眼镜上的 GUI 和手势/音频反馈控制数据记录的起止,无需手持任何控制器。
- 优势:极大降低了操作员的物理负担,实现了自然、舒适的大规模数据采集。
B. 数据处理流水线
为了将人类演示转化为机器人可学习的统一表示,系统进行了以下处理:
- 深度估计与点云重建:利用 FoundationStereo 从立体图像对估计深度,重建 RGB 点云。
- 分割与去噪:使用 Grounded-SAM 分割并移除人手点云,使用 SAM2 分割操作物体,获得物体掩码。
- 物体姿态估计:利用 FoundationPose 结合深度图和物体掩码,估计物体在相机坐标系下的 6-DoF 姿态,形成物体轨迹。
- 世界坐标系校准:
- 利用桌面上的三个橙色球体作为标定参考,建立世界坐标系。
- 通过头部姿态的相对运动(Head-pose relative motion)将每一帧的点云和物体姿态转换到统一的世界坐标系中,解决了因头部移动导致的视角不一致问题。
C. 策略网络设计 (Object-Centric 3D Policy)
为了解决形态差异(Human vs. Robot),系统采用以对象为中心 (Object-Centric) 的策略,而非直接模仿人类关节运动。
- 输入:统一世界坐标系下的 3D 点云。
- 输出:通过两个独立的扩散头 (Diffusion Heads) 同时预测:
- 物体轨迹:预测操作物体在任务空间中的 6-DoF 轨迹(绝对表示)。
- 头部运动:预测感知臂(模拟人头)的运动轨迹(相对表示,避免工作空间越界)。
- 关键设计:
- 不输入当前物体姿态作为条件:强制策略基于视觉观察推理场景变化,防止模型过拟合到固定的运动模式。
- 绝对 vs 相对表示:实验表明,物体轨迹使用绝对表示,头部运动使用相对表示效果最佳。
- 执行:
- 主机械臂:执行预测的物体轨迹(通过手眼标定转换为末端执行器动作)。
- 感知臂:部署一个 6-DoF 桌面机械臂,同步模仿人类操作员的头部运动,实现主动视觉,主动调整视角以克服遮挡。
3. 关键贡献 (Key Contributions)
- 可扩展的徒手数据采集系统:ActiveGlasses 利用商用 AR 眼镜和立体相机,消除了对手持设备或遥操作的依赖,显著降低了数据收集门槛,提升了操作员的舒适度和数据质量。
- 纯主动视觉输入框架:系统在整个训练和部署过程中仅依赖单一主动视觉相机(安装在模拟人头的机械臂上)。这证明了机器人可以通过模仿人类的头部运动来主动解决遮挡和远距离观察问题,无需固定相机或手腕相机。
- 跨形态的零样本迁移策略:提出了一种基于对象中心的 3D 点云策略,直接预测物体轨迹而非人类动作。这种方法天然地弥合了人手与机械臂、人头与感知臂之间的形态鸿沟,实现了在不同机器人平台(如 UR5 和 Flexiv)上的零样本迁移。
- 主动视觉的有效性验证:通过对比实验,证明了在遮挡和精密操作任务中,主动视觉(模仿人类头部运动)对于提升成功率至关重要。
4. 实验结果 (Results)
作者在三个具有挑战性的真实世界任务上进行了评估:书籍放置(Book Placement)、遮挡下的远距离倒水(Occluded Distant Water Pouring)和面包插入(Bread Insertion)。这些任务均涉及严重遮挡和高精度操作。
- 性能对比:
- 在相同硬件设置(仅单主动视觉相机)下,ActiveGlasses 在三个任务上的最终成功率分别比基线 π0.5 高出 35%、25% 和 30%。
- 相比“无主动视觉”(固定视角)的变体,ActiveGlasses 在遮挡场景下表现显著更优(例如在面包插入任务中,无主动视觉成功率仅为 4/20,而 ActiveGlasses 为 14/20)。
- 消融实验:
- 表示方式:物体轨迹使用绝对表示优于相对表示;头部运动使用相对表示可避免机械臂超出工作空间。
- 条件输入:在预测绝对物体轨迹时,不将当前物体姿态作为额外条件输入,能防止模型忽略视觉输入并过拟合到固定模式。
- 跨平台泛化:策略在 Flexiv Rizon4 和 UR5 两种不同机械臂上均取得了成功,证明了其跨形态部署的能力。
- 数据收集效率:相比遥操作和手持设备,ActiveGlasses 显著提高了数据收集效率,且操作员疲劳度更低。
5. 意义与影响 (Significance)
- 重新定义数据采集范式:ActiveGlasses 证明了利用人类自然的“徒手 + 主动头部运动”行为进行数据采集的可行性,为构建大规模、高质量的机器人操作数据集提供了低成本、高效率的解决方案。
- 主动视觉的回归:该工作强调了“主动感知”在机器人操作中的核心地位,表明机器人不应只是被动接收视觉信息,而应像人类一样主动调整视角来完成任务。
- 通用性与实用性:通过对象中心的策略设计,该系统成功解决了从人到机器人的形态鸿沟问题,展示了在不进行复杂重映射的情况下,实现跨平台零样本迁移的潜力,为未来通用机器人(General Purpose Robots)的部署奠定了重要基础。
总结:ActiveGlasses 通过结合智能眼镜采集的自然人类演示、对象中心的 3D 点云策略以及模仿人类头部运动的主动视觉执行机制,成功实现了在复杂遮挡和高精度任务中的零样本机器人操作,是机器人模仿学习与主动视觉领域的一项重要突破。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。