想象一下,你正试图教一个机器人像人类一样跳舞。过去,科学家们主要依靠摄像头(比如你的手机或监控摄像头)来观察人类并告诉机器人该做什么。
这就像是仅仅通过观看平面屏幕上的视频来学习一段舞蹈动作。你可以看到舞者的手臂和腿在移动,但你无法“感受”到他们是如何蹬地的,或者他们的脚是真的踩在地面上,还是仅仅轻微地悬浮在上方。由于这种“平面”视角,机器人往往会因为不理解舞蹈背后的物理原理而导致打滑、滑动甚至摔倒。
PressMimic 是一个全新的系统,它通过为机器人增加一种“第六感”——压力——来解决这个问题。
它是如何运作的,可以分为以下三个简单的部分:
1. “超级眼睛”(动作捕捉)
通常,摄像头会尝试猜测人的脚部位置。有时它们会猜错,让看起来像是人在漂浮或者在地面下行走。
PressMimic 使用了一种特殊的压力垫,它就像一层巨大的、敏感的皮肤。当人类踩在上面时,压力垫能精确感受到重量的位置以及他们蹬地的力度。
- 类比: 想象一下,如果你从远处观察一个人,仅凭视觉很难猜出对方拥抱你的力度有多大。你很难分辨那是一个温柔的轻拍,还是一个力道十足的挤压。现在,想象你能“感觉到”这个拥抱。这就是压力垫的作用。
- 结果: 该系统将摄像头的“视觉”与压力垫的“触觉”结合起来。这创造了一个完美的 3D 运动地图,能够准确知道人类何时落地以及脚下的压力有多大。这阻止了机器人对足部位置产生错误的猜测。
2. “聪明老师”(机器人控制)
一旦机器人知道了人类在做什么,它就必须真正地去执行。在过去,机器人被告知要模仿人类关节的“形状”。但如果人类为了平衡而向前倾斜,机器人可能只会机械地模仿那个倾斜动作,却因为不知道人类为什么要倾斜而导致摔倒。
PressMimic 教会了机器人一条新规则:“模仿压力,而不只是模仿姿态。”
- 类比: 想想一个学骑自行车的学生。一个糟糕的老师会说:“保持你的车把手处于这个精确的角度。”而一个好的老师会说:“感受当你转弯时,地面是如何反作用于你的轮胎的。”
- 结果: 机器人被训练去匹配人类的“压力模式”。如果人类为了转向而将重心转移到左脚,机器人也会学习将重心转移到左脚。这让机器人保持平衡,防止滑动或摔倒。
3. “练习大厅”(数据集)
为了训练这个系统,研究人员建立了一个庞大的数据库,称为 MotionPRO。
- 他们记录了 70 名不同的人 进行的 400 种不同类型的动作(从行走、跑步到拉伸和舞蹈)。
- 他们同时捕捉了所有信息:视频、光学动作捕捉(超精确的标记点)以及来自地面的压力。
- 这就像拥有一个包含 1240 万个“舞蹈动作”的图书馆,其中每一个步伐都同时记录了视觉和触觉。
为什么这很重要?
论文表明,当机器人使用这种“压力引导”的方法时:
- 它们不会摔倒: 即使在做复杂的动作时也能保持稳定。
- 它们不会滑动: 它们的脚会像人类一样紧贴地面。
- 它们看起来很自然: 不会出现看起来像是在漂浮或动作卡顿的情况。
简而言之,PressMimic 弥合了“看到”动作与“感受到”动作背后的物理原理之间的鸿沟。它将一个只会模仿形状的机器人,变成了一个理解如何在现实世界中站立、行走和跳舞的机器人。
技术摘要:PressMimic
问题陈述
人形机器人动作模仿面临着一个关键瓶颈:现有的流水线主要依赖基于视觉的动作捕捉(MoCap)和运动学模仿,很大程度上忽略了身体与环境之间的物理交互。虽然运动学方法可以估计关节配置,但它们往往无法捕捉接触动力学,导致出现物理上不合理的伪影,如足部滑动、地面穿透、时间抖动和步态不稳定。纯视觉方法难以应对深度歧义和遮挡问题,使得推断对稳定行走至关重要的地面接触状态和支撑模式变得困难。因此,由运动学估计的参考轨迹驱动的机器人经常无法重现人类动作的物理接地性,导致在富接触场景中性能下降或造成硬件损坏。
方法论
作者提出了 PressMimic,这是一个统一的框架,将压力传感作为核心模态集成到人形动作模仿的全流程中,涵盖从人类动作捕捉到机器人控制的各个阶段。该框架主要分为两个阶段运行:
1. 压力引导的动作捕捉 (FRAPPE++)
第一阶段引入了 FRAPPE++,这是一个多模态模型,旨在通过融合 RGB 视频与压力信号,共同估计 3D 人体姿态和全局运动轨迹。
- 输入: 同步的 RGB 视频和 2D 压力分布图。
- 架构:
- 稀疏压力编码器 (SPE): 使用希尔伯特空间填充曲线将稀疏的 2D 压力图转换为紧凑的 1D 序列,以保留空间拓扑结构,并通过傅里叶嵌入进行特征编码。
- 时间上下文聚合模块 (TCAM): 使用门控循环单元 (GRU) 和自注意力机制在固定窗口内建模时间依赖性,同时通过交叉注意力引入相邻窗口的上下文,以确保运动平滑度。
- 融合交叉注意力模块 (FCAM): 通过将压力特征视为查询(Queries),将视觉特征视为键(Keys)和值(Values)来融合模态。这使得压力信号能够引导视觉注意力关注人体与地面的接触区域。
- 训练目标: 一个联合损失函数约束姿态参数、3D 关节位置、全局平移和地面接触状态。通过施加正交相似性和全身接触约束来解决基于视觉估计的歧义问题。
2. 压力监督控制 (PSP)
第二阶段引入了 压力监督策略 (PSP),这是一个强化学习 (RL) 框架,它结合了压力衍生信号,以在机器人执行过程中强制执行物理一致性。
- 压力建模: 系统计算一个“压力偏移量” (o),代表左右脚之间的双侧重量分布。该标量值能够区分双脚接触、单脚接触和腾空状态。
- 奖励函数: RL 奖励函数包含标准的运动学模仿项以及一个压力偏移奖励。该奖励鼓励机器人的地面反作用力与人类演示者的压力偏移分布相匹配。
- 两阶段课程学习:
- 阶段 1: 策略被训练用于模仿固定的真人参考压力偏移。
- 阶段 2: 一旦达到性能阈值,参考压力将使用机器人自身最优接触分布的指数移动平均 (EMA) 进行动态更新。这使得机器人能够在保持从人类学习到的接触动力学的同时,适应其特定的物理约束。
数据集:MotionPRO
为了支持这些方法,作者构建了 MotionPRO,这是一个大规模多模态数据集,包含:
- 规模: 70 名受试者、400 种运动类型和 1240 万帧姿态数据。
- 模态: 同步的 RGB 视频 (30Hz)、压力垫数据 (100Hz) 和高精度光学动作捕捉数据 (120Hz),所有数据均重采样至 30Hz。
- 内容: 多样化的活动,包括日常任务、传统锻炼和面向机器人的运动。
关键结果
在 MotionPRO 数据集和 Unitree G1 人形机器人上进行的实验证明了所提方法的有效性:
- 运动估计: FRAPPE++ 在所有指标上均优于最先进的基于 RGB 的方法(如 WHAM, GVHMR, PhysPT)。它实现了 33.2mm 的平均关节位置误差 (MPJPE) 和 25.9mm 的根平移误差 (RTE),与仅基于视觉的基准相比,显著减少了轨迹漂移和足部滑动。
- 动作模仿稳定性:
- 当使用 FRAPPE++ 作为参考时,机器人使用 BeyondMimic 策略达到了 90.56% 的成功率 (SR),与使用地面真值(Ground-truth)光学动作捕捉参考的成功率 (92.78%) 相当。
- 低质量的视觉参考(如 WHAM)会导致接近完全失败(SR < 3.33%),凸显了准确接触估计的必要性。
- 控制性能: 集成 PSP 策略进一步提升了性能。在使用 FRAPPE++ 参考时,PSP 达到了 94.44% 的成功率 (SR) 和 98.46% 的动作完成度 (MC),甚至超过了“光学动作捕捉 + BeyondMimic”的基准。
- 物理合理性: 定性结果表明,FRAPPE++ + PSP 能产生稳定、自然的运动,具有正确的足部接触动力学,而基准方法经常表现出姿态扭曲、不稳定或保守的足部放置。
重要性与主张
论文声称 PressMimic 是第一个系统性利用压力信号在人形动作模仿的感知和控制阶段进行处理的系统。其重要性在于:
- 桥接感知与控制: 通过使用压力作为统一模态,该框架创建了一个一致的物理接地信号,使运动估计阶段与控制阶段保持一致,缩小了运动学模仿与物理一致执行之间的差距。
- 解决歧义: 压力信号提供了关于接触和支撑的显式约束,解决了基于视觉的姿态估计中固有的歧义(如深度和遮挡),并防止了诸如地面穿透之类的伪影。
- 实现稳定运动: 压力监督策略使机器人能够重现人类演示者的底层接触动力学,从而在复杂的富接触场景中实现更高的稳定性和成功率。
- 数据贡献: MotionPRO 的引入为训练和评估多模态、物理接地运动模仿系统提供了必要的资源。
作者总结道,尽管目前在涉及外部物体的复杂多接触场景中仍存在局限性,但引入压力等物理感知模态是实现鲁棒且具有物理接地性的具身智能的关键一步。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。