想象一下,你正试图通过观看人们做诸如拉开抽屉、挥手或跳跃等动作的视频,来教机器人理解人类运动。机器人将这些运动视为随时间推移而移动和变化的浮动点云("point cloud")。
本文介绍了一种名为DiMP(扩散掩码预训练,Diffusion Masked Pretraining)的新训练方法,以帮助机器人更好地学习这些运动。以下是通过简单类比对其工作原理的解释:
问题所在:“作弊”的机器人和“一刀切”的猜测
以往的方法试图通过向机器人展示视频、隐藏其中一部分(例如给某些点戴上眼罩),然后让机器人猜测被隐藏的部分来教导它。然而,这些旧方法存在两个重大缺陷:
- “作弊”的位置:当机器人试图猜测被隐藏点的位置时,旧方法会悄悄向机器人的“解码器”(负责将碎片重新拼合的部分)透露确切的正确位置。这就像在学生考试时给他们答案钥匙。机器人并没有真正学会推断位置;它只是记住了作弊代码。这被称为位置泄露。
- “平均”猜测:在预测一个人从一秒到下一秒如何移动时,旧方法迫使机器人猜测平均运动。想象一个人有同等几率向左或向右挥手。一个“平均”的猜测会是直直地向上挥手。但在现实中,人们很少直直地向上挥手!通过迫使机器人猜测平均值,它忽略了存在多种有效运动方式的事实。它将所有可能性坍缩成一个枯燥的、确定性的猜测。
解决方案:DiMP(“蒙眼侦探”)
DiMP 利用受扩散模型(与从噪声生成图像相同的技術)启发的技术来解决这些问题。
1. 修复“作弊”(不再提供答案钥匙)
DiMP 不再向机器人悄悄透露正确位置,而是将隐藏的点用静态噪声(如电视雪花)打乱,然后要求机器人将其清理复原。
- 类比:想象你试图在黑暗的房间里寻找一个丢失的玩具。与其有人告诉你“它在椅子下面”,不如给你一张椅子的模糊、充满噪点的照片,并说:“根据这张照片推断出玩具在哪里。”
- 结果:机器人必须真正学会从周围语境中推断位置。它无法作弊。这创造了一个“无泄露”的环境,使机器人能够真正理解空间关系。
2. 修复“平均”猜测(拥抱“可能”)
在预测运动时,DiMP 不要求机器人猜测一条特定路径。相反,它要求机器人学习整个可能性地图。
- 类比:想象一位天气预报员。一位糟糕的预报员说:“明天正好是 72 华氏度。”一位优秀的预报员会说:“有 50% 的概率下雨,30% 的概率晴天,20% 的概率多云。”
- 结果:DiMP 教导机器人,对于特定动作(如“拿起杯子”),并非只有一种完美的做法。存在许多有效的方式。通过学习完整的“分布”(所有可能性的地图),机器人即使在平均运动看起来相同的情况下,也能更好地识别动作之间的细微差别。
实际运作方式
训练主要分为两个阶段:
- 阶段 1(定位):机器人学习清理被打乱的隐藏点,以确定它们属于何处,而不被提供答案钥匙。
- 阶段 2(运动与重建):一旦机器人知道点的位置,它便尝试重建整个场景。同时,它学习预测帧与帧之间运动中的噪声。这迫使它理解运动的“形状”,而不仅仅是平均路径。
结果
作者在机器人需要识别人类动作(如“拉开抽屉”或“跳跃”)的数据集上测试了该方法。
- 离线性能:当机器人可以在视频结束后查看整个视频时,与以往方法相比,DiMP 显著提高了准确率(在某些测试中提高了 11% 以上)。
- 在线性能:这是真正的考验。想象机器人必须在人正在做动作时猜测他们在做什么,而无法看到未来。DiMP 在此表现出色,准确率提高了 13% 以上。因为它理解了可能运动的范围,所以它比只了解“平均”运动的机器人能更好地预测接下来可能发生什么。
总结
DiMP 就像是将学生从死记硬背者(通过看答案钥匙作弊并猜测平均值)升级为侦探(通过线索推断位置,并理解解决问题有多种方式)。这使得机器人在理解三维空间中的动态人类运动方面变得更加聪明。
技术摘要:动态点云扩散掩码预训练(DiMP)
问题陈述
动态点云预训练目前主要由掩码重建目标主导。然而,现有方法存在两个关键局限性,阻碍了动态序列的有效表征学习:
- 时空位置泄露:现有方法(如 MaST-Pre、M2PSC)直接将真实管状中心坐标注入解码器作为位置嵌入。这泄露了空间先验,导致解码器依赖局部几何检索,而非从时空上下文中推断位置。
- 确定性运动监督:当前方法使用确定性代理目标(如均值回归)来监督帧间运动。这将合理轨迹的多模态分布坍缩为单一条件均值。因此,模型丢弃了分布结构(方差和形状),而这些结构对于区分具有相似均值轨迹但在不确定性或高阶统计量上不同的动作类别至关重要。
方法论:扩散掩码预训练(DiMP)
DiMP 是一个统一的自监督框架,将去噪扩散概率模型(DDPMs)集成到掩码自动编码范式中,以同时解决上述两个局限性。该框架分为两个阶段运行:
1. 阶段一:Token 编码与时空中心去噪
- 掩码管状 Token 化:动态点云被划分为时空管状区域。大部分管状区域被掩码。
- 无泄露中心扩散:与腐蚀所有 patch 的静态方法不同,DiMP 将前向扩散噪声仅应用于被掩码的管状中心(C0m)。可见管状中心(C0v)保持无噪声,作为干净的时序锚点。
- 双流编码器:共享编码器通过自注意力处理可见 Token,并通过与可见上下文的交叉注意力处理被掩码 Token。
- 中心预测:中心预测头将被掩码 Token 映射为预测的干净中心(C^0m)。该过程通过均方误差(MSE)与真实值进行监督。通过在可见上下文条件下从噪声输入预测中心,模型学习了鲁棒的位置表征,且无位置泄露。
2. 阶段二:几何重建与运动感知扩散
- 非对称解码器:解码器结合可见编码器特征、噪声被掩码内容嵌入,以及源自干净可见中心和停止梯度预测被掩码中心(sg(C^0m))的位置嵌入。停止梯度确保中心预测头仅由中心损失更新,而不受重建或运动损失的影响。
- 几何重建:解码器输出监督每帧的 Chamfer 距离重建(Lgeo),以恢复完整的点云几何。
- 运动扩散分支:
- 目标:使用冻结的对应关系模型(CorrNet3D)离线构建帧间位移向量(Δp)。
- 过程:单独的扩散过程在分层时间步(h 间隔)上腐蚀这些位移向量。
- 目标:一个噪声预测头,以解码器输出(Zdec)和扩散时间步为条件,预测注入的噪声(Lmot)。
- 意义:这将运动监督重构为噪声预测任务,驱动编码器内化运动轨迹的完整条件分布,而非单一确定性均值。
总体训练目标
三个损失通过加权求和统一:
L=Lgeo+γcenLcen+λmotLmot
预训练后,解码器和扩散头被丢弃;仅保留编码器用于下游微调。
主要贡献
- 理论洞察:本文正式论证了确定性运动监督系统地丢弃了对多模态轨迹不确定性至关重要的分布结构。它指出位置泄露是有效分布运动建模的先决障碍。
- DiMP 框架:首个针对动态点云的基于扩散的预训练框架。它将帧间位移监督重构为 DDPM 噪声预测任务,在变分代理下针对运动轨迹的完整条件分布。
- 中心扩散策略:一种新颖策略,将噪声注入严格限制在被掩码的管状中心。这解决了位置泄露问题,同时不损害时序推断,因为可见坐标保持为干净锚点。
- 实证性能:大量实验表明,DiMP 在多个基准测试中相比 prior 方法取得了持续改进。
实验结果
DiMP 在动作分割、语义分割和动作识别任务上进行了评估:
- 4D 动作分割(HOI4D):DiMP 相比骨干网络本身及 prior 预训练方法取得了显著提升。
- 在 P4Transformer 骨干网络上,其 F1@50 提升了**+22.57%(从 65.9 提升至 80.77),编辑距离提升了+11.80%**。
- 在更强的 PPTr 骨干网络上,其 F1@50 提升了**+11.93%**。
- 4D 语义分割(HOI4D):DiMP 优于所有 prior 方法,实现了47.6% mIoU(比 P4Transformer 基线高 7.5),表明所学表征捕捉到了细粒度的边界几何。
- 3D 动作识别(MSRAction-3D):DiMP 在 PST-Transformer 骨干网络上实现了95.51%的准确率,在 P4Transformer 上实现了93.97%,优于确定性运动目标。
- 在线推理:在因果约束的在线推理(仅根据过去上下文预测未来运动)下,DiMP 表现出尤为显著的增益,相比 P4Transformer 基线 F1@50 提升了**+27.20%**。这表明所学的运动分布在无法获取未来帧时提供了强大的预测先验。
- 消融研究:
- 位置泄露:腐蚀可见中心(全中心扩散)导致性能下降,证实了保持可见坐标干净的必要性。
- 先决作用:仅使用运动扩散带来的增益微乎其微;需要中心扩散才能实现有效的运动建模。
- 分层采样:使用多个分层时间步(h=4)在细粒度局部恢复(小 t)和粗略全局语义(大 t)之间提供了最佳权衡。
意义与主张
本文声称 DiMP 是首个利用 DDPM 完整分布建模能力进行动态点云预训练的框架。其意义在于:
- 解决多模态性:通过针对完整条件分布,DiMP 能够区分具有相同均值轨迹但在轨迹方差和形状上不同的动作类别,这是确定性回归所缺乏的能力。
- 解决位置泄露:它提供了一种机制,可在不泄露真实先验的情况下从上下文中推断被掩码位置,这对于运动扩散分支作为真正的分布学习器发挥作用至关重要。
- 鲁棒性:该方法在不同骨干网络和任务上表现出鲁棒性,特别是在未来运动分布建模至关重要的在线推理场景中表现尤为强劲。
作者承认了骨干网络效率方面的局限性,指出其实现依赖于 P4Transformer,该网络具有二次自注意力复杂度,且在线吞吐量低于线性复杂度架构。他们将 DiMP 定位为未来动态点云分布表征学习研究的参考基线。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。