← 最新论文
💻 computer science

Diffusion Masked Pretraining for Dynamic Point Cloud

本文提出了扩散掩码预训练(DiMP),这是一种针对动态点云的统一自监督框架,通过将扩散建模整合到位姿推断与运动学习中,消除了时空位置泄露并捕捉多模态运动不确定性,从而在下游动作分割任务中实现了显著提升。

原作者: Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

发布于 2026-05-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhuoyue Zhang, Jihua Zhu, Chaowei Fang, Jian Liu, Ajmal Saeed Mian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图通过观看人们做诸如拉开抽屉、挥手或跳跃等动作的视频,来教机器人理解人类运动。机器人将这些运动视为随时间推移而移动和变化的浮动点云("point cloud")。

本文介绍了一种名为DiMP(扩散掩码预训练,Diffusion Masked Pretraining)的新训练方法,以帮助机器人更好地学习这些运动。以下是通过简单类比对其工作原理的解释:

问题所在:“作弊”的机器人和“一刀切”的猜测

以往的方法试图通过向机器人展示视频、隐藏其中一部分(例如给某些点戴上眼罩),然后让机器人猜测被隐藏的部分来教导它。然而,这些旧方法存在两个重大缺陷:

  1. “作弊”的位置:当机器人试图猜测被隐藏点的位置时,旧方法会悄悄向机器人的“解码器”(负责将碎片重新拼合的部分)透露确切的正确位置。这就像在学生考试时给他们答案钥匙。机器人并没有真正学会推断位置;它只是记住了作弊代码。这被称为位置泄露
  2. “平均”猜测:在预测一个人从一秒到下一秒如何移动时,旧方法迫使机器人猜测平均运动。想象一个人有同等几率向左或向右挥手。一个“平均”的猜测会是直直地向上挥手。但在现实中,人们很少直直地向上挥手!通过迫使机器人猜测平均值,它忽略了存在多种有效运动方式的事实。它将所有可能性坍缩成一个枯燥的、确定性的猜测。

解决方案:DiMP(“蒙眼侦探”)

DiMP 利用受扩散模型(与从噪声生成图像相同的技術)启发的技术来解决这些问题。

1. 修复“作弊”(不再提供答案钥匙)

DiMP 不再向机器人悄悄透露正确位置,而是将隐藏的点用静态噪声(如电视雪花)打乱,然后要求机器人将其清理复原。

  • 类比:想象你试图在黑暗的房间里寻找一个丢失的玩具。与其有人告诉你“它在椅子下面”,不如给你一张椅子的模糊、充满噪点的照片,并说:“根据这张照片推断出玩具在哪里。”
  • 结果:机器人必须真正学会从周围语境中推断位置。它无法作弊。这创造了一个“无泄露”的环境,使机器人能够真正理解空间关系。

2. 修复“平均”猜测(拥抱“可能”)

在预测运动时,DiMP 不要求机器人猜测一条特定路径。相反,它要求机器人学习整个可能性地图

  • 类比:想象一位天气预报员。一位糟糕的预报员说:“明天正好是 72 华氏度。”一位优秀的预报员会说:“有 50% 的概率下雨,30% 的概率晴天,20% 的概率多云。”
  • 结果:DiMP 教导机器人,对于特定动作(如“拿起杯子”),并非只有一种完美的做法。存在许多有效的方式。通过学习完整的“分布”(所有可能性的地图),机器人即使在平均运动看起来相同的情况下,也能更好地识别动作之间的细微差别。

实际运作方式

训练主要分为两个阶段:

  1. 阶段 1(定位):机器人学习清理被打乱的隐藏点,以确定它们属于何处,而不被提供答案钥匙。
  2. 阶段 2(运动与重建):一旦机器人知道点的位置,它便尝试重建整个场景。同时,它学习预测帧与帧之间运动中的噪声。这迫使它理解运动的“形状”,而不仅仅是平均路径。

结果

作者在机器人需要识别人类动作(如“拉开抽屉”或“跳跃”)的数据集上测试了该方法。

  • 离线性能:当机器人可以在视频结束后查看整个视频时,与以往方法相比,DiMP 显著提高了准确率(在某些测试中提高了 11% 以上)。
  • 在线性能:这是真正的考验。想象机器人必须在人正在做动作时猜测他们在做什么,而无法看到未来。DiMP 在此表现出色,准确率提高了 13% 以上。因为它理解了可能运动的范围,所以它比只了解“平均”运动的机器人能更好地预测接下来可能发生什么。

总结

DiMP 就像是将学生从死记硬背者(通过看答案钥匙作弊并猜测平均值)升级为侦探(通过线索推断位置,并理解解决问题有多种方式)。这使得机器人在理解三维空间中的动态人类运动方面变得更加聪明。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →