✨ 要点🔬 技术摘要
想象一下你正在试图教一个机器人拿起一个方块并把它放入碗中。
旧的方法(“2D电影”法) 目前的机器人大多通过观看2D视频来学习,就像在看平面的屏幕上的电影一样。它们试图根据前一帧预测下一帧画面会是什么样子。
问题所在: 如果机器人是一个电影放映机,它实际上并不理解“深度”。它看到的是一个平面的方块图像。如果摄像机稍微移动,或者光照发生变化,机器人就会感到困惑,因为它只是在匹配像素,而不是在理解这是一个实体的3D物体。这就像是试图仅通过看一张平面地图来通过迷宫;你可能知道纸上的墙在哪里,但当你撞到墙时,你无法感受到墙的存在。
新的方法(“3D粘土”法) 这篇论文介绍了一种名为**结构化4D潜在预测模型(Structured 4D Latent Predictive Model)**的新方法。机器人不再是预测一段扁平的视频,而是使用“数字粘土”(一个结构化的3D空间)来构建其对世界的心理模型。
以下是它的工作步骤:
1. 构建“数字粘土”(3D潜在空间)
当机器人通过摄像头观察世界时,它不仅仅是保存一张照片。它将看到的视图转换为一个稀疏的3D网格 ——可以把它想象成3D版的《我的世界》(Minecraft)方块,但只有那些真正有物体存在的方块才是“激活”状态。
神奇之处: 这个网格承载了房间内所有事物的形状、颜色和位置。这是一个统一的3D地图,机器人可以从任何角度观察它,而不仅仅局限于摄像机的视角。
2. 预测未来(“时间机器”)
机器人会接收到一个文本指令,例如“拿起木桩并把它放入孔中”。
机器人不是在猜测下一帧视频看起来像什么,而是利用它的3D粘土模型来模拟未来 。它会问:“如果我这样移动手臂,3D粘土会如何变化?”
它会生成一系列未来的3D状态序列。因为它是在处理一个真实的3D模型,所以它想象的未来在物理上是一致的。木桩确实能放入孔中;它不会仅仅从一个角度看起来是对的,换个角度就消失了。
3. “翻译官”(逆动力学)
机器人现在拥有了一部完美的未来3D电影,但它需要知道如何移动其物理关节才能实现这部电影。
这就是**逆动力学模块(Inverse Dynamics Module)**发挥作用的地方。把它想象成一个翻译官。它观察“当前3D状态”和“未来3D状态”,然后说:“为了从这里到达那里,机器人手臂需要以这种特定的方式移动关节。”
它将抽象的3D预测转化为具体的电机指令(例如“肩膀旋转15度”)。
为什么这更好? 该论文声称这种方法优于以往,主要基于三个原因:
它不会感到晕眩: 因为机器人理解3D几何结构,所以它比基于视频的机器人能更好地处理光照或摄像机角度的变化。它知道即使阴影移动了,方块依然在那里。
它看到了全局: 它不仅仅看到一个摄像机的视角;它理解整个房间。如果一个物体被一个摄像机挡住了,3D模型仍然会根据其他角度“知道”它的存在。
它能在现实世界中工作: 作者在真实机器人上测试了该方法(而非仅仅在模拟器中)。他们展示了他们的机器人可以成功地堆叠方块、拉动工具以及插入木桩,即使在光线昏暗或背景与训练时不同的情况下也是如此。
简而言之: 旧的机器人试图猜测一段扁平电影的下一帧。这个新的机器人构建了一个世界的3D雕塑,模拟这个雕塑随时间变化的过程,然后弄清楚如何精确地移动身体,使这种模拟变为现实。这使得它在理解空间和处理复杂任务方面表现得更加出色。
技术摘要:用于机器人规划的结构化 4D 潜空间预测模型
问题陈述
当前的机器人规划范式在泛化能力和空间推理方面面临显著局限。虽然端到端策略模型(将观测值直接映射到动作)在狭窄、受控的环境中表现良好,但在面对分布偏移(如光照变化、视角变化或任务组合变化)时表现挣扎。相反,视频生成预测模型作为长程规划的一种极具前景的替代方案,其本质上是在 2D 像素空间内运行。这种 2D 特性导致其与真实的 3D 世界存在物理不一致性,从而缺乏准确的空间理解和多视角一致性。现有的引入 3D 线索(例如,在 RGB 之外预测深度和法向量)的尝试通常仅停留在表面投影层面,容易受到遮挡和视角变化的影响。传统的 3D 表示(点云、网格)缺乏语义理解所需的丰富视觉细节,而照片级逼真的表示(NeRFs、3D 高斯泼溅)则计算密集且难以对动态进行建模。本文解决的核心挑战是构建一个能够内在模拟世界动态 3D 结构的模型,以实现精确且具有 3D 一致性的机器人规划。
方法论
1. 结构化 3D 潜空间表示
作者提出了一种结构化 4D 潜空间预测模型 ,该模型在结构化潜空间而非像素空间中运行。
表示: 场景被编码为一系列稀疏体素网格 。每个活跃体素 p i p_i p i 持有一个紧凑的特征向量 f i f_i f i ,用于编码局部几何和颜色。这平衡了结构信息与潜空间压缩,使用约 8,000 个活跃体素及 8 维特征,相比于需要 64 3 64^3 6 4 3 个元素的稠密网格,极大地降低了复杂度。
编码: 多视图 RGB-D 观测值通过相机几何进行逆投影,形成 3D 点云,并进行体素化。预训练的 DINOv2 编码器从图像中提取补丁级嵌入,这些嵌入被逆投影并平均到体素网格中,从而生成结构化 3D 潜变量 z t z_t z t 。
解码: 潜变量解码器将体素特征映射为 3D 高斯函数集。这些高斯函数可以从任意视角渲染成图像,或转换为显式点云,从而架起原始视觉感知与内部 3D 状态之间的桥梁。
2. 预测模型架构
该模型根据当前状态 z t z_t z t 和文本指令 c c c ,预测 3D 场景的演变过程(z t + 1 , … , z t + T z_{t+1}, \dots, z_{t+T} z t + 1 , … , z t + T )。它采用两步流水线:
单一动力学模型 (SD): 专注于粗略的几何变化。它使用基于 Transformer 的条件流匹配(conditional flow matching)来预测下一状态的稀疏体素位置。它以当前潜变量和文本指令作为输入。
潜变量生成器 (LG): 专注于外观和视觉细节。在给定 SD 预测的体素位置的基础上,LG 利用同样基于流匹配的框架为这些体素填充特征向量。
训练: 这两个组件作为条件流匹配模型独立进行训练。训练目标是最小化在干净数据与高斯噪声插值过程中,预测的速度场与真实噪声向量之间的距离。
3. 规划流水线
该预测模型作为高级规划器,生成的未来 3D 状态通过目标条件逆动力学模块 转化为可执行的动作:
从潜变量到动作: 模型预测一系列潜空间子目标。逆动力学模块将当前状态与下一个子目标映射为短时程动作块(关节位置)。
实现选项:
学习型逆动力学: 将潜变量解码为点云,利用金字塔卷积骨干网络进行编码,并使用扩散头来预测动作。
无学习姿态估计: 将预测的子目标解码为点云,估计使机器人夹持器模板与预测的夹持器几何形状对齐的刚体变换(使用 FPFH、RANSAC 和 ICP),并将目标位姿传递给运动规划器。
执行: 系统可以以开环方式运行(执行预测动作)或闭环方式运行(根据新观测值在每一步进行重新规划)。
核心贡献
结构化 4D 潜空间预测模型: 一种新型模型,能够在观测和文本的条件下预测未来的 3D 结构,通过在结构化潜空间而非 2D 像素空间中运行,实现了强大的视觉质量、3D 一致性和鲁棒的视角泛化能力。
规划框架: 一个利用详细 3D 预测作为逆动力学模块几何丰富目标的框架,实现了精确且具备空间感知能力的操控。
经验优越性: 实验证明,该方法在生成质量和下游机器人任务性能方面均优于最先进的视频生成规划器(如 UniPi、TesserAct),包括在视觉变化下的强零样本泛化能力以及在真实世界平台上的有效性。
实验结果
4D 生成质量
指标: 在图像质量(PSNR, SSIM, LPIPS)和 3D 一致性(Chamfer Distance, 深度误差, 多视角 PSNR/SSIM/LPIPS)方面进行评估。
性能: 所提方法与 Wan-2.1、TesserAct 和 OpenSora-1.3 等基线相比,实现了更优的 3D 一致性和多视角相干性。例如,其 Chamfer Distance 为 5.95,而基线约为 42-44;其多视角 cPSNR 为 27.42,而基线约为 16-17。
视觉保真度: 生成的序列在多个相机视角下保持了时间一致性和高视觉保真度。
机器人规划性能
仿真环境 (ManiSkill3 & RLBench): 在 StackCube、ToolPull 和 PegInsertion 等任务中,该方法在 ManiSkill3 上达到了 61.3% 的平均成功率,显著超过了 UniPi (29.3%) 和 TesserAct (24.7%),并接近专门的模仿学习策略。在 RLBench 任务中,它实现了 75.3% 的平均成功率,高于 UniPi (55.0%) 和 TesserAct (61.7%)。
零样本泛化: 模型展示了对未见视觉条件(光照变化、噪声、背景偏移)和新颖视角(最高 10° 旋转)的鲁棒性,在这些情况下仍能保持 78% 以上的成功率,而基线(如 DP 在光照变化下降至 7%)则大幅下降。
真实世界验证: 在一个包含 50 个回合的真实世界“篮中放块”任务中,该方法达到了 80% 的成功率 ,优于 Diffusion Policy 基线 (62%)。
消融实验
输入表示: 研究发现,解码后的点云是逆动力学模块最有效的输入,与原始体素或全量 3D 潜变量相比,它在几何保真度和计算效率之间取得了平衡。
视角数量: 虽然使用更多视角(40 个)进行训练提升了 3D 一致性,但该模型在使用有限训练视角(4 个)的情况下依然有效,尤其是在结合闭环重规划时,这显著提升了成功率。
意义与主张
论文声称,通过从 2D 视频生成方法转向结构化 4D 潜空间,所提模型克服了当前视频生成规划器固有的物理不一致性和空间推理缺失问题。其重要性在于:
整体 3D 理解: 能够对完整的 3D 场景结构进行编码和预测,确保多视角相干性和物理一致性。
泛化能力: 能够在无需重新训练的情况下,对新的视觉条件和视角进行泛化,这是实际部署的关键要求。
模块化规划: 预测模型(规划)与逆动力学模块(控制)的分离,允许灵活地集成并迁移到不同的机器人设置和任务中。
真实世界适用性: 该方法从仿真到真实机器人平台的成功迁移,展示了其在复杂操控任务中的实际应用潜力。
作者指出,虽然目前的实现假设初始重建使用校准过的多视图输入,但如何将该方法扩展到更弱的输入设置仍是未来的研究方向。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。