想象一下,你正在教一个机器人去拿起咖啡杯、拉开抽屉,或者挂起一把钳子。要做到这一点,机器人需要以三维方式“看见”世界。
长期以来,科学家们一直试图通过两种主要方法教机器人如何“看见”,但这两种方法都存在一个重大缺陷:
- “迷雾”方法(隐式):这种方法生成一种平滑、连续的数据云,看起来像雾状的三维模型。它非常擅长描述物体“看起来”是什么样(纹理、颜色),但就像试图抓住一团云;它缺乏清晰的边缘和结构,使得机器人难以确切知道该伸向何处。
- “像素化乐高”方法(显式):这种方法由离散的、独立的点(像微小的乐高积木)构建世界。它具有清晰的结构,但如果你想要一条平滑的曲线,就需要数百万块积木。为了保持机器人的速度,科学家们往往不得不使用更少的积木,这导致图像变得块状化,并丢失了精细细节。
解决方案:“结构潜在点”
本文的作者提出了一种巧妙的中间方案。他们称之为“学习结构潜在点”。
可以这样理解:与其试图记住海滩上每一粒沙子的确切形状(数据量太大),或者仅仅从一张模糊的照片中猜测海滩的大致形状(太模糊),机器人学习的是一张海滩的“草图”。
- 草图:这张草图捕捉了物体的“感觉”和“大致形状”(例如,“这里有一个圆杯子”,“那里有一张平坦的桌子”)。
- 魔法技巧:机器人使用一种名为“逐点潜在变分自编码器(Point-wise Latent VAE)”的特殊工具。想象这是一个“智能压缩机”。它将原始三维数据压缩成一个紧凑、平滑的摘要。它并不保留真实物体那些精确但锯齿状的边缘;相反,它将它们平滑成一种“概率性”形状。这使得数据更容易被机器人的大脑处理,并且对微小的误差或噪声不那么敏感。
他们如何训练它
为了教会机器人这种新的感知方式,作者利用**3D 高斯泼溅(3D Gaussian Splatting)**构建了一个精简的训练流程。
- 类比:想象你是一位艺术家,试图学习绘制三维物体。你不是去绘制一幅耗时极久且需要庞大计算机支持的超写实杰作,而是被教导只绘制物体的轮廓和“感觉”。
- 该系统从多个角度拍摄物体照片,将其转换为三维点,然后尝试“重新渲染”这些照片。如果机器人内部的“草图”足够好,它就能完美地重现该视角。
- 关键在于,他们保持了训练过程的轻量化。他们剔除了不必要的复杂性,使机器人能够完全专注于学习世界的结构,而不仅仅是记忆颜色。
结果
团队通过两种方式测试了这个机器人“大脑”:
- 在模拟环境中:他们使用了两个流行的类视频游戏环境(RLBench 和 ManiSkill2),机器人在其中练习堆叠方块、转动水龙头和倒水等任务。他们的方法始终优于其他顶级方法,帮助机器人更频繁地成功完成任务并更快地学习。
- 在现实世界中:他们将训练好的机器人安装在一台真实的物理机械臂(AgileX Piper)上,并配备真实摄像头。他们在六个现实生活中的任务中测试了它,例如用海绵清洁桌子、挂起钳子和倒水。使用这种新的“结构草图”方法的机器人,其表现明显优于使用旧方法的机器人或完全未经预训练的机器人。
核心结论
本文提出了一种赋予机器人“三维直觉”的方法。通过教它们将世界视为平滑、结构化的草图,而非杂乱的云团或块状的像素,机器人能够更好地理解物体的位置以及如何与它们互动,同时使用的计算资源更少。
一个注意事项:作者指出,由于这种方法为了创建“草图”而平滑了细节,它可能不足以胜任需要微观精度的任务,例如穿针引线或进行手术。它是为通用操作设计的,而非高精度手术。
技术摘要:为机器人操作中的高效视觉表征学习结构潜在点
1. 问题陈述
当前用于具身感知与操作的 3D 感知预训练方法,在表达能力与结构可解释性之间面临根本性的权衡。
- 隐式表征(例如基于 NeRF 的方法): 虽然具有高度表达能力,能够编码连续的空间与语义信息,但缺乏显式的结构线索。这使得下游具身智能体难以直接利用。此外,由于其低效的光线投射机制,计算成本高昂。
- 显式表征(例如 3D 高斯泼溅): 这些方法保留了几何信息并提供了可解释的结构。然而,其容量通常受限于分辨率。为了保持轻量级的策略网络,点状泼溅(splats)经常被下采样,导致细粒度结构信息的丢失。此外,当下游场景与预训练领域显著偏离时,这些方法往往表现不佳,因为投影可能位于预训练潜在流形之外。
现有方法往往无法结合隐式方法的表达能力与显式方法的结构先验,同时 suffers 计算效率低下或对现实世界变化的泛化能力差的问题。
2. 方法论
作者提出了一种新颖的预训练框架,用于学习混合表征:结构潜在点(Structural Latent Points)。该方法通过一个精简的、基于 3D 高斯泼溅(3DGS)的流水线,融合了两种范式的优势。
A. 核心架构:逐点潜在变分自编码器(PL-VAE)
该框架通过在潜在空间中插入逐点潜在变分自编码器(PL-VAE),对标准的 Point Transformer V3(PTv3)自编码器进行了修改。
- 流程: 原始点云通过 PTv3 被编码为稀疏特征点(Psparse)。PL-VAE 并非直接解码这些点,而是对其进行操作。
- 机制: PL-VAE 提取每个点的全局和局部描述符,将它们拼接,并预测特征维度和坐标维度的高斯分布参数(μ,σ)。
- 正则化: 利用重参数化技巧,模型采样出向标准高斯先验正则化的潜在变量(zvae)。
- 效果: 生成的潜在点既不是严格的显式(精确几何),也不是完全的隐式。相反,它们以概率正则化的形式捕捉粗略的结构趋势和语义信息。这创造了一个紧凑、平滑的潜在空间,在保留几何规律性的同时降低了对噪声的敏感性,从而增强了泛化能力。
B. 精简的 3DGS 渲染流水线
为了确保前端潜在模块成为表征学习的主要驱动力,作者设计了一个轻量级、高效的渲染流水线:
- 几何推理: 一个模块(Gθ)从解码后的密集特征中预测高斯属性(旋转、缩放、不透明度)。
- 仅特征泼溅: 与先前同时泼溅颜色和特征的工作不同,该方法仅泼溅特征和深度。这使得流水线简洁,将模型容量集中在学习几何感知特征上,而非照片级图像合成。
- 双重监督: 渲染后的特征图被解码为语义特征和颜色。该框架将这些特征与真实语义图(来自 E-RADIO)和 RGB 图像进行对齐。
- 辅助重建: 一个轻量级模块从密集特征中回归原始点坐标和颜色。辅助损失(Lrecon)将表征锚定在基本外观和几何上,在渲染特征尚不成熟时稳定早期训练。
C. 优化
总损失函数结合了渲染对齐、重建和 VAE 正则化:
Ltotal=(1−w(t))Lrender+w(t)Lrecon+Lvae+LKL
- Lrender:RGB、深度和语义特征上的 L1 损失。
- Lrecon:点坐标和颜色上的 L1 损失。
- Lvae:稀疏潜在点的 L1 重建损失。
- LKL:KL 散度损失,用于在特征和坐标分布上强制高斯先验。
- w(t):一个退火权重,将关注点从重建(早期训练)转移到渲染对齐(后期训练)。
3. 主要贡献
- 结构潜在点: 一种新颖的混合表征,通过逐点潜在 VAE 将隐式表达能力与显式结构先验融合,在不编码精确几何的情况下捕捉粗略形状和语义信息。
- 高效预训练流水线: 一个精简的基于 3DGS 的框架,去除了冗余的架构组件。它采用仅特征泼溅和深度对齐,以最大化潜在模块的表征容量,同时显著降低计算成本。
- 鲁棒的泛化性: 坐标和特征的概率正则化创造了一个平滑的潜在流形,与刚性显式表征相比,提高了对视角变化和场景变化的鲁棒性。
4. 实验结果
该框架在RLBench、ManiSkill2以及真实机器人平台上进行了评估。
- 仿真基准(RLBench & ManiSkill2):
- 与包括 MultiViT、PTv3、VC-1、MultiMAE、PonderV2 和 SPA 在内的强基线相比,该方法取得了最佳整体性能(最高的平均成功率 MSR 和最低的平均排名)。
- 在 RLBench 上,其平均成功率为0.56(次优的 SPA 为 0.50),平均排名为1.50。
- 在 ManiSkill2 上,其平均成功率为0.64,平均排名为1.33,优于所有 3D 感知基线。
- 消融研究:
- 几何推理: 移除推理模块(使用恒定高斯属性)导致深度图噪声增加和性能显著下降(例如,CloseJar 任务的成功率从 0.48 降至 0.24)。
- PL-VAE: 移除 PL-VAE 导致所有任务的性能大幅下降,证实了其在学习紧凑、正则化的结构潜在点方面的关键作用。
- 特征泼溅: 定性分析表明,与同时泼溅颜色和特征的方法相比,仅特征泼溅能产生更清晰的语义可分性。
- 效率: 所提出的方法效率显著提高,在单张 A800 GPU 上仅需166 GPU 小时,而 SPA(80 张 A100)需要约 4000 小时,VC-1 需要约 10,000 小时。
- 真实世界部署: 在配备 Orbbec 摄像头的 AgileX Piper 机械臂上测试了六个任务(如清洁、倾倒、抓取)。预训练模型始终优于从头训练的基线和其他对应方法(例如,“放置橘子”任务的成功率为 84%,而从头训练为 76%)。
5. 意义与主张
该论文声称,通过学习结构潜在点,所提出的框架成功弥合了隐式场的表达能力与显式原语的结构效用之间的差距。
- 泛化性: 由于平滑的、概率正则化的潜在空间,该方法表现出卓越的向下游具身任务的迁移能力,特别是在场景变化显著的情况下。
- 效率: 精简的流水线为大规模预训练提供了可扩展的解决方案,与最先进的 3D 感知方法相比,将硬件需求和训练时间降低了数个数量级。
- 实用性: 在真实世界机器人上的成功部署证实,所学表征不仅仅是仿真伪影,而且对物理操作是有效的。
局限性: 作者谦逊地指出,采样步骤虽然提高了泛化能力,但阻止了表征以完全精确的方式捕捉物体几何。因此,在需要极高精度的场景(如手术操作或穿针引线)中,该方法可能存在性能上限。未来的工作建议探索耦合确定性和概率性组件的表征。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。