长期以来,科学家们试图通过向机器人输入成千上万段从各种可能角度拍摄的视频来解决这个问题,希望机器人最终能自己摸索出其中的规律。这就像是在没有字典的情况下,通过听取一百万个不同说话者的声音来学习一门语言;虽然可行,但极其缓慢且效率极低。另一种方法是给机器人配备特殊的“深度传感器”,充当 3D 眼睛,让它们无论摄像机角度如何都能看到物体的实际形状。但这些特殊传感器既昂贵,也不适用于所有机器人。研究人员提出的核心问题是:我们能否教机器人清晰地观察世界并做出正确的行动,即使摄像机在移动,且不需要昂贵的硬件或数百万小时的训练?
它是这样工作的:当机器人看到一个来自奇怪角度的图像时,ARGUS 会利用一个强大的预训练 3D 视觉模型来推测整个 3D 场景看起来是什么样的,这几乎就像是在构建一个房间的数字粘土模型。然后,它从一个固定的、完美的角度对该 3D 模型进行“重渲染”——想象一下,无论真实的摄像机在哪里,总有一个摄像机始终悬停在恰到好处的位置。这创造了一张干净、一致的图片,机器人的学习大脑可以轻松理解。
然而,作者也谨慎地指出,这种“魔法”目前还不完美。虽然 ARGUS 在处理通用任务时表现出色,但在处理非常微小、精细的动作(例如捡起一个小纽扣)时,有时会遇到困难。这是因为软件对 3D 形状的推测并不总是 100% 准确,导致微小的误差,从而在机器人需要极高精确度时使其产生困惑。此外,由于机器人必须为每一次动作都进行这种 3D 重建,这会消耗额外的时间——每次动作大约半秒钟——对于需要即时反应的任务来说,这可能太慢了。但总体而言,这项研究表明,为机器人提供一个“标准化的视角”是让它们成为更聪明、学习更快的学习者的强大方式。
作者提出了 ARGUS(Aligning Robot Scene Geometry Under Shifting Views,视角变换下的机器人场景几何对齐),这是一个旨在将视角变化与任务学习解耦的观测预处理流水线。ARGUS 并不训练策略去处理任意视角,而是将观测结果归一化为规范视角(canonical viewpoint),然后再输入到下游的视觉运动策略中。该过程由三个主要阶段组成:
跨视角点云估计: 给定来自任意相机视角的 RGB 图像,ARGUS 利用大规模预训练的 3D 视觉模型(具体为 VGGT)来重建场景的 3D 点云。该模型以多视图图像作为输入,输出预测的点云及相应的外参。值得注意的是,初始重建是尺度模糊的,且是相对于其中一个输入相机帧定义的。