See like a Robot: Robot-Centric Pointmaps for Vision-Language-Action Models
本文引入了以机器人为中心的点图(robot-centric pointmaps),这是一种在保留预训练视觉-语言-动作模型所需的二维网格结构的同时,将3D场景几何编码在机器人坐标系中的表示方法,从而解决了坐标系不匹配的问题,并显著提升了在模拟和真实机器人实验中跨多样化摄像机视角的泛化能力。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人做三明治。你想让机器人抓起面包并把它放在盘子上。但这里有个棘手的问题:机器人的“大脑”(决定手臂如何移动的部分)说的是一种语言,而它的“眼睛”说的又是另一种。
机器人的手臂是在基于自身身体的地图(我们称之为机器人地图)上移动的。“向前移动10厘米”对手臂来说有着非常具体的含义。但机器人的眼睛通过摄像头观察世界,而摄像头有自己的地图(相机地图)。如果摄像头安装在机器人的手腕上,它看到的景象与摄像头安装在房间另一侧的架子上时完全不同。
长期以来,机器人大脑一直试图通过观察相机地图来猜测如何在机器人地图上移动手臂。如果相机不动,这套方法运行良好。但如果用来自50个不同相机角度的视频来训练机器人呢?机器人会感到困惑。它必须记忆一百万种不同的方式,将“相机看到了什么”转化为“手臂要做什么”。这就像每当你转动一下头,就要学习一种新语言一样。
“以机器人为中心”的解决方案:一种新型照片
论文的作者提出了一个聪明的解决方法:停止要求机器人进行翻译。从一开始就用正确的语言直接给它答案。
他们创建了一种特殊类型的图像,叫做以机器人为中心的点图(Robot-Centric Pointmap)。
把普通照片想象成一个由彩色像素组成的网格。现在,想象一张照片,其中每个像素不仅存储颜色(红、绿、蓝),还存储了一个秘密代码:它在机器人地图上的精确 3D 位置。
- 普通照片: “这个像素是一个红苹果。”
- 点图: “这个像素是一个红苹果,位于相对于机器人手臂的坐标 (X, Y, Z) 处。”
神奇之处在于,这个点图在机器人的大脑看来与普通照片完全一样。它保持了机器人已经习惯处理的相同网格形状(高度 × 宽度)。机器人不需要学习新的观察方式;它只是得到了一个已经知道物体在自身空间中位置的“超级照片”。
他们尝试了什么(以及他们拒绝了什么)
研究人员并没有凭空猜测;他们测试了向机器人提供 3D 信息的不同方式。以下是他们的发现:
- 不要只给机器人提供相机的参数: 有人可能会想,“我们只要告诉机器人‘相机倾斜了30度’,让它自己去搞定剩下的部分就好了。” 论文表明这是一个很弱的策略。这就像给某人一张地图和一个指南针,却期望他们能自己画出路线。机器人处理这种方式时比使用点图更加吃力。
- 不要丢弃照片网格: 另一种想法是将 3D 世界转化为“点云”(散落的点云)。论文认为对于这些特定的机器人来说,这是一个坏主意。这就像把一张高分辨率照片变成一张由 4000 个点组成的低分辨率素描。机器人会丢失它所需的精细细节,并且必须学习一种全新的方式来处理这些点云。点图保留了高分辨率网格,而这正是机器人大脑所热爱的。
- 将地图中心设在手上,而不是地板上: 在创建点图时,你必须选择一个“中心点”。坐标应该是基于机器人的底座(它的脚部)测量,还是基于它的手(夹持器)测量?论文发现,基于手部进行测量效果要好得多。
- 类比: 如果你伸手去拿一个杯子,杯子相对于你脚的位置会随着你在厨房里的走动而改变。但杯子相对于你的手的位置,在抓取前的瞬间始终是恒定的。通过将地图中心设在手上,无论杯子在房间的哪个位置,机器人看到的“抓取形状”都是一样的。
结果:这真的有效吗?
团队在两个地方测试了这个想法:一个名为 RoboCasa 的计算机模拟环境,以及实验室中的一个真实机器人手臂。
在模拟器中 (RoboCasa):
他们针对 24 种不同的任务训练了机器人,比如开门或拿起咖啡杯。
- 没有点图,标准机器人模型(称为 π0.5)的成功率为 55.3%。
- 使用点图后,这个数字跃升至 62.9%。
- 他们还测试了一个较小的模型 (SmolVLA),该模型从 37.2% 提升到了 41.4%。
- 点图击败了其他尝试以不同方式添加 3D 数据的花哨方法。
在现实世界中 (Franka 机器人):
这是最酷的部分。他们用三个不同位置的摄像头训练了机器人。然后,他们在机器人从未见过的第四个位置对其进行了测试。
- “已知”测试: 当相机处于机器人熟悉的某个位置时,点图帮助机器人的成功率比标准版本高出 5.0%。
- “未知”测试: 当相机被移动到一个全新的位置时,标准机器人的表现大幅下滑(从 73.3% 降至 55.0%)。但点图机器人表现强劲,仅轻微下降。
- 结果: 当相机移动到新位置时,点图的优势从 5.0% 扩大到了巨大的 11.7%。
核心结论
这篇论文表明,如果你想让机器人在 3D 世界中完成手臂移动的任务,尤其是当它需要从许多不同的相机角度学习时,你不应该让它去猜测几何结构。相反,给它一张“超级照片”(点图),这张照片已经将世界翻译成了机器人自己的语言。
这是一个简单的技巧:不要让机器人去做“我在哪里?”的数学计算。给它一张已经标明“你在哪里,物体在那里”的地图。 这使得机器人能够专注于任务本身——比如抓起杯子——而不是担心相机站在哪里。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。