想象一下,你正在教机械臂从杂乱的桌子上拿起一把特定的叉子,并将其放入一个特定的碗中。
问题:“哪把叉子?”的困惑
通常,我们使用“拿起叉子”这样的词语,或者通过给出任务代码编号来告诉机器人该做什么。但在一个有五把相同叉子和三个碗的杂乱厨房里,说“那把叉子”会让人困惑。机器人不知道你说的是哪把叉子,也不知道你想把它放进哪个碗。这就像在拥有百万藏书的图书馆里告诉朋友“拿那本书”一样;他们需要确切知道是哪一本。
解决方案:用手指指向
本文介绍了一种与机器人交流的新方法:空间提示(Spatial Prompting)。与其使用语言,你只需在视频的第一帧上,直接指向你想要移动的物体以及你想要它去的位置。这就像在机器人开始移动之前,在照片上围绕叉子画一个小框,再围绕碗画一个框。
新挑战:SP-VTP
作者将这一新挑战称为 SP-VTP(空间提示视觉轨迹预测)。
- 设置:你向机器人提供带有你的点/框(即提示)的场景“快照”。
- 任务:随后,机器人从其自身视角(第一人称视角)观看场景视频,并必须预测其机械手(末端执行器)为完成任务所要走过的完整路径。
- 转折:机器人必须在摄像头移动、机械手遮挡视线以及物体发生位移的同时,找出路径。这就像在音乐变化、舞台旋转的同时,试图猜出舞蹈套路。
数据集:EgoSPT(训练场)
为了教会机器人这项技能,研究人员构建了一个名为 EgoSPT 的新数据集。
- 他们使用了一种特殊的手持设备(经过修改的“通用操作接口”),它像机械手一样运作,但由人类控制。
- 他们录制了数千段视频,内容是人们拿起叉子并将其放入杯子、碗和盘子中。
- 至关重要的是,他们在每段视频的第一帧添加了“指向”标注(即框),从而为这种“指并预测”的游戏创造了完美的练习场地。
机器人大脑:SPOT
他们创建了一种新的机器人策略(即机器人的大脑),名为 SPOT(空间提示对象 - 目标策略)。可以将 SPOT 想象为一个由三部分组成的团队:
- 任务读取器:查看第一帧,读取你的“指向”框,并理解目标。它利用强大的视觉 AI(DINOv2)来识别场景。
- 观察者:观看当前的视频流,并记住机器人最近做出的几个动作(就像记住舞蹈的最后几步)。
- 预测器:结合来自任务读取器的目标(Goal)和来自观察者的当前状况(Situation),绘制出机械手未来应采取的路径。
测试方法
他们不仅在一个完美的房间里测试机器人,还在三个不同的“世界”中进行了测试:
- 场景 1:一张干净、整洁的桌子。
- 场景 2:一张杂乱、堆满物品的桌子,额外的物品会分散机器人的注意力。
- 场景 3:各种杂乱桌子的混合体。
他们发现,当机器人获得“指向”框(空间提示)时,其在预测正确路径方面的表现,远优于仅根据语言或完全没有指令进行猜测的情况。将“看到”图像上绘制的框与“读取”框的坐标相结合,效果最佳。
结论
本文证明,如果你希望机器人处理涉及外观相似物体的杂乱任务,指向比说话更有效。通过在首帧提供一个简单的视觉地图,指明“从这里开始,去那里”,机器人就能成功预测完成工作所需的复杂动作,即使周围场景在不断变化。
技术摘要:用于第一人称操作的空间提示视觉轨迹预测
问题定义:空间提示视觉轨迹预测 (SP-VTP)
当前的机器人操作策略通常依赖语言指令或离散任务标识符来指定目标。然而,在包含视觉相似物体的杂乱环境中,语言描述(例如,“拿起叉子”)或任务 ID 可能具有歧义,或无法识别特定的实例或放置区域。作者认为,在此类场景中,目标规范在本质上是空间性的,然后才是语言性的:“拿起这个物体并将其放置到那里。”
为此,本文形式化了一个名为空间提示视觉轨迹预测 (SP-VTP) 的新设定。在该框架中:
- 输入: 模型接收带有静态空间提示(点或边界框)的第一帧第一人称图像,指示目标物体和目标放置区域。
- 任务: 模型必须基于流式第一人称观测预测未来的末端执行器 (EE) 轨迹。
- 输出: 与输出掩码或框的视觉定位或跟踪不同,输出是一系列相对 6D 末端执行器运动和夹爪状态。
- 挑战: 该问题结合了四种不同的难点:
- 静态任务规范: 物体和目标仅在第一帧中定义。
- 动态执行: 相机移动,末端执行器遮挡场景,物体在抓取后发生位移。
- 实例消歧: 杂乱环境和同类干扰项需要持续的实例级跟踪。
- 相位依赖运动: 相同的物体 - 目标对在执行的各个阶段可能需要不同的运动。
方法论
数据集:EgoSPT
为了研究 SP-VTP,作者引入了EgoSPT,这是一个包含第一人称空间提示操作轨迹的数据集。
- 采集: 数据使用改装的通用操作接口 (UMI) 采集,配备 GoPro(170° 鱼眼镜头)用于第一人称视频,以及 iPhone 用于通过视觉惯性 SLAM 进行 6 自由度末端执行器轨迹跟踪。
- 内容: 该数据集包含 2,841 个抓取 - 放置片段,涉及五个视觉相似的叉子和九个目标(盘子、碗、杯子)。
- 结构: 数据集按难度递增组织为三个场景:
- 场景 1: 结构化布局(清洁条件)。
- 场景 2: 杂乱布局(干扰项和空间歧义)。
- 场景 3: 随机杂乱的子场景,每种配置的演示稀疏。
- 标注: 每个片段包含第一帧物体和目标定位标注(边界框)以及恢复的 3D 末端执行器轨迹。
模型:SPOT(空间提示物体 - 目标策略)
作者提出了SPOT,这是一种旨在融合空间提示与视觉观测以生成未来轨迹片段的策略。该架构由三个主要模块组成:
任务编码器:
- 处理第一帧 (I0) 和空间提示(物体 pobj 和目标 ptgt)。
- 双重提示表示: 提示以两种互补方式编码:
- 视觉: 将边界框渲染到第一帧上。
- 坐标: 将框坐标使用傅里叶位置特征和 MLP 编码为空间令牌。
- 融合: 冻结的 DINOv2 ViT-B/14 骨干网络提取图像令牌。提示令牌(嵌入角色)通过交叉注意力查询这些视觉令牌,以提取与任务相关的证据,将全局场景上下文与特定的物体/目标信息融合。
观测编码器:
- 使用相同的冻结视觉骨干网络编码当前第一人称帧 (It),以确保与任务编码器共享视觉空间。
- 通过轻量级 MLP 和时间位置嵌入整合最近的轨迹历史 (ht)。
- 连接当前视觉令牌和历史令牌以形成执行上下文。
轨迹生成器:
- 将连接的任务和观测令牌作为条件输入。
- 预测未来轨迹片段 (At∈RH×10),表示相对平移、6D 旋转和夹爪宽度。
- 目标: 默认实现使用流匹配 (Flow Matching) 来预测轨迹的速度场,但也支持扩散头。模型被训练以去噪插值的轨迹令牌。
评估协议
本文强调场景感知划分以防止数据泄露和对泛化能力的过高估计。同一场景单元的所有片段都保留在单个分区(训练或验证)内。评估指标包括最终位移误差 (FDE)、位置 L2、旋转 L2 和夹爪宽度 L1。
主要结果
提示基线
比较不同提示模态(无提示、点、边界框、视觉、边界框 + 视觉)的实验表明,空间提示显著优于无提示基线。
- 视觉提示(渲染的框)和坐标提示(框令牌)的组合产生了最佳的整体结果,将 FDE 从 0.1739(无提示)降低至 0.1147。
- 仅视觉提示对旋转精度特别有效,而坐标提示提供了明确的几何信息,有利于杂乱场景中的平移。
消融研究
- 视觉编码器: DINOv2-Base 在其他基础模型(SigLIP、SAM、EVA2、PE)中表现更优,特别是在端点和平移精度方面,尤其是在杂乱场景(场景 2 和 3)中。
- 冻结与未冻结: 保持视觉骨干网络冻结比微调它产生更好的泛化能力,这表明将骨干网络适应有限的任务分布会导致过拟合。
- 轨迹头: 流匹配头在所有指标上始终优于扩散头。
- 历史视界: 适中的历史视界 (K=4) 提供了最佳平衡,提供了足够的运动上下文而不引入过时的观测。
定性性能
可视化显示,SPOT 成功地从静态提示和当前观测中推断出正确的局部运动阶段。虽然长视界拼接会累积局部漂移(误差累积),但该模型保留了操作轨迹的粗略几何结构,包括接近和返回运动。
意义与主张
本文主张确立SP-VTP为一种新的、简单的且可扩展的第一人称操作任务条件。其主要贡献是:
- 形式化: 定义了第一个将第一人称操作框架化为以视觉为中心、空间提示的轨迹预测的设定,区别于语言条件规划或标准跟踪。
- 数据集: 引入了 EgoSPT,提供了研究该问题所需的定位标注和 3D 运动恢复。
- 策略: 提出了 SPOT,证明了将渲染和坐标空间提示与视觉历史融合,可以有效预测新颖场景配置中的未来轨迹。
- 评估: 建立了场景感知评估协议,测试真正的跨场景泛化能力,而非布局记忆。
作者将空间提示定位为在杂乱环境中指定操作目标的直接、低歧义接口,为视觉上下文至关重要的情况提供了基于语言指令的实用替代方案。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。