← 最新论文
💻 computer science

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

本文针对第一人称操作引入了空间提示视觉轨迹预测(SP-VTP)这一新任务,并依托全新的 EgoSPT 数据集与 SPOT 模型,该模型利用初始空间提示来预测动态杂乱环境中的未来末端执行器轨迹。

原作者: Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

发布于 2026-05-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教机械臂从杂乱的桌子上拿起一把特定的叉子,并将其放入一个特定的碗中。

问题:“哪把叉子?”的困惑
通常,我们使用“拿起叉子”这样的词语,或者通过给出任务代码编号来告诉机器人该做什么。但在一个有五把相同叉子和三个碗的杂乱厨房里,说“那把叉子”会让人困惑。机器人不知道你说的是哪把叉子,也不知道你想把它放进哪个碗。这就像在拥有百万藏书的图书馆里告诉朋友“拿那本书”一样;他们需要确切知道是哪一本。

解决方案:用手指指向
本文介绍了一种与机器人交流的新方法:空间提示(Spatial Prompting)。与其使用语言,你只需在视频的第一帧上,直接指向你想要移动的物体以及你想要它去的位置。这就像在机器人开始移动之前,在照片上围绕叉子画一个小框,再围绕碗画一个框。

新挑战:SP-VTP
作者将这一新挑战称为 SP-VTP(空间提示视觉轨迹预测)。

  • 设置:你向机器人提供带有你的点/框(即提示)的场景“快照”。
  • 任务:随后,机器人从其自身视角(第一人称视角)观看场景视频,并必须预测其机械手(末端执行器)为完成任务所要走过的完整路径。
  • 转折:机器人必须在摄像头移动、机械手遮挡视线以及物体发生位移的同时,找出路径。这就像在音乐变化、舞台旋转的同时,试图猜出舞蹈套路。

数据集:EgoSPT(训练场)
为了教会机器人这项技能,研究人员构建了一个名为 EgoSPT 的新数据集。

  • 他们使用了一种特殊的手持设备(经过修改的“通用操作接口”),它像机械手一样运作,但由人类控制。
  • 他们录制了数千段视频,内容是人们拿起叉子并将其放入杯子、碗和盘子中。
  • 至关重要的是,他们在每段视频的第一帧添加了“指向”标注(即框),从而为这种“指并预测”的游戏创造了完美的练习场地。

机器人大脑:SPOT
他们创建了一种新的机器人策略(即机器人的大脑),名为 SPOT(空间提示对象 - 目标策略)。可以将 SPOT 想象为一个由三部分组成的团队:

  1. 任务读取器:查看第一帧,读取你的“指向”框,并理解目标。它利用强大的视觉 AI(DINOv2)来识别场景。
  2. 观察者:观看当前的视频流,并记住机器人最近做出的几个动作(就像记住舞蹈的最后几步)。
  3. 预测器:结合来自任务读取器的目标(Goal)和来自观察者的当前状况(Situation),绘制出机械手未来应采取的路径。

测试方法
他们不仅在一个完美的房间里测试机器人,还在三个不同的“世界”中进行了测试:

  1. 场景 1:一张干净、整洁的桌子。
  2. 场景 2:一张杂乱、堆满物品的桌子,额外的物品会分散机器人的注意力。
  3. 场景 3:各种杂乱桌子的混合体。

他们发现,当机器人获得“指向”框(空间提示)时,其在预测正确路径方面的表现,远优于仅根据语言或完全没有指令进行猜测的情况。将“看到”图像上绘制的框与“读取”框的坐标相结合,效果最佳。

结论
本文证明,如果你希望机器人处理涉及外观相似物体的杂乱任务,指向比说话更有效。通过在首帧提供一个简单的视觉地图,指明“从这里开始,去那里”,机器人就能成功预测完成工作所需的复杂动作,即使周围场景在不断变化。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →