✨ 要点🔬 技术摘要
想象一下,一个拥有类人手的机器人手臂需要清理一个凌乱的房间,但它从未见过这个特定的房间,也没有人教过它如何做这项特定的工作。大多数机器人需要数小时的训练或数千个示例才能学习。这篇论文介绍了一个可以实现**零样本(zero-shot)**学习的系统——这意味着它只需通过观察和倾听,就能在运行过程中即时掌握,而无需任何先前的练习。
以下是该系统的运作方式,通过简单的概念进行了拆解:
1. “摄影师团队” vs. “单张快照”
大多数机器人通过一个摄像头观察场景,就像拍一张单照。如果你试图仅凭一张照片来猜测杯子的位置,你可能会猜对左右位置,但你不会确切知道它有多远。这就像你只睁一只眼在黑暗中接球;你可能会错过深度信息。
本论文的系统使用了多个摄像头 (就像站在房间不同角落的一组摄影师)。
问题: 每个摄像头看到的物体都不同。一个可能看到了勺子的柄;另一个可能看到了勺头。一个可能被书挡住了;另一个则看到了全貌。
解决方案: 系统使用一个“智能大脑”(视觉语言模型)向每个摄像头提问:“勺子在哪里?”以及“我应该在哪里抓取它?”
神奇之处: 它使用两种方法来结合这些不同的答案:
三角测量法(Triangulation): 就像你的双眼协同工作以判断距离一样,它通过数学计算出所有摄像头视角都达成一致的精确 3D 位置。
射线投票法(Ray Voting): 如果摄像头之间存在分歧(例如一个被遮挡了),系统会从主摄像头的视角射出一道“激光束”,并询问其他摄像头:“你们是否在这一特定深度看到了该物体?”它会选择获得最多票数的答案。这确保了机器人不会抓向虚空,也不会因为阴影而错过物体。
2. “说明书” vs. “肌肉记忆”
一旦机器人知道了物体在 3D 空间中的位置,它就需要知道如何移动。
对于拿起物品: 系统将大任务(“清理房间”)分解为微小、简单的步骤:“抓起杯子”、“移动到垃圾桶”、“放下它”。它将这些步骤视为像乐高积木一样的模块。
对于使用工具: 这是聪明之处。如果机器人需要使用扫帚或水壶,它不需要从头学习如何扫地。它的记忆中有一个**“原子动作包”(Bag of Atomic Actions)**。你可以把它想象成一个预录制的工具舞蹈库。
如果指令是“扫地”,机器人会在其库中找到“扫地”这个舞蹈动作。
然后,它将该舞蹈动作对齐 到当前的房间。如果扫帚在左边,垃圾在右边,它会将预录制的“扫地”动作进行拉伸和旋转,以适应特定的几何结构。
3. “安全检查”与“重试机制”
机器人经常失败,是因为它们尝试抓取东西时撞到了墙,或者试图把锅放在太高的炉灶上。
示能区域(Affordance Regions): 系统不仅仅是抓取一个点,而是确定物体上的“安全区域”。对于一个手柄,它知道整个手柄都是可以抓取的好地方,而不仅仅是一个像素点。
碰撞规避: 在移动之前,它会模拟路径,以确保机器人的手不会撞到桌子或墙壁。
闭环验证(Closed-Loop Verification): 这是机器人的“现实检查”。如果机器人尝试拿起杯子,但摄像头看到杯子并没有移动,系统不会只是盲目重复失败的动作。它会停止、重新评估场景,并重新规划 。这就像人类说:“哎呀,我没抓准,让我换个角度再试试,”而不是盲目重复错误。
结果
作者在真实房间里的真实机器人和灵巧手上测试了该系统。
更高的准确度: 与仅使用单个摄像头的机器人相比,它在寻找物体的精确 3D 位置方面表现得更出色。
零样本成功率: 虽然其他经过 30 个特定示例训练的高级机器人完全失败了,但该系统在从未针对这些特定任务进行过训练的情况下,成功完成了诸如“扔掉垃圾”、“把锅放在炉灶上”和“用扫帚扫地”等任务。
长程任务(Long-Horizon Tasks): 它能够将多个步骤串联起来(例如整理整个桌面),并在中间出错时进行恢复。
总结
这篇论文描述了一个表现得像聪明且适应力强的真人 一样的机器人。它不是通过死记硬背每一种可能的移动方式,而是利用一个智能大脑来理解语言和多角度的 3D 空间,从库中提取预设的“工具舞蹈”,并不断检查自己的工作以实时修正错误。它证明了,如果你给了机器人正确的推理工具,你就不需要为每一项工作都单独训练它。
技术摘要:通过多视图 3D 定位 VLM 推理实现零样本长程灵巧操纵
问题陈述
本文旨在解决如何使通用机器人系统能够根据高层语言指令执行**长程灵巧操纵(long-horizon dexterous manipulation)**的挑战。尽管近期的视觉-语言-动作(VLA)模型已取得进展,但它们通常需要大量的特定任务数据收集、微调或人类演示重定向,这限制了其在多样化物体、工具和空间配置下的可扩展性。此外,现有的零样本方法通常依赖于 2D 中间表示(如关键点、视觉标记),这对于操纵任务本质上的 3D 特性(例如确定接触点、放置目标和工具轨迹)而言是不够的。灵巧手中微小的 3D 定位误差会导致抓取不稳定、碰撞或错误的工具使用。作者主张采用一种将语义推理与物理执行解耦的模块化方法,并强调了将 2D VLM 预测转化为可靠 3D 量值以弥合语言与物理动作之间差距的关键需求。
方法论
所提出的框架是一个零样本系统 ,它将校准后的多视图 RGB 图像和语言指令转换为可执行的机械臂-灵巧手计划。该流水线由四个主要阶段组成:
1. 参考坐标系语义定位
视觉语言模型(VLM)Φ \Phi Φ 处理多视图图像和指令,以执行以下操作:
选择一个参考视图 r r r 。
推断操纵模式 z z z (即“拾取”或“工具使用”)。
预测特定模式的定位元组 g z g_z g z 。
对于拾取与放置 :识别目标物体及其 2D 目的地像素。
对于工具使用 :识别工具物体、技能类别(例如倾倒、清扫)、目标物体以及相关的 2D 关键点。
在参考视图上生成一系列原语序列 Q r Q_r Q r (例如抓取、执行动作、释放),并关联相应的 2D 关键点和语义描述。
2. 基于多视图融合的 3D 提升
为了将 2D 关键点转换为鲁棒的 3D 坐标,系统采用了双重策略融合方法来处理遮挡和深度歧义:
跨视图三角测量 :在所有视图中查询 VLM,以获取相同语义概念的 2D 定位。对视图对进行 RANSAC 式的三角测量,根据有多少个视图的重投影误差低于阈值来为候选点评分。
参考视图射线投票 :为了更牢固地锚定估计值,系统沿参考视图的相机射线采样深度候选点。这些候选点被投影到带有视觉标记的非参考视图中,由 VLM 选择与语义描述最匹配的索引。具有最高共识票数的候选点被选中。
动态选择 :最终的 3D 关键点基于几何共识进行选择。如果三角测量产生高置信度的内点,则使用该点;否则,系统回退到鲁棒的投票估计。
3. 以物体为中心的原子动作对齐(工具使用)
对于工具使用任务,系统利用了一个原子动作包(Bag of Atomic Actions) ,这是一个按技能类别索引的、预构建的以物体为中心的 6D 工具轨迹库。
一旦识别出技能类别,系统便检索相应的原子动作(轨迹 T T T )。
系统通过计算刚性变换将存储的轨迹对齐到当前场景,该变换将动作的存储起始/结束锚点映射到由 VLM 提升得到的 3D 关键点(执行动作点和终止关键点)。
这产生了一个与场景对齐的工具 6D 轨迹 T ^ \hat{T} T ^ 。
4. 灵巧性示教引导的抓取与运动生成
示教区域估计 :系统在各视图中查询 VLM,以预测围绕抓取关键点的 2D 可抓取边界框(示教区)。这些区域通过投影物体网格顶点并基于多视图包含得分进行过滤,从而提升至 3D。
抓取生成 :在 3D 示教区域内(针对把手使用圆柱体模板或基于优化的生成器)生成候选抓取。
碰撞感知精化 :通过在局部垂直网格中搜索最近的无碰撞位置,对放置或工具位姿的定位点进行精化。
执行 :使用现成的机械臂-灵巧手运动生成器解决运动学和碰撞约束,以产生可行的执行轨迹。
闭环验证 :对于长程任务,系统执行状态验证。如果某一步骤失败(例如抓取失败),VLM 会检测状态并触发特定子任务的重新规划或重新定位。
核心贡献
统一的零样本框架 :该系统将基于 VLM 的任务规划与多视图 3D 定位以及可复用的原子原语库相结合,实现了在未见物体和工具上的零样本执行,无需特定任务的训练。
多视图 VLM 定位 :提出了一种新颖的方法,通过结合跨视图三角测量与参考视图射线投票,将依赖视图的 2D 预测融合为可靠的 3D 量值,显著提高了在遮挡和部分可见情况下的鲁棒性。
灵巧执行扩展 :将多视图定位扩展到灵巧手,通过估计功能性 3D 示教区域,并基于轨迹级逆运动学和碰撞可行性过滤候选抓取。
长程能力 :通过闭环验证和动态重规划,展示了在复杂多步任务(如烹饪、整理)中的稳健零样本泛化能力。
实验结果
该系统在配备 xArm 和 Inspire 灵巧手的真实桌面设置上进行了评估,使用了多个校准后的 RGB 相机。
成功率 :该方法优于单视图 RGB-D 定位基线和两个经过微调的 VLA 基线(后者需要每个任务 30 次演示)。
在“丢弃垃圾”和“将锅放在炉灶上”任务中,所提方法分别达到了 5/5 和 4/5 的成功率,而基线模型的表现较低或为零。
在“杂乱精确拾取与放置”任务中,该方法达到了 4/5 成功率,对比 RGB-D 基线为 2/5。
微调后的 VLA 模型(GR00T, Being-HO)在零样本工具使用任务中完全失败(0/5),而所提系统在“清扫地面”任务中取得了 8/10 的成功。
3D 定位精度 :多视图融合将抓取定位误差(L g r a s p L_{grasp} L g r a s p )从 16.43 cm (RGB-D) 降低至约 4.6 cm。执行动作误差(L a p p l y L_{apply} L a ppl y )也显著降低。
碰撞鲁棒性 :碰撞感知精化步骤最小化了穿透深度误差。
长程任务 :系统成功完成了多步任务(如整理 3-4 个物体、烹饪),并通过闭环重试从中间失败(如关节极限、碰撞)中恢复。
重要性与声明
本文声称,相比于端到端策略学习,一种将 VLM 处理语义推理与原语控制器处理执行相结合的模块化设计,是通往通用操纵更高效的路径。作者强调,3D 定位 是实现灵巧操纵的关键缺失环节,而单视图推理无法满足这一需求。
这项工作的意义在于证明了:
现代 VLM 可以提供准确的任务分解和 2D 定位,且具备零样本能力。
通过将这些 2D 预测融合到多个视图中,系统可以恢复复杂操纵所需的可靠 3D 几何结构。
这种方法能够在无需大规模数据收集或微调的情况下,在未见物体和新环境中实现稳健执行,解决了当前 VLA 模型的扩展性限制。
作者承认了局限性,指出性能受限于底层 2D VLM 的推理可靠性,且物理执行依赖于现成的规划器,这可能会引入延迟或奇异点。他们并未声称解决了手内操纵(例如在手中旋转物体)的问题,而是专注于以物体为中心的操纵和工具使用。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。