这篇论文介绍了一种名为 CLASP 的新系统,它的核心目标是让机器人能更聪明、更稳定地在桌面上抓取各种物体(比如把玩具、工具或积木分类放好)。
为了让你更容易理解,我们可以把这篇论文里的技术难题和解决方案,想象成教一个“有点迷糊但很博学”的机器人管家干活的故事。
🤖 背景:为什么现在的机器人管家容易“翻车”?
现在的机器人虽然很聪明,能听懂人话(比如“把那个红色的杯子拿给我”),但在真正动手抓东西时,经常犯三个大错:
- “眼高手低” (缺乏高质量数据):就像学生只背了理论书,没怎么见过真实的杂乱桌面,导致一上手就懵。
- “脑补过度” (空间幻觉):这是最致命的。机器人虽然知道“杯子”是什么,但它可能脑补出杯子的把手在左边,实际上在右边。结果手伸过去,抓了个空,或者抓到了杯底,把杯子打翻。
- “一条道走到黑” (开环执行):现在的机器人像是一个“盲盒玩家”,一旦发出指令,它就不管结果了。如果第一次抓失败了,它不会回头检查,而是继续执行下一个动作,导致任务彻底失败。
💡 CLASP 的三大“独门秘籍”
为了解决这些问题,作者给机器人管家装上了三套新装备,我们叫它 CLASP 系统:
1. 双通道“透视眼” (Dual-Pathway Hierarchical Perception)
- 比喻:想象机器人有两个大脑在同时工作。
- 大脑 A (语义):负责“认人”。它看图片说:“哦,这是一个扳手,我要抓它的把手。”
- 大脑 B (几何):负责“量尺寸”。它不看名字,只看形状:“这个把手是圆的,距离边缘 2 厘米,角度是 45 度。”
- 作用:以前机器人只靠大脑 A,容易“想当然”。现在两个大脑配合,大脑 A 告诉大脑 B 抓哪里,大脑 B 负责确认具体的坐标和角度。这样就不会出现“想抓把手却抓了刀尖”的幻觉了。
2. “异步闭环裁判” (Asynchronous Closed-Loop Evaluator)
- 比喻:这就像是一个边干活边检查的“监工”。
- 传统的机器人是:下指令 -> 闭眼执行 -> 结束。
- CLASP 的机器人是:下指令 -> 执行 -> 监工立刻检查(“哎呀,刚才那个扳手没抓稳,滑了!”) -> 监工写个便条(“下次往左边移 2 厘米”) -> 机器人根据便条调整,再试一次。
- 关键点“异步”:这个“监工”检查的时候,机器人不需要停下来等。它一边在调整动作,一边在思考下一步,就像你一边开车一边听导航纠正路线,而不是车停在那儿等导航说话。这让效率大大提升。
3. “自动造梦工厂” (Scalable Multi-modal Data Engine)
- 比喻:以前教机器人,需要真人拿着遥控器(遥操作)一遍遍演示,累死人。
- CLASP 的做法:他们建了一个自动化的“造梦工厂”。这个工厂能自动生成成千上万张“虚拟桌面”的图片,甚至自动给这些图片打上“哪里该抓”的标签。
- 作用:机器人可以在这个虚拟工厂里“做梦”(训练),不用真人手把手教,就能学会在各种杂乱环境下怎么抓东西。这就解决了“数据太少”的问题。
🏆 效果怎么样?
作者把这套系统放在模拟器和真实的机器人手臂(WidowX)上进行了测试:
- 成绩:在抓取各种杂乱物体(特别是很难抓的工具,如锤子、剪刀、螺丝刀)的任务中,成功率达到了 87%。
- 对比:比目前最先进的大模型(如 Qwen3-VL)和其他抓取算法都要好。
- 真实场景:在真实的桌面上,当其他机器人因为抓错位置把扳手弄掉时,CLASP 能精准地抓住扳手的把手,稳稳地放好。
📝 一句话总结
这篇论文就是给机器人装上了一套**“双脑思考 + 实时纠错 + 自动自学”的系统,让它从一个“只会听指令但容易脑补出错”的笨拙新手,变成了一个“眼明手快、知错能改”的熟练工**,能在杂乱的桌面上精准地抓取各种奇怪形状的物体。
CLASP:面向开放词汇桌面物体抓取的非闭环空间感知技术总结
本文介绍了一种名为 CLASP (Closed-loop Asynchronous Spatial Perception) 的新型框架,旨在解决视觉语言模型(VLM)在机器人低层抓取任务中部署时面临的关键挑战。该框架通过结合多模态感知、逻辑推理和状态反馈,实现了在动态、非结构化桌面环境中的开放词汇物体抓取。
以下是该论文的详细技术总结:
1. 研究背景与核心问题
尽管视觉语言模型(VLM)在机器人操作方面展现出巨大潜力,但在实际部署到低层抓取任务(Low-level Grasping)时仍面临三大瓶颈:
- 高质量多模态演示数据稀缺:缺乏用于训练的高质量、细粒度的抓取数据。
- 空间幻觉(Spatial Hallucination):VLM 缺乏细粒度的几何 grounding(定位),导致生成的抓取点在空间上不准确(例如抓取到物体边缘或背景)。
- 开环执行的脆弱性:在动态环境中,传统的开环执行缺乏纠错机制,一旦初始抓取失败,任务即告终止。
2. 方法论 (Methodology)
CLASP 框架设计了一个异步闭环系统,包含三个核心模块:双通路分层感知、VLM 驱动的推理以及异步闭环评估器。
A. 双通路分层感知 (Dual-Pathway Hierarchical Perception)
为了解决语义意图与几何定位的耦合问题,该模块将感知解耦为两个路径:
- 语义通路:直接处理 RGB 图像,生成全局语义嵌入,用于理解物体类别和任务意图。
- 几何感知通路:结合开放词汇检测(Open-vocabulary Detection)、分割(Segmentation)和几何特征提取,生成明确的姿态和质心描述符。
- 作用:这种设计引导推理模型输出结构化的动作元组(如 2D 接触点、角度),显著减少了空间幻觉,实现了确定性控制。
B. VLM 驱动的结构化抓取推理
- 利用微调后的 VLM 作为推理核心,输入多模态数据(图像、深度、语义框)和自然语言指令。
- 输出标准化的 JSON 格式,包含精确的抓取参数(抓取角度、中心点、物体类别)。
- 通过确定性解析和空间/碰撞约束谓词,确保输出符合物理可行性。
C. 异步闭环评估器 (Asynchronous Closed-Loop Evaluator)
这是 CLASP 区别于传统开环系统的关键:
- 状态对比:在动作执行前后,系统对比环境状态。
- Judger 模块:如果任务失败(如未抓取到或放置错误),Judger 模块会生成基于文本的诊断反馈(例如:“抓取点偏离中心”)。
- 启发式调整:结合启发式算法(如将抓取点向物体中心移动),将反馈重新输入推理模块,形成误差修正闭环。
- 异步执行:感知、推理和执行线程解耦,允许在执行过程中并行进行状态评估,减少阻塞开销。
D. 可扩展的多模态数据引擎
- 构建了一个自动化的数据生成管道,无需人工遥操作。
- 从真实和合成场景(Synthetic Scenes)中自动合成高质量的抓取姿态、掩码和推理模板,解决了数据稀缺问题。
3. 主要贡献 (Key Contributions)
- 双通路分层感知方法:成功将高层语义意图与细粒度几何定位解耦,通过输出结构化动作元组,有效缓解了基于 VLM 的机器人抓取中的空间幻觉问题。
- 异步闭环评估器:设计了一个包含 Judger 模块的评估机制,通过比较执行前后的状态并生成文本诊断反馈,建立了鲁棒的纠错机制,显著提高了动态环境下的任务成功率。
- 可扩展多模态数据引擎:开发了自动化管道,能够合成高质量的演示数据(视觉提示、掩码、抓取姿态),无需人工干预,降低了数据收集成本。
4. 实验结果 (Experimental Results)
实验在 ManiSkill 仿真环境和真实的 WidowX 250S 6-DoF 机械臂上进行,任务包括在杂乱场景中抓取并分类物体(玩具、工具、积木)。
- 总体成功率:CLASP 在综合测试中达到了 87.0% 的总体成功率,显著优于现有基线模型。
- 基线对比:
- 相比 Qwen3-VL (72.27%)、Doubao-Seed (68.67%) 和 AnyGrasp (56.53%),CLASP 表现最佳。
- 在最具挑战性的**工具类(Tools)**物体(如锤子、剪刀、螺丝刀)上,CLASP 取得了 77.0% 的成功率,远超其他方法(Qwen3-VL 为 46.4%),证明了其在处理复杂几何形状时的优势。
- 组件有效性:消融实验表明,完整的流水线(感知 + 推理 + 启发式 + 评估器)性能最优。仅增加评估器(Judger)和启发式模块(Heuristic)能显著提升鲁棒性。
- 延迟与效率:
- 相比流式(Streaming)执行策略,CLASP 的异步策略将总执行时间减少了 39.8%,平均任务完成时间减少了 39.9%。
- 执行时间方差降低了 59.5%,表明系统运行更加稳定。
- 真实世界验证:在真实机器人上,CLASP 能够准确选择扳手等工具的最佳抓取点,而基线方法常出现抓取点错误、无法生成结果或抓取边缘等失败情况。
5. 意义与展望 (Significance)
- 填补语义与几何的鸿沟:CLASP 有效地桥接了 VLM 的语义理解能力与机器人所需的精确几何控制,解决了 VLM 在低层控制中“懂意思但抓不准”的痛点。
- 提升鲁棒性:通过引入闭环反馈机制,系统具备了在动态和杂乱环境中的自我纠错能力,不再依赖完美的单次执行。
- 数据驱动的创新:提出的自动化数据引擎为未来机器人学习提供了低成本、高质量的数据解决方案,有助于解决长尾物体和特定场景的数据匮乏问题。
- 实际应用潜力:该框架在零售、办公和家庭服务等非结构化场景中具有极高的应用价值,能够安全、高效地处理多样化的桌面物体整理任务。
综上所述,CLASP 通过架构创新和闭环反馈机制,显著提升了开放词汇机器人抓取任务的可靠性、准确性和效率,为 VLM 在物理世界的落地应用提供了重要的技术路径。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。