← 最新论文
💻 computer science

CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping

本文提出了名为 CLASP 的闭环异步空间感知框架,通过双通路分层感知解耦语义与几何、异步闭环评估实现状态反馈纠错,以及自动化多模态数据引擎生成高质量标注,有效解决了开放词汇桌面物体抓取中的空间幻觉与开环脆弱性问题,在复杂场景下实现了 87.0% 的高成功率。

原作者: Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

发布于 2026-04-15
📖 1 分钟阅读☕ 轻松阅读

原作者: Yiran Ling, Wenxuan Li, Siying Dong, Yize Zhang, Xiaoyao Huang, Jing Jiang, Ruonan Li, Jie Liu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这篇论文介绍了一种名为 CLASP 的新系统,它的核心目标是让机器人能更聪明、更稳定地在桌面上抓取各种物体(比如把玩具、工具或积木分类放好)。

为了让你更容易理解,我们可以把这篇论文里的技术难题和解决方案,想象成教一个“有点迷糊但很博学”的机器人管家干活的故事。

🤖 背景:为什么现在的机器人管家容易“翻车”?

现在的机器人虽然很聪明,能听懂人话(比如“把那个红色的杯子拿给我”),但在真正动手抓东西时,经常犯三个大错:

  1. “眼高手低” (缺乏高质量数据):就像学生只背了理论书,没怎么见过真实的杂乱桌面,导致一上手就懵。
  2. “脑补过度” (空间幻觉):这是最致命的。机器人虽然知道“杯子”是什么,但它可能脑补出杯子的把手在左边,实际上在右边。结果手伸过去,抓了个空,或者抓到了杯底,把杯子打翻。
  3. “一条道走到黑” (开环执行):现在的机器人像是一个“盲盒玩家”,一旦发出指令,它就不管结果了。如果第一次抓失败了,它不会回头检查,而是继续执行下一个动作,导致任务彻底失败。

💡 CLASP 的三大“独门秘籍”

为了解决这些问题,作者给机器人管家装上了三套新装备,我们叫它 CLASP 系统:

1. 双通道“透视眼” (Dual-Pathway Hierarchical Perception)

  • 比喻:想象机器人有两个大脑在同时工作。
    • 大脑 A (语义):负责“认人”。它看图片说:“哦,这是一个扳手,我要抓它的把手。”
    • 大脑 B (几何):负责“量尺寸”。它不看名字,只看形状:“这个把手是圆的,距离边缘 2 厘米,角度是 45 度。”
  • 作用:以前机器人只靠大脑 A,容易“想当然”。现在两个大脑配合,大脑 A 告诉大脑 B 抓哪里,大脑 B 负责确认具体的坐标和角度。这样就不会出现“想抓把手却抓了刀尖”的幻觉了。

2. “异步闭环裁判” (Asynchronous Closed-Loop Evaluator)

  • 比喻:这就像是一个边干活边检查的“监工”。
    • 传统的机器人是:下指令 -> 闭眼执行 -> 结束。
    • CLASP 的机器人是:下指令 -> 执行 -> 监工立刻检查(“哎呀,刚才那个扳手没抓稳,滑了!”) -> 监工写个便条(“下次往左边移 2 厘米”) -> 机器人根据便条调整,再试一次。
  • 关键点“异步”:这个“监工”检查的时候,机器人不需要停下来等。它一边在调整动作,一边在思考下一步,就像你一边开车一边听导航纠正路线,而不是车停在那儿等导航说话。这让效率大大提升。

3. “自动造梦工厂” (Scalable Multi-modal Data Engine)

  • 比喻:以前教机器人,需要真人拿着遥控器(遥操作)一遍遍演示,累死人。
  • CLASP 的做法:他们建了一个自动化的“造梦工厂”。这个工厂能自动生成成千上万张“虚拟桌面”的图片,甚至自动给这些图片打上“哪里该抓”的标签。
  • 作用:机器人可以在这个虚拟工厂里“做梦”(训练),不用真人手把手教,就能学会在各种杂乱环境下怎么抓东西。这就解决了“数据太少”的问题。

🏆 效果怎么样?

作者把这套系统放在模拟器和真实的机器人手臂(WidowX)上进行了测试:

  • 成绩:在抓取各种杂乱物体(特别是很难抓的工具,如锤子、剪刀、螺丝刀)的任务中,成功率达到了 87%。
  • 对比:比目前最先进的大模型(如 Qwen3-VL)和其他抓取算法都要好。
  • 真实场景:在真实的桌面上,当其他机器人因为抓错位置把扳手弄掉时,CLASP 能精准地抓住扳手的把手,稳稳地放好。

📝 一句话总结

这篇论文就是给机器人装上了一套**“双脑思考 + 实时纠错 + 自动自学”的系统,让它从一个“只会听指令但容易脑补出错”的笨拙新手,变成了一个“眼明手快、知错能改”的熟练工**,能在杂乱的桌面上精准地抓取各种奇怪形状的物体。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →