← 最新论文
💻 computer science

SWIM: Vision-Language-Grounded Soft Whole-Body Interactive Manipulation

SWIM 是一个视觉-语言驱动的框架,它通过将基于扩散模型的视觉-语言-动作(VLA)策略与视觉软本体感知相结合,生成能够利用固有顺应性实现鲁棒物理执行的可执行驱动序列,从而使软连续体机器人能够执行复杂的全身交互式操控任务。

原作者: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

发布于 2026-09-16
📖 1 分钟阅读☕ 轻松阅读

原作者: Tingcong Liu, Aye Phyu Phyu Aung, Junjie Xiong, Siyi Ma, Bo An, Ke Wu, Senthilnath Jayavelu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在机器人领域,存在着一种明显的划分:一类是利用坚硬金属框架制造的机器,另一类则是用柔软、灵活材料打造的机器。刚性机器人(如汽车工厂中看到的机械臂)能够以精确且预设好的确定性进行运动,但当它们需要挤进狭窄空间或处理易碎且形状不规则的物体而不将其压碎时,就会显得力不从心。相比之下,软体机器人由具有顺应性的材料制成,可以像生物组织一样弯曲、拉伸和扭转。这种灵活性使它们能够包裹住物体,并根据周围环境调整形状,为在受限空间内执行任务或与人类安全交互提供了潜在的解决方案。然而,这种灵活性本身也带来了一个新问题:控制一个可以发生无数种形变的身体是极其困难的。当人类给出一个简单的指令,如“把那个拿起来”时,刚性机器人可以计算出一条移动其手部的单一路径。而对于一个全身都能改变形状的软体机器人来说,它必须弄清楚如何扭转其整个形态来实现同样的目标,这项任务不仅需要理解目标物体,还需要实时理解机器人自身复杂的几何结构。

研究人员最近开发了一种名为 SWIM 的新系统来解决这一特定挑战,旨在教会软体机器人通过理解语言和视觉场景来进行全身操控。该团队的研究重点是一个由线缆驱动的螺旋形机器人,其原理类似于肌肉拉动骨骼,这使得机器人能够进行卷曲、触达并包裹物体。他们解决的核心难点在于,以往的方法通常试图仅通过关注机械臂末端来控制这些机器人,而忽略了身体其余部分的复杂形状。这种方法之所以失败,是因为仅靠末端的位置无法完整描述机器人其余部分的弯曲程度,也无法描述它与世界的接触状态。为了解决这个问题,研究人员创建了一个学习系统,该系统能同时观察机器人的整个身体形状、视觉场景以及语音指令。他们在模拟环境中训练该系统,让机器人可以在其中进行数千次的练习,学习预测能够实现目标的线缆运动序列,例如将物体收纳起来、伸手触达目标或抓取物体。

他们方法中的一项关键创新是一种被称为“视觉软本体感觉”(visual soft proprioception)的技术。简单来说,这意味着机器人学会了通过摄像头图像来“看见”自己的身体形状,从而补充其内部关于线缆张力的感知知识。在训练期间,系统使用当前的腱长向量作为本体感觉输入来理解其构型,同时也会被展示模拟器中机器人身体上若干个点的精确坐标。通过强制计算机模型预测这些点的位置,系统学会了在脑中建立一张关于自身几何结构的地图。这使其能够理解,为了触及某个特定物体,机器人可能需要以不同于“收纳物品”时的弯曲方式来调整其中部截面。此外,该系统并没有尝试去预测通往目标的单一、完美的路径,而是学会了预测一系列可能的成功运动。这一点至关重要,因为对于软体结构而言,通常存在许多种不同的包裹物体的方式,系统需要具备足够的灵活性来选择任何一个有效的选项,而不是困于某一个僵化的计划。

研究人员通过两种方式测试了这一方法:首先是在计算机模拟中,然后在实际的物理机器人上。在模拟中,该系统的表现非常出色,完成收纳任务的成功率达 100%,触达目标的成功率达 96%,抓取物体的成功率达 88%。这些结果明显优于那些未使用身体形状感知或缺乏灵活预测模型的其他方法。然而,真正的考验出现在他们将系统转移到现实世界时。当他们尝试直接在物理机器上运行机器人的“大脑”,并将其连接到摄像头和电机进行实时操作时,性能大幅下降。机器人在抓取物体时失败率高达 75%,这主要是由于处理过程中的微小延迟以及模拟环境与现实世界之间的差异,导致机器人是在基于过时信息进行动作。

为了克服这一问题,研究人员引入了一种巧妙的部署策略。他们不再要求机器人在移动时进行实时思考和反应,而是让它先在虚拟模拟中规划好整个运动序列。机器人观察现实世界,创建一个场景的数字孪生体,然后在脑海中演练整个任务,生成一份完整的指令列表。一旦这套完整的序列准备就绪,机器人便会执行动作,期间不再停下来观察或思考。由于机器人的身体本质上是柔软且具有弹性的,它可以自行处理细小的碰撞和接触变化,而无需计算机进行持续修正。当他们使用这种“先规划后执行”的方法时,物理机器人的成功率大幅回升:收纳任务达到 100%,触达目标达到 80%,抓取物体达到 75%。这表明,通过结合对自身形状的深度理解以及利用其天然物理灵活性的策略,软体机器人可以被简单的语言引导,从而完成以往难以实现的复杂全身任务。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →