DeCAL: Towards Physically-Grounded Dexterous Vision-Language-Action Models via Contact-Aware Latent Co-Imagination
DeCAL 是一个具有物理属性的灵巧视觉-语言-动作模型,它利用具有自适应视触融合与潜在共想象功能的混合 Transformer 架构,通过动态集成触觉感知并对物理动力学进行建模,在富接触操作任务中实现了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是工厂车间的专家,能够沿着可预测的路径精准地移动重物。然而,当我们要求它们进入我们的家庭,执行日常生活中那些细腻且繁琐的任务时——比如拧入一个灯泡、擦拭一个花瓶或拧开一个瓶盖——它们往往会出错。世界并非一个干净、静态的网格;它是一个充满持续、微妙摩擦的地方。要取得成功,机器不仅要能“看”,还必须能“感觉”。它需要理解接触中那些无形的物理特性:手指滑脱的瞬间、转动旋钮所需的压力,或是柔软物体在触摸下发生形变的方式。几十年来,科学家们一直试图通过赋予机器人眼睛和皮肤来弥补这一差距,但教导机器将这些感官结合成一种单一、流动的直觉,仍然是人工智能领域中最顽固的挑战之一。
现在,一支研究团队通过一个名为 DeCAL 的新系统取得了重大进展。这不仅仅是一个能看、能触的机器人;这是一个旨在“想象”物理交互发生前的未来状态的系统。通过构建一个统一了理解、想象与行动的模型,研究人员创造了一种机器人策略,使其能够以一种前所未见的灵巧程度,应对人类操作中复杂且充满接触的任务。该系统在六项不同的任务上进行了测试,从擦拭花瓶到组装小零件,其表现始终优于现有的最先进方法。在这些现实世界的试验中,DeCAL 在较简单的任务上实现了高达 100% 的成功率,并在所有六项挑战中保持了 71% 的稳健平均成功率,即使环境发生了意想不到的变化。
研究人员解决的核心问题是,仅靠视觉往往会对操作中最关键的时刻“视而不见”。当机器人的手去抓取物体时,手指往往会遮挡摄像头的视线,从而在机器人最需要了解情况的时刻制造出一个“盲区”。此外,视觉数据无法告诉机器人它正在施加多大的压力,或者物体是否即将滑落。虽然以往尝试为机器人添加触觉传感器的做法通常将其视为简单的插件,但 DeCAL 将触觉信息作为其思考过程的基础组成部分进行了整合。该系统在每个指尖使用高分辨率传感器,能够检测物体表面在压力下的形变情况,以及施加的精确力量。这使得机器人能够以一种如同视觉感知般丰富且细致的方式去“感受”世界。
DeCL 真正独特之处在于它处理信息的方式。它不是简单地对当前看到或感觉到的事物做出反应,而是经过训练去想象接下来会发生什么。它以三个截然不同但相互关联的能力运行。首先,它通过观察视觉场景、阅读语言指令并感受接触点来理解当前状况。其次,它进行一种“协同想象”,即预测视觉场景和触觉感受在接下来的几秒钟内将如何演变。它本质上是在问自己:“如果我现在转动这个盖子,力量会如何变化,物体在片刻之后看起来又会是什么样?”最后,它利用这种对未来的想象来决定完成任务所需的精确动作。这种前瞻性的方法让机器人能够基于交互中的物理特性来规划行动,而不是仅仅根据过去的模式进行猜测。
为了实现这一点,研究人员开发了一种特殊的决策方法,用于决定何时信任触觉。在许多任务中,机器人可能正在空气中移动(此时触觉无关紧要),然后突然接触到一个物体。如果机器人始终对触觉信号给予同等的关注,它会被空气的噪声或缺乏接触的情况所困扰。DeCAL 使用了一种智能门控机制,就像是一个调节触觉感的“音量旋钮”。当机器人没有接触任何物体时,系统会降低触觉信号的“音量”,主要依赖视觉。一旦发生接触,系统会立即调高“音量”,让触觉数据以高精度引导动作。这种动态调整确保了机器人能在正确的时间使用正确的感官,防止感官输入之间产生冲突。
该系统在一组由配备了二十二指手的双臂机器人进行的严格实验中接受了测试。研究人员要求机器人完成六种不同的活动:擦拭花瓶、擦拭白板、组装零件、旋转盖子、使用移液管取液以及拧入灯泡。选择这些任务是因为它们都需要精细的控制和持续的物理接触。研究人员将 DeCAL 与几种最先进的模型进行了对比,包括仅依赖视觉的模型,以及使用了触觉但缺乏想象未来状态能力的模型。结果显而易见:DeCL 完成任务的成功率远高于其他系统。例如,在拧入灯泡的任务中(由于手部遮挡视觉且需要精确扭矩,视觉往往失效),DeCAL 的成功率为 40%,而次优的模型仅为 35%。在擦拭花瓶的任务中,DeCAL 达到了 100% 的完美成功率,而表现最好的纯视觉模型成功率仅为 30%。
更令人印象深刻的是该系统处理从未见过的情况的能力。研究人员在背景不同、堆满随机物体、光线昏暗以及使用形状和大小完全不同的新物体的环境下测试了 DeCL。在这些“分布外”场景中(即机器人无法依赖记忆模式的情况下),DeCL 依然表现强劲。当被要求在一个全新的杯子上旋转盖子时,系统的成功率达到了 75%,显著优于竞争对手。这表明机器人不仅仅是在记忆一组特定的动作,而是在学习物体交互的底层物理原理,从而使其能够即时适应新的挑战。
研究人员还仔细观察了系统如何学习预测未来。通过分析机器人的内部预测,他们发现机器人能够准确预报在交互过程中会产生的力和形变。当机器人预测转动盖子需要多少力,或者柔软表面会如何变形时,这些预测与实际物理现实高度吻合。这种在内部模拟物理世界的能力赋予了机器人“常识”。它让系统明白,如果推得太用力,物体可能会滑落;或者如果转得太慢,任务会耗时过长。这种源自视觉与触觉结合的隐性物理知识,使机器人能够以如此流畅和自信的方式行动。
尽管取得了这些成功,作者也谨慎地指出其局限性。该系统高度依赖触觉传感器的准确性,如果传感器出现噪声或校准偏差,机器人的性能可能会下降。此外,目前的设置需要人类操作员通过遥操作系统演示任务,而该系统无法为操作员提供触觉反馈。这意味着训练数据可能无法完美捕捉到人类在能亲手感知物体时的那种细微调整。研究人员还指出,他们的模型尚未在海量的多样化触觉数据上进行训练,这表明未来的改进可以来自于让系统接触更广泛的物理交互。
这项工作代表了我们对机器人智能认知方式的一种转变。与其仅仅构建更快或更强的机器人,这种方法侧重于构建能够理解物理世界是一个动态、交互式场所的机器。通过赋予机器人想象其行为后果并适应环境感官的能力,研究人员创造了一个感觉不再像是执行脚本的机器,而是一个具备真实交互能力的智能体。随着技术的成熟,人们希望这些系统最终能够胜任定义人类生活的复杂、高接触性任务——从烹饪、清洁到照顾老人——并展现出与人类相匹配的灵巧度。未来的道路在于完善这些传感器、扩展训练数据,并持续弥合“看”、“感觉”与“做”之间的鸿沟。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。