← 最新论文
💻 computer science

ReTouch: Empowering Contact-Rich Dexterous Manipulation with Online-Refined Tactile Prediction

ReTouch 是一种视觉-语言-动作模型,它通过采用触觉补丁编码器(Tactile-Patch Encoder)和高频动作模块来共同预测并在线优化触觉状态与动作,从而增强了富接触型灵巧操作能力,并在新引入的 XHT 数据集上实现了显著高于基准模型的成功率。

原作者: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Shiqi Zhang, Xin Zhang, Yedong Shen, Jiajun Deng, Yuxuan Gao, Sha Zhang, Yuan Zhang, Kaixue Long, Jiajia Wu, Jia Pan, Yao Li, Yanyong Zhang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人就像是在试图搭建积木塔的笨拙幼儿的世界。它们有眼睛(摄像头)和大脑(人工智能),可以理解像“拿起红色积木”这样的指令。但问题在于,眼睛无法感知触觉。如果积木很滑,或者机器人的抓握力太重压碎了积木,或者积木开始滑动,机器人的眼睛可能直到为时已晚才会察觉。这就是在“灵巧操作”(dexterous manipulation)中面临的大问题——这是一个描述机器人使用双手完成精细、依赖触觉任务的专业术语。科学家们一直试图赋予机器人触觉,但这非常棘手。仅仅给机器人的大脑增加一个“感觉”传感器通常是不够的,因为机器人需要预测下一步会发生什么,并立即调整抓握力度,而不是在东西掉落后才做出反应。

这就是名为 ReTouch 的新理念发挥作用的地方。你可以把它想象成不仅给了机器人一种触觉,还给了它一种“第六感”,让它能够预判下一秒手指的感觉,并在现实情况与预测不符时立即修正自己的判断。研究人员构建了一个系统,将触觉视为机器人手部与其大脑之间一场生动的、呼吸着的对话。ReTouch 不仅仅是观察一张手握物体的图片,它将每根手指的感觉分解成微小的、具体的“补丁”(patches),就像一张高分辨率的压力地图。然后,它会在机器人移动时不断更新这张地图,如果物体滑动或位移,它会实时修正其预测。结果是?一个机器人可以比以往更好地处理复杂的、依赖触觉的工作——比如按下移液器上的按钮或擦拭白板——即使在情况出错时也是如此。

问题所在:眼睛无法感知,且预测会过时

机器人正变得越来越擅长遵循指令。如果你告诉机器人“拿起杯子”,它的摄像头会看到杯子,大脑会计算如何移动机械臂。但一旦机器人的手指真正接触到杯子,情况就变得复杂了。杯子是滑的吗?它在滑动吗?机器人捏得太重了吗?摄像头无法看到接触点发生的无形力量。

科学家们曾尝试通过给机器人的手指配备“触觉传感器”(触觉传感器)来解决这个问题。有些机器人只是观察触觉数据并做出反应,就像反射一样。另一些机器人则试图预测未来的触觉。但这些系统的工作方式存在缺陷。想象你在接一个球。你预测了一秒钟后球的位置。但如果风向变了,或者球旋转得很奇怪,你的预测就会出错。如果你在伸手接球的过程中不更新你的预测,你可能会错过。

本文指出,许多目前的机器人系统都犯了这个错误。它们在动作开始时对手指的感觉做一个预测,然后就坚持执行那个计划,即使物体开始滑动也不管。等到机器人意识到物体正在移动时,已经太晚了。预测已经“过时”了。

解决方案:ReTouch 与“补丁”系统

研究人员引入了 ReTouch,这是一个通过实现两个主要功能来解决问题的系统:更好地组织触觉数据并不断更新其预测。

1. 触觉补丁编码器:手指地图
首先,ReTouch 改变了机器人“读取”其触觉传感器的方式。大多数机器人只是将所有的触觉数据丢进一个大而混乱的堆里。然而,ReTouch 将每根手指视为一张微型地图。它将每个手指的表面划分为五个特定的“补丁”(例如指尖、中心、基部、左侧和右侧)。

这就像一张天气图。天气图不仅仅是说“在下雨”,它还会告诉你具体哪里在下雨以及雨有多大。ReTouch 对触觉也做了同样的处理。它告诉机器人:“你食指的尖端压力很大,但中指的侧面几乎没碰到。”这有助于机器人进行微小的、精确的调整,就像人类在抓握一颗光滑的葡萄而不将其捏碎时那样。

2. “预见”与“后见”专家
第二部分,也是最重要的一部分,是 ReTouch 如何预测未来。该系统使用两个“专家”(AI 模型)来学习触觉:

  • 后见专家(The Hindsight Expert): 这是老师。在训练期间,它观察实际的未来触觉数据(真实发生了什么)以学习机器人应该预测的内容。
  • 预见专家(The Foresight Expert): 这是学生。它尝试根据当前看到的内容来预测未来的触觉。

这里有一个神奇的技巧:预见专家并不仅仅做一个预测然后就固守不变。它以极快的速度运行(每秒 36 次)。每当它获得来自机器人手指的新触觉数据时,它都会说:“等等,我的预测有点偏差。让我更新一下!”然后它利用这个新鲜的、更新后的预测来修正机器人的下一个动作。

这就像玩电子游戏,你可以暂停,观察敌人的新位置,然后立即改变策略。如果物体滑动了,机器人不会等待下一个“回合”;它会立即重新计算抓握力并挽救物体。

他们的发现:不会掉东西的机器人

为了测试这一点,研究人员制造了一个真实的机器人手(称为 XHand),并将其连接到机器人臂(UR7e)上,创建了一个新的数据集,称为 XHT-Dataset。他们记录了 900 次机器人执行七种不同复杂任务的真实世界演示,例如:

  • 按下移液器上的按钮。
  • 抓取不同重量的水瓶。
  • 用海绵擦拭白板。
  • 打开存放烧杯的柜子抽屉。

他们将 ReTouch 与其他智能机器人系统进行了对比。结果令人印象深刻。在正常条件下,ReTouch 的成功率比排名第二的机器人高出 18.4%。在“挑战性”条件下(即机器人必须处理光滑物体、不同高度,甚至有人拉走物体时),ReTouch 的成功率高出 23.8%。

例如,在“液体转移”任务(将水从一个容器移动到另一个容器)中,ReTouch 比最优秀的竞争对手好 19%。在“海绵擦拭”任务中,它比后者好 25%。论文指出,这些巨大的进步是因为 ReTouch 能够处理“富接触”任务——即那些机器人需要不断接触、滑动并适应物体的任务。

为什么这很重要

论文表明,赋予机器人触觉不仅仅是添加传感器;更在于机器人如何使用这些信息。如果机器人只是对触觉做出反应,它就太慢了。如果它预测未来但不对预测进行更新,它就会感到困惑。ReTouch 证明了处理精细、重触觉任务的最佳方式是同时进行预测和持续修正。

研究人员发现,这种“在线细化”(在移动过程中更新预测)是关键。当他们测试一个做出预测且不进行更新的机器人版本时,成功率显著下降。这表明,对于机器人要真正掌握手术、烹饪或组装电子产品等任务,它们需要能够“感知”未来,并在现实发生变化时瞬间改变主意。ReTouch 是迈向赋予机器人那种灵巧性的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →