想象一下,一个机器人正试图拿起一块脆弱、薄薄的玻璃或一根长而光滑的杆子。对人类来说,这感觉轻而易举,但对机器人来说却是一场噩梦。因为机器人通常依赖它们的眼睛(摄像头)来观察自己的动作。但是,当机器人的手指环绕住一个薄边缘时,摄像头往往无法再看到接触点——接触点被手指遮挡了,或者物体本身太薄,在屏幕上显示得并不清晰。这就像是戴着厚厚的冬手套,隔着一层雾气弥漫的窗户去穿针引线。这就是“触觉感知”发挥作用的地方。机器人不再仅仅依靠视觉,而是学会了去“感觉”。就像即使闭着眼睛,你也能通过大拇指摩擦来判断一枚硬币是平的还是圆的一样,机器人可以通过指尖上的特殊传感器来感知物体的形状和位置。科学家们正在问的一个重大问题是:机器人能否仅凭这种感觉,在不需要视觉或不需要预先建立物体模型的情况下,修正错误的抓取并将物体滑动到完美的位置?
这篇论文介绍了一个名为 TacRefineNet 的巧妙新系统,它针对这类棘手的、以边缘特征为主的对象(如薄板、扁平圆盘和细长的杆子)回答了“可以”这个问题。把机器人的手想象成一个试图握住一支滑溜铅笔的笨拙学生。机器人抓住了铅笔,但抓得有点歪。与其松手并猜测该在哪里重新抓取,TacRefineNet 就像一位超级灵敏的教练。它观察当前抓取的“感觉”,并将其与“完美抓取”的感觉(这可能来自人类演示的记忆)进行对比。利用一个特殊的 AI 大脑,它计算出需要旋转或滑动手腕的具体幅度来修正抓取。然后,手部张开、移动并再次抓取,重复这个过程,直到“感觉”与目标完美匹配。
研究人员首先完全在计算机模拟中构建了这个系统,并在 15 种不同物体的 156,007 个虚拟“触觉”样本上对其进行了训练。他们教会了 AI 一种“孪生(Siamese)”策略,这就像是有两个一模一样的双胞胎(一个观察当前的抓取,一个观察目标的抓取)通过互相比较笔记来找出差异。AI 学会了忽略它感觉不到的部分(比如旋转一枚完美的圆型硬币),并专注于它能感知到的部分,例如上下滑动或倾斜。当他们在配备了压力传感器的 11 个运动部件和 5 根手指的真实机器人手上进行测试时,结果令人印象深刻。对于机器人曾经见过的物体,在固定目标下,它成功修正抓取的概率为 80.7%,在随机目标下为 59.3%,仅需五次尝试,就能将物体调整到距离完美位置约 5 毫米和 3.5 度以内。
然而,论文也谨慎地指出,这并不是解决所有情况的万能药。该系统在物体具有明显的边缘、能产生独特的传感器“指纹”时效果最好。如果物体是一个完全光滑且对称的圆盘,传感器就会感到困惑,因为无论如何旋转,感觉都是一样的,成功率也会显著下降。此外,虽然机器人完全在类似电子游戏的模拟环境中学习,但在面对从未“感觉”过的新物体时,表现仍略显吃力,这表明尽管该技术前景广阔,但要实现完美的现实世界可靠性,仍有一段距离需要跨越。作者总结道,这种方法对于需要仅凭触觉处理精细、边缘特征明显的物品的机器人来说,是向前迈出的有力一步,但它在所训练的特定运动范围内表现最为出色。
技术摘要:TacRefineNet
问题陈述
对于具有显著边缘特征的物体(如薄板、圆盘和细长杆),精确的最终抓取对齐仍然是一个重大挑战。对于这些物体,稳定抓取和下游任务执行(如插入、组装)取决于与薄、平或细长边缘的精确接触。在这种场景下,视觉反馈往往不可靠,因为接触区域经常被手指遮挡,且深度感知在处理反射性或细微结构时表现不佳。因此,微小的感知和控制误差会不断累积,导致位姿偏差,从而引起下游任务失败。虽然现有方法利用触觉感知进行抓取质量预测或滑移检测,但仍需要一种能够利用触觉反馈直接控制并迭代优化抓取位姿的框架,且该框架不依赖于视觉、物体模型或针对特定目标的重新训练。
方法论:TacRefineNet
作者提出了 TacRefineNet,一个用于局部抓取精细化的目标条件(goal-conditioned)纯触觉框架。该系统作为一个外部灵巧度触觉伺服环路运行:
- 输入: 该策略接收当前和目标多指触觉图像(来自压阻式传感器)及其对应的手部关节配置(本体感受)作为输入。
- 架构: 它采用了孪生网络架构(Siamese network architecture),利用基于 Vision Transformer 的权重共享编码器分别处理当前和目标触觉观测值。可学习的位置嵌入保留了手指的身份信息,而交叉注意力机制允许当前触觉特征对目标特征进行关注。这些特征与本体感受状态融合,以预测修正性的腕部位姿增量。
- 输出: 网络直接回归一个 6 自由度(6-DoF)的腕部位姿增量 (Δx),该增量被编码为一个由 9 维旋转矩阵和 3 维平移向量拼接而成的向量。
- 执行环路: 手部抓取物体,观察触觉反馈,预测修正性的腕部运动,张开手部,移动到新的腕部位姿,然后重新抓取。此过程循环往复,直到触觉观测值与目标匹配。
- 训练策略: 该策略完全在基于物理的 MuJoCo 模拟器中通过**交叉组合策略(cross-combination strategy)**进行训练。当前样本和目标样本从数据集中随机配对以形成训练对,这使得系统可以在采样位姿范围内指定目标,而无需重新训练。数据集包含 156,007 个跨越 15 种物体(板、圆盘、杆)的模拟样本。
- 可观测性: 该方法仅精细化基于物体几何形状在触觉上可观测的位姿维度(例如,针对杆件的 z 平移和滚转;针对板件的 z、滚转和俯仰),从而避免了从不可观测维度引入噪声。
核心贡献
- 目标条件触觉伺服: 一种将精细抓取执行视为触觉伺服问题的表述方式,通过外部灵巧度重抓取环路,迭代地将当前多指触觉观测值与目标观测值对齐。这消除了对视觉、物体模型或针对特定目标重新训练的需求。
- 孪生多指触觉策略: 开发了 TacRefineNet,它能够联合编码配对的触觉观测值和本体感受状态,从而直接回归相对位姿增量。这避免了在接触稀疏的情况下难以处理的绝对位姿估计问题,并支持在局部位姿范围内实现不同的目标。
- 广泛的仿真到现实(Sim-to-Real)验证: 该策略完全在仿真中训练,并零样本(zero-shot)部署在配备定制压阻式传感器的真实 11 自由度五指手上。评估涵盖了已见物体、同几何类别的未见物体以及长时程动态扰动。
实验结果
- 在已见物体上的表现: 在真实系统中,在 10∘/10 mm 的标准下,TacRefineNet 的成功率在固定目标下为 80.7%,在随机目标下为 59.3%。经过五次精细化步骤后,平均误差约为 5.2 mm(位置)和 3.5∘(方向)。
- 泛化能力: 该方法可以迁移到同一几何类别的未见物体上,但当触觉接触模式缺乏辨识度时(例如对称圆盘),性能会下降。相比于圆盘和板件,杆件表现出了最好的迁移性能(在 10∘/10 mm 标准下,随机目标的成功率为 25.0%)。
- 消融实验: 去除触觉输入会导致性能发生灾难性下降(成功率接近 0%),证实了触觉感知是主要的决策信息源。去除手指融合或本体感受也会降低性能。将触觉手指的数量从两个增加到三个带来了最大的收益,超过三个后收益递减。
- 对比: TacRefineNet 显著优于通过独立估计绝对 6-DoF 位姿并计算相对变换的基准方法(在仿真中,前者成功率为 85.9%,后者为 54.1%,标准为 10∘/10 mm)。
- 鲁棒性: 系统在长时程物体扰动下展示了持续纠偏的能力,能够朝着指定的目标位姿保持高精度精细化。
意义与局限性
论文声称 TacRefineNet 为机器人抓取的最后阶段提供了一个鲁棒的解决方案,特别是对于视觉失效的具有显著边缘特征的物体。通过利用目标条件触觉伺服,它实现了无需外部感知的毫米级精细化精度。
然而,作者也承认了特定的局限性:
- 对辨识性接触的依赖: 性能依赖于具有信息量的触觉模式;具有对称或弱辨识度接触的物体(如圆盘)仍然具有挑战性。
- 局部范围限制: 该框架旨在进行采样数据集范围内的局部位姿调整,而非用于全局抓取规划或大规模修正。
- 仿真到现实的差距: 虽然实现了零样本迁移,但仍存在残余差距影响性能,特别是在具有新颖触觉特征的未见物体上。
作者建议,未来的工作可以将这种触觉精细化与视觉感知相结合,以实现全局定位和粗略引导。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。