想象一下,你正试图教一只机械手如何处理脆弱的物体,比如拿起一个熟透的西红柿,或者拧紧一颗微小的螺丝。为了安全地做到这一点,机器人需要具备“触觉”。但问题在于,就像人类拥有不同类型的触觉一样(有些人对纹理敏感,而另一些人对压力敏感),机器人的“触觉传感器”也各不相同,而且它们使用的“语言”也各不相同。
有些传感器就像高分辨率相机,通过拍摄柔软表面的形变来观察形状(这非常擅长观察形状,但可能反应较慢);另一些传感器则像是压力按钮阵列,能告诉你在压力下产生了多大的反作用力,但它们无法提供物体的清晰轮廓。
由于这些传感器所使用的“语言”不同,在一个类型的传感器上训练出的机器人通常无法理解另一种类型的数据。这就像试图通过只读英文书来教一只狗学法语,狗根本听不懂。
解决方案:“机器人触觉的通用翻译器”
这篇论文的作者创建了一个名为异构触觉 Transformer (HTT) 的新系统。你可以将 HTT 想象成一个通用翻译器,它允许不同类型的机器人触觉传感器相互理解并共同学习。
他们是这样构建这个系统的,这里使用了一个简单的类比:
1. “语言交换”数据集 (HPT)
要教导这个翻译器,你需要那些说着不同语言、但同时在讨论同一件事的学生。研究人员构建了一个庞大的数据集,称为 HPT(异构配对触觉)。
- 设置: 他们在机器人夹持器的相对两侧放置了两种不同类型的传感器。
- 动作: 他们让机器人针对 160 万种不同的物体进行触摸、扭转和滑动(例如按压海绵、扭动螺丝或滑动方块)。
- 结果: 因为传感器是在触摸完全相同的物体且在完全相同的时间内进行操作,所以系统可以学习到“来自相机传感器的这种柔软图像”与“来自按钮传感器的这种特定压力模式”是如何匹配的。
2. 训练方法:“填空游戏”
该系统使用了一种聪明的训练游戏,叫做掩码重构(类似于“填空题”测试)。
- 游戏规则: 系统获取一个传感器的数据,隐藏(掩码)掉其中一大块内容,然后要求 AI 猜出缺失的部分是什么。
- 转折点: 它不仅仅是基于同一种传感器进行猜测,而是通过观察另一个传感器的数据来帮助填补空白。
- 目标: 通过这种方式,AI 学到了一种共享的“内在语言”(潜空间),在这个空间里,“握住一颗螺丝”这一概念无论是由相机传感器还是压力传感器报告,看起来都是一样的。
3. 结果:效果如何?
研究人员通过三种方式测试了这个“翻译器”:
- 识别物体: 他们要求 AI 仅凭触觉来识别物体。HTT 系统比以往的方法表现得更好,尤其是在切换不同传感器类型时。它学会了无论哪个传感器报告,一种“柔软”的感觉就是“柔软”的感觉。
- 检测滑动和压力: 他们测试了 AI 是否能分辨物体是否正在滑动,以及被挤压的力度有多大。HTT 系统表现出色,因为它结合了相机传感器的“视觉”细节和压力传感器的“力量”细节。
- 现实世界机器人任务(终极测试): 这是最令人印象深刻的部分。他们将 HTT 系统应用在一个真实的机器人手臂上(Franka 手臂配合 Sharpa 手掌)来完成两个棘手的任务:
- 拧紧玩具螺丝: 机器人必须反复抓取并旋转螺丝。
- 拿起豆腐: 机器人必须拿起一块柔软的豆腐,既不能把它压碎,也不能把它掉落。
最终结果:
- 没有 HTT “翻译器”时,机器人表现得很糟糕(要么掉落豆腐,要么无法转动螺丝)。
- 有了 HTT 系统,机器人的成功率大大提高。它能感受到拧紧螺丝所需的细微接触变化,并知道应该施加多少压力来拿起豆腐而不将其压碎。
为什么这很重要
论文声称,这种方法允许机器人同时从多种不同类型的传感器中学习。与其为每购买一种新传感器就训练一个新的机器人大脑,你可以训练一个“通用大脑”(HTT),它能够理解所有这些传感器。
简而言之,作者构建了一个系统,教机器人如何流利地“说触觉”,无论它们使用的是哪个品牌或哪种类型的传感器,这使得它们在处理现实世界中的脆弱物体时变得更加出色。
技术摘要:异构触觉 Transformer (HTT)
1. 问题陈述
触觉感知对于接触密集型机器人操作(例如,抓取易碎物体、精密组装)至关重要,然而扩展触觉学习仍是一个显著的瓶颈。与摄像头不同,触觉传感器本质上是异构的:它们在换能机制、数据结构和输出格式方面存在根本差异。
- 光学传感器(例如 GelSight, 9DTact)通过弹性体变形捕获丰富的空间和几何信息,但往往受限于摄像头的帧率。
- 阵列式传感器(例如 Xela, Tac-02)提供高频时序信号和直接的力/压力测量,但空间分辨率较低。
目前的表示学习方法主要侧重于光学传感器,或将传感器视为孤立个体。在一种模态上训练的模型无法直接摄取来自另一种模态的数据,这阻碍了创建统一的、传感器无关的操作策略。目前缺乏大规模、同步配对这些不同模态的数据集,也没有现有的框架能有效学习它们之间的共享表示。
2. 方法论
2.1 异构配对触觉 (HPT) 数据集
为了解决数据稀缺问题,作者利用通用操作接口 (UMI) 设置构建了异构配对触觉 (HPT) 数据集。
- 规模: 160 万帧同步配对帧。
- 传感器: 四种不同的传感器:两种光学传感器(GelSight Mini, 9DTact)和两种阵列式传感器(Xela, Tac-02)。
- 采集: 传感器安装在夹持器手指的相对两侧,以捕捉与日常用品交互过程中的同步接触特性。
- 组成部分: 该数据集包括:
- 无标签交互数据: 用于自监督预训练(按压、扭转、滑动动作)。
- 物体分类: 20 种具有不同几何形状和纹理的物体。
- 力估计: 通过带有外部 F/T 传感器的探测装置收集的同步 6 维力标签。
- 滑移检测: 源自摩擦系数时间序列的标签,分为静态、初始和宏观滑移。
2.2 异构触觉 Transformer (HTT) 架构
HTT 是一个旨在学习跨异构传感器共享潜在空间的自监督框架。它采用了掩码自编码器 (MAE) 设计,包含以下组件:
- 传感器特定编码器 (Ei):
- 对于光学传感器:处理空间补丁 (patches) 的视觉 Transformer (ViT) 编码器。
- 对于阵列传感器:处理多维时间序列时序补丁的自注意力 Transformer。
- 输入在编码前进行补丁化和归一化处理。
- 共享 Transformer 主干 (T): 一个统一的骨干网络,将所有传感器的标记嵌入 (token embeddings) 处理到统一的潜在空间中。
- 传感器特定解码器 (Di): 用于在预训练期间重建被掩码的输入补丁。
- 跨模态预测器 (Pij): 通过源传感器嵌入和可见的目标嵌入来预测被掩码的目标传感器嵌入的交叉注意力 Transformer。
2.3 预训练目标
模型使用结合了两个目标的联合损失函数进行训练:
- 单模态掩码重建 (LMAE): 鼓励每个传感器通过重建其自身的掩码输入来提取鲁棒的结构和物理特征。
- 跨模态对齐 (LAlign): 训练模型利用源传感器的完整嵌入和目标的可见嵌入来预测被掩码的目标传感器嵌入。这使不同模态在共享潜在空间中实现对齐。
- 应用了梯度停止 (stop-gradient) 于目标端,以防止表示崩溃。
- 对齐损失由随时间变化的系数 (αt) 加权,从 0 开始(热身阶段),以便在增强对齐之前先进行传感器特定的特征开发。
在下游任务中,解码器和预测器会被丢弃;仅使用传感器编码器和共享主干。
3. 核心贡献
- HPT 数据集: 一个大规模(160 万帧)、同步配对光学和阵列式触觉传感器的数据集,使得研究异构触觉表示学习成为可能。
- HTT 框架: 一种自监督架构,结合了 MAE 式重建和双向跨传感器预测,以学习跨异构传感器类型的可迁移表示。
- 全面评估: 在感知任务(分类、力估计、滑移检测)和操作任务(模拟及真实世界)中进行了广泛验证,证明了该框架向未知传感器和任务泛化的能力。
4. 实验结果
4.1 触觉感知任务
- 物体分类: HTT 在所有四种传感器上均优于 "Scratch" 基准。在光学传感器上,HTT 以显著优势超过了最强的仅光学预训练基准(T3, SITR)(例如,在 9DTact 上提升 +13.5%,在 GSMini 上提升 +17%)。跨模态对齐提高了光学传感器的性能,但在阵列传感器上表现出混合结果(在 Xela 上略有下降),这归因于模态间的信息不平衡。
- 力估计与滑移检测: HTT 在所有传感器上都大幅超越了基准。仅光学预训练的方法(T3, SITR)通常无法迁移到力敏感型任务,而 HTT 保持了稳健的性能。跨模态对齐在滑移检测方面特别有效,通过绑定互补的力和空间线索,显著提高了 Macro-F1 分数(例如,在 TAC-02 上提升 +12.0%)。
4.2 机器人操作任务
- 真实世界实验(Franka Arm 上的 Sharpa Hand):
- 任务: “玩具螺丝”(拧紧螺丝)和“抓取豆腐”(提起软豆腐而不压碎)。
- 设置: 使用预训练期间未见过的传感器(9DTact 编码器)进行零样本适配。
- 结果: 使用 HTT 嵌入的策略显著优于仅使用原始 6 维力矢量或关节位置的策略。
- 玩具螺丝: HTT 实现了 95% 的成功率,而基于力矢量的策略仅为 50%。作者将其归功于 HTT 能够表示循环重新抓取所需的空间接触特征(接触位置和偏移),而原始力矢量无法捕捉这些特征。
- 抓取豆腐: HTT 实现了 55% 的成功率,而基于力矢量的策略为 35%,这减少了三分之一的滑移率并消除了压碎失败。
- 模拟任务 (ManiFeel): 与基准相比,HTT 嵌入提高了插销 (Peg Insertion) 和安装灯泡 (Bulb Installation) 任务的成功率,证实了传感器无关接触嵌入的效用。
5. 重要性与主张
论文声称,配对的异构预训练是实现通用、传感器无关的触觉表示学习的一条切实路径。
- 可迁移性: HTT 学习到的表示可以适应新任务和此前未见过的传感器,而无需针对特定传感器进行预训练。
- 策略学习: 该框架提供了比原始力读数更丰富的接触表示,直接提升了接触密集型操作策略的性能。
- 可扩展性: 通过弥合光学与阵列式传感器之间的差距,HTT 解决了扩展触觉学习的一个关键瓶颈,超越了单模态数据集的局限性。
作者指出了局限性,包括目前仅关注光学和阵列类传感器、缺乏同类传感器配对研究,以及缺乏传感器补丁之间显式的几何空间对齐。未来的工作旨在将对齐扩展到其他传感模态,并完善跨模态监督。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。