想象一下,一个机器人正试图采摘一颗成熟的草莓。它有一双敏锐的眼睛,但眼睛无法感知水果是否柔软,也无法察觉果柄是否即将折断。为了解决这个问题,工程师们给机器人穿上了“皮肤”——一种特殊的传感器,当它们接触物体时会发生挤压和拉伸,将压力和纹理转化为图像。这些被称为视觉触觉传感器。它们就像是观察着一层柔软橡胶片的微型高科技摄像机;当你按压这层薄膜时,产生的褶皱会告诉机器人它正在触摸什么。问题在于,这些传感器非常脆弱且昂贵,而且收集现实世界的“触觉照片”是一项缓慢且杂乱的工作。这就像是试图通过只听一个人在嘈杂房间里的练习来学习弹钢琴;你需要大量的数据才能精通,但获取这些数据却是个苦差事。科学家们一直尝试利用计算机来“梦造”或合成这些触觉图像,而不是全部在现实生活中采集,但之前的尝试就像是试图只用一种特定类型的手套来教机器人如何去感知。如果机器人换了一副手套,计算机就会感到困惑。
于是,VQ-Touch 出现了,它是一个像机器人皮肤“通用翻译官”一样的新型框架。这项研究背后的研究人员意识到,与其分别教机器人如何感知每一种类型的传感器,不如教它一种适用于几乎任何传感器的“触觉语言”。他们构建了一个名为 DM-VQGAN 的系统,这本质上是一位超级聪明的艺术家,它学会了观察触觉图像中最核心的部分——大的挤压感和细微的纹理——同时忽略掉无聊的背景噪声。你可以把它想象成一位素描画家,他只画出人脸的关键线条,而忽略发色或背景,这样无论谁坐在椅子上,画作都能适用。
但真正的魔力在于:团队发现许多不同的传感器实际上是“亲戚”。他们将这些传感器分成了不同的家族,就像金毛寻回犬和拉布拉多犬都是狗一样。通过使用一种被称为少样本混合训练(few-shot mixed training)的巧妙技巧,他们向计算机展示了来自一种未见过的新传感器(也许只有50张图像)的极少量图片,并将其与来自其“亲戚”传感器的数据混合在一起。计算机迅速领悟到:“噢,这个新传感器是同一个家族的!”并立即学会了如何生成该传感器的触觉图像,而无需数以千计的范例。随后,他们使用了一个离散扩散解码器(discrete-diffusion decoder),它就像一位创意作家,可以根据一个提示词——比如一张岩石的照片、一个单词如“树”,甚至是一张不同的触觉图像——来创作出一张全新的、高质量的触觉图像,且完美契合该提示词。
结果令人印象深刻。在测试中,VQ-Touch 不仅仅是在猜测;即使在数据量极少的情况下,它也能以比以往方法更高的准确度重构触觉图像。事实上,它只需通过观察几个例子并了解传感器的“家族”,就能生成它从未见过的传感器的触觉图像。无论是机器人需要通过纹理识别物体,还是模拟触觉场景进行训练,这个新框架都做得比现有最先进的模型更快、更好,且所需数据更少。这表明,我们可能很快就能让机器人像学习视觉那样轻松地学习感知世界,而无需为每种新工具花费数年时间去收集物理数据。
技术摘要:VQ-Touch
问题陈述
触觉图像生成旨在合成高保真度的触觉数据,以减少对昂贵且易损的视觉触觉传感器(VBTS)以及繁琐的现实世界数据采集流程的依赖。虽然现有方法已取得一定进展,但仍面临两个关键限制:
- 数据效率低下: 它们需要大规模、多样化的数据集来为特定传感器类型进行预训练,导致在数据稀缺或视觉受限的环境中性能下降。
- 泛化能力差: 学习到的特征往往无法泛化到涉及不同传感器的图像生成任务,阻碍了跨传感器的适用性。
核心挑战在于:如何学习一种高效的数据表示,从而在无需针对每个新设备进行大规模数据集全量重训练的情况下,实现跨传感器和跨场景的生成。
方法论
所提出的框架 VQ-Torch 通过一个三阶段流水线运行,旨在实现跨传感器和多场景的应用:
1. DM-VQGAN:高效的触觉表示学习
为了在建模触觉图像低方差潜在空间的同时保留丰富的几何和纹理信息,作者提出了 DM-VQGAN,这是一种基于向量量化生成对抗网络(VQGAN)的触觉专用编码器-解码器架构。
- 可变形卷积(Deformable Convolutions): 与使用固定卷积的标准 VQGAN 不同,DM-VQGAN 集成了可变形卷积,以自适应地学习动态空间偏移。这使得模型能够捕捉 VBTS 特有的非刚性、复杂且不规则的变形模式。
- 多尺度融合(Multi-scale Fusion): 采用并行扩张卷积模块(扩张率分别为 1、2 和 4),同时提取宏观层面的全局变形和微观层面的纹理特征,从而扩大感受野。
- 训练目标: 模型最小化重构损失(L1)、向量量化损失(包括承诺损失)、感知损失和对抗损失。
2. 用于跨传感器泛化的少样本混合训练
为了解决新传感器数据稀缺的问题,VQ-Touch 引入了一种基于**传感器家族(sensor families)**的策略。
- 传感器家族聚类: 该框架识别出具有共同内在属性(设计/制造)但处于不同环境条件下的传感器属于同一个“传感器家族”。通过使用由 DM-VQGAN 提取的特征质心进行无监督聚类策略,将传感器进行分组。
- 混合训练: 系统并非进行全量重训练,而是构建一个小样本混合数据集。该数据集结合了少量来自未见传感器的图像与其所属传感器家族的现有数据(例如 1:5 的比例)。DM-VQGAN 在这种混合数据上进行训练,使学习到的表示能够以极少量的额外数据迁移到新传感器。
3. 统一离散扩散解码器
离散扩散模型作为生成解码器,其条件接口支持多种输入模态:
- 多模态条件化: 解码器可以基于视觉图像(通过冻结的 CLIP 编码器)、原始触觉图像(通过传感器特定码本映射为离进制索引)或语义标签进行条件化。
- 生成过程: 条件潜在特征通过 Transformer 块与噪声潜在表示进行交互,以合成高质量的触觉图像,从而实现诸如零样本迁移和跨传感器生成等任务。
核心贡献
- DM-VQGAN: 一种高效的触觉表示学习器,能够捕捉专门针对触觉数据变形和纹理特征的、具有泛化性的丰富信息特征。
- 统一多模态框架: 一个支持多样化输入(视觉、触觉、标签)的条件生成系统,以满足不同的生成需求。
- 传感器家族迁移策略: 一种利用聚类和少样本混合训练将已知传感器的特征迁移到同族新变体的新颖方法,消除了对全量多数据集训练的需求。
- 性能: 该框架在触觉图像重构和生成任务中达到了最先进的水平,特别是在视觉受限和数据稀缺的场景下表现优异。
实验结果
作者在涵盖 GelSight、GelSight Mini 和 DIGIT 传感器的四个公开数据集(Touch and Go, FabricVST, VisGel, HCT)上对 VQ-Touch 进行了评估。
- 重构质量: 在重构任务中,在不同样本量(100 到 10k)下,DM-VQGAN 始终优于基准模型(MAE, VQGAN)。值得注意的是,仅用 100 个样本训练的 DM-VQGAN 取得了比使用 10k 样本训练的 MAE 更好的结果,保留了 MAE 无法恢复的精细触觉结构。
- 生成指标: 在触觉生成任务(HCT 和 SSVTP 数据集)中,VQ-Touch 在 CTTP、LPIPS、SSIM 和 PSNR 指标上均优于 UniTouch、PixArt-α 和 TextToucher。
- 少样本与零样本: 该模型展示了卓越的少样本表示学习能力和对未知物体的零样本泛化能力。在跨传感器重构方面,通过将少量未见传感器图像与家族数据混合进行训练,实现了有效的迁移,这一点在重构对比中得到了证实。
- 下游效用: 在 VQ-Touch 生成图像上训练的分类器,其物体识别准确率(例如在 FabricVST 上为 92.48%)高于在 PixArt-α 生成图像上训练的分类器(88.79%)。
意义
本文将 VQ-Touch 定位为解决触觉数据稀缺瓶颈的方案。通过建立一种少样本触觉生成的新范式,该框架实现了跨传感器兼容性和无视觉的多模态到触觉的生成。作者声称,这种方法在保持高保真度的同时,显著降低了下游机器人任务(如操作和纹理识别)的训练成本。传感器家族聚类和混合训练策略被强调为实现可扩展触觉感知的关键,为机器人技术和人机交互提供了稳健的替代方案,有效规避了物理数据采集的困难。
每周获取最佳 computer science 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。