Zero-Shot Transfer of Force Map Estimation Across GelSight Mini Sensors
本文提出了一种两阶段零样本迁移方法,通过首先利用基于 UniT 的模型将触觉图像适配到一个公共领域,然后再利用 U-Net 网络进行力估计,从而实现跨不同 GelSight Mini 传感器单元的 3D 力图估计泛化,并以此消除对每个传感器进行重新训练的需求。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在机器人领域,赋予机器感知能力是一项长期依赖于人工之手的挑战。虽然机器人观察和听觉方面的能力日益精进,但它们的触觉往往仍然是一种脆弱且定制化的产物。研究人员制造出特殊的传感器,它们看起来像柔软、橡胶状的眼睛,通过捕捉触摸物体时的图像来理解纹理和压力。然而,制造这些传感器并不像在工厂流水线上冲压出完全相同的零件那样简单。因为它们通常是在实验室中手工组装的,所以没有两个传感器是完全一样的。有的可能背景颜色略有不同,或者凝胶层比另一个厚了零点几毫米。这种缺乏统一性的现象造成了一个显著的障碍:一个旨在理解特定传感器“感觉”的计算机程序,在面对另一个看似几乎完全相同的单元时,往往会彻底失效。为了解决这个问题,科学家通常不得不为每一个新制造的传感器收集海量的新数据并重新训练模型,这种缓慢且昂贵的过程阻碍了机器人灵巧性的进步。
来自阿利坎特大学的一个研究小组提出了一种打破这一循环的方法,允许计算机学习如何读取一个传感器的触觉,并将其知识应用于任何其他同类型的传感器,而无需事先看到任何新的示例。他们的工作专注于一种被称为 GelSight Mini 的特定设备,该设备利用摄像头拍摄当柔软透明表面被按压在物体上时的图像。当物体接触表面时,它会产生独特的明暗图案,揭示接触的形状和力量。研究人员开发了一个两步系统:首先清理触觉图像,去除特定传感器的“指纹”;然后利用处理后的图像来精确计算各个方向上施加的力量。通过这种方式,他们证明了一个仅针对单一传感器进行训练的模型,可以准确预测完全不同的传感器的受力情况,即使是背景颜色不同的传感器,也能达到足以媲美使用特殊标记系统的准确度。
他们发现的核心在于一种将传感器之间的差异视为“翻译问题”而非“障碍”的方法。想象一下,你试图理解一个你不会说的方言所写的文章;与其从头学习每一种新方言,不如先将故事翻译成你熟悉的标准语言,然后再阅读。研究人员将这种逻辑应用于触觉图像。他们构建了一个系统,可以将来自陌生传感器的原始图像重建为一张“通用”图像,使其看起来像是来自一个标准的、理想化的传感器。第一阶段使用一种在单个传感器的大量图像集上训练的人工智能,该人工智能学会了识别触觉的核心特征,同时忽略了该特定单元的背景颜色或微小缺陷。其结果是一个干净、标准化的图像,剥离了硬件特有的怪癖,只留下关于被触摸物体的纯粹信息。
一旦图像被标准化,系统的第二阶段就会接管,以确定物理力量的作用。研究人员发现,仅仅观察重建后的图像是不够的;他们需要明确指出接触发生的具体位置。为此,他们从重建图像中减去背景,创建了一个差分图像,该图像仅显示接触点。这个清晰、高对比度的图像随后被输入到第二个神经网络中,用于预测力图。该网络计算压力在三个维度上的大小:向下推力和两个方向的侧向推力。团队使用超过 18,000 张图像的数据集测试了这种方法,在此过程中,他们必须首先移除最初用于帮助计算机识别力量的小型彩色标记。他们创建了一种算法来数字式地擦除这些标记,留下干净的触觉图像,然后训练系统根据这些无标记图像来预测力量。
实验结果非常稳健。当系统在从未见过的传感器(包括具有不同背景颜色和略有不同物理特性的单元)上进行测试时,表现出了惊人的连贯性。在第一阶段,即系统重建触觉图像时,它与原始真实世界图像达到了高度的相似性,评分表明重建后的图片在结构和细节方面与真实图片几乎无法区分。在第二阶段预测实际力量时,系统的误差非常小,平均与真实力量的偏差仅略高于 1 牛顿。作为参考,1 牛顿大约是一个小苹果的重量,这意味着在整个传感器表面上,系统的预测误差仅相当于一个苹果的重量。即便系统从未针对测试中的特定传感器进行过训练,仍能达到这种精度,证明了该方法可以在不同硬件单元之间实现泛化。
研究人员还将他们的无标记方法与仍在使用传统彩色标记的系统进行了比较。他们发现,虽然标记确实能略微降低误差,但其带来的提升不足以抵消它们所造成的复杂性和视觉遮挡。使用干净、无标记图像训练的系统表现得几乎与使用标记的系统一样好,这表明数字擦除标记是一种成功的策略。此外,整个过程速度极快,足以用于实时应用。系统处理一张图像并输出力图的时间不到 20 毫秒,这足以跟上这些传感器捕捉图像的速度。对于需要对环境做出即时反应的机器人(例如调整抓取脆弱物体的机器人手)来说,这种速度至关重要。
尽管取得了这些成功,研究人员也谨慎地指出了目前工作的局限性。当力量极低(接近于零)或极高(接近传感器的最大极限)时,系统表现挣扎。此外,当力量非常大或物体被用力向侧面推挤时,系统在预测接触区域的确切形状方面也存在困难。这些领域表明,模型对触觉物理学的理解尚不完整。作者建议,未来的改进可以通过加入特定的训练规则来实现,以帮助计算机更好地理解接触的几何形状,确保接触的形状能像力量本身一样被精确保留。
这项工作代表了迈向使触觉感知广泛应用的重大一步。通过证明针对单一传感器训练的模型可以推广到许多其他传感器,研究人员消除了开发机器人触觉的一个主要瓶颈。他们的方法表明,建立一个通用的触觉“翻译器”是可能的,这个翻译器可以将现实世界传感器产生的杂乱、多变的输出转化为机器人可以理解的清晰、可靠的信号。这种方法不需要此前认为必需的海量数据集或完美的制造条件,为下一代能够真正感知世界的机器提供了一条更灵活、更高效的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。