← 最新论文
🤖 machine learning

Tactus: Open-Vocabulary Object Recognition from Low-Cost Pressure Arrays

Tactus 是一种开放词汇的触觉识别模型,它利用在低成本电阻式压力阵列上的掩码自编码器预训练,仅使用 187 条标记录制数据就在 STAG 基准测试中实现了最先进的性能,证明了有效的基于触觉的目标识别并不需要光学传感器或大规模监督数据集。

原作者: Abdul Basit Tonmoy

发布于 2026-08-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Abdul Basit Tonmoy

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

触觉的秘密语言

想象一个能够完美观察世界的机器人,却对握手的触感一无所知。它能发现桌上的咖啡杯,但如果它抓起杯子时,镜头被窗帘遮住了,机器人就会突然陷入迷茫。它不知道自己手里握着的是杯子、球,还是空无一物。这就是“触觉感知”(tactile sensing)发挥作用的地方——即赋予机器触觉感的科学。长期以来,研究人员一直试图通过在柔软、富有弹性的凝胶中使用高级摄像头,来教机器人用手指去“看”。但这些设备既昂贵又脆弱。然而,现实世界充满了廉ly、耐用的压力传感器,它们广泛存在于从智能手套到机器人手部的各种设备中。这些传感器并不拍摄图像,它们只是测量不同位置受压的程度。科学家们一直在问一个核心问题:我们能否仅通过读取这些简单的压力图,就教会机器人理解它正在抓握的东西?而且,它能否在不需要记忆特定物体清单的情况下做到这一点?换句话说,它能否通过观察一张压力图,通过理解触觉的语言,从而说出:“这摸起来像个杯子”?

Tactus:教机器人“阅读”压力

Tactus 应运而生,它是一个全新的 AI 模型,充当了沉默的压力语言与人类口语之间的翻译官。研究人员构建这个模型,是为了让它仅凭低成本压力传感器的数据来回答文本问题。想象你戴着一只拥有 548 个微小压力点(称为“税元”,taxels)的手套。当你抓取物体时,这些点会像繁星点点的夜空一样亮起,显示出哪里压力大,哪里压力小。Tactus 观察这张“星图”,并通过将其与诸如“人类双手紧紧握住杯子”之类的文本描述进行对比,尝试猜测你正在抓握什么。

关于 Tactus 最令人惊讶的地方在于它学习所需的训练数据极少。通常情况下,AI 模型需要数百万个示例才能胜任一项任务,而 Tactus 仅通过 187 次手部抓取 27 种不同物体的记录就学会了。为了实现这一点,研究人员使用了一个巧妙的技巧:他们首先让 AI 对 144,000 张无标签的压力图进行“白日梦”式的预训练,教它如何填补图像缺失的部分(这种技术被称为掩码自编码器预训练)。然后,他们将这个“触觉大脑”连接到一个已经掌握语言理解能力的庞大预训练语言模型上。结果呢?Tactus 的预测准确率达到了 77.1%(Top-1),这与那些专门为识别这 27 种物体而训练的复杂系统相比,表现同样出色,甚至更好。它无需经过训练的分类器头,而是通过计算压力感官与你输入的文字在特定类别上的匹配度来进行排序。

成功的秘诀(以及隐藏的陷阱)

团队发现,Tactus 成功的秘诀不在于某种高级的新型计算机架构,而在于解决一些枯燥且实际的细节问题。他们发现,他们使用的传感器存在“静止噪声”——即一个并非真正为零的基准压力。如果不对其进行修正,AI 本质上是在试图从一张 97% 都是灰色、只有 3% 有趣的图片中学习。一旦他们应用了传感器自身的校准数学公式来清理数据,模型的性能便大幅提升。这一单一的修复手段比所有改变 AI 大脑结构的改动加起来都更为重要。

他们还了解到,AI 并不需要看到手部抓取物体的完整“电影”。虽然观察几个不同的角度会有所帮助,但仅需 两个截然不同的帧(即两个瞬间的画面)就足以恢复到观看八帧画面时 89% 的准确度。这表明,对于机器人而言,要了解自己抓着什么,它不需要一段长视频,只需要几次快速、不同的触觉快照即可。

AI 错在哪里(以及为什么这不是 AI 的错)

尽管取得了成功,Tactus 并非完美无缺。研究人员分析了它的错误,并发现了有趣的一点:AI 出错并不是因为词汇相似。例如,它不会因为“杯子”(mug)和“杯”(cup)听起来像而混淆它们。相反,它出错是因为“感觉”相似。它经常把“刺梨”(kiwano,一种带刺的水果)误认为是“链条”,因为两者摸起来都像是许多独立的硬点压在手上。它把“螺丝刀”误认为“杯子”,是因为两者摸起来都是细长的圆柱体。这些错误源于触觉的物理特性,而非语言本身。

论文还测试了一些行不通的想法,这同样具有重要意义。他们尝试同时在不同类型的传感器数据上训练 AI,希望它能学会一种通用的“触觉语言”。但失败了;事实上,这反而降低了模型的性能。他们还尝试让 AI 在感受物体的同时观察物体的照片,但视觉信息(显示背景或手部本身)过于干扰,导致触觉感官产生混乱。这里的教训是,对于这些廉价的压力传感器,与其试图将一切混合在一起,不如专注于使用单一类型的传感器并完美地清理数据。

总结

Tactus 证明了你不需要充满摄像头的昂贵机器人手指来赋予机器触觉。通过廉价的压力传感器、一点聪明的的数据清洗以及与语言模型的连接,机器人只需通过阅读压力图就能理解它正在抓握什么。它提醒我们,有时 AI 的重大突破并不在于构建更强大的大脑,而在于更仔细地倾听世界本身已经在发送的简单信号。该模型现已开源,任何人都可以将其接入机器人的记忆中,并开始询问:“我正在抓着什么?”

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →