← 最新论文
💻 computer science

CAAT: Contact-Aware Attention Scaling and Tactile Masking for Data-Efficient Contact-Rich Manipulation

CAAT 是一个轻量级框架,它通过引入注意力缩放(attention scaling)和动态触觉掩码(dynamic tactile masking)来显式地整合接触先验,从而增强了数据高效的富接触操控能力,并显著提升了多种基于 Transformer 的视觉-触觉策略在仿真和真实世界实验中的性能。

原作者: Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

发布于 2026-08-04
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiaming Jiang, Yuzhe Huang, Hao Liang, Pei Lin, Shengcheng Luo, Fanrong Dong, Jiaping Wu, Chenxi Xiao, Wanlin Li, Ziyuan Jiao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,一个机器人正试图学习如何拿起一个脆弱的鸡蛋。如果机器人只有眼睛,它可以看到放在桌子上的鸡蛋并规划动作。但就在它的手指触碰到鸡蛋的那一刻,摄像头的视野被遮挡了,真正的魔法发生了:机器人需要感受压力、滑动和纹理,才能知道自己抓得太紧还是太松。这就是“富接触操控”(contact-rich manipulation)的世界,机器人的成功取决于在“看”与“感觉”之间进行切换。长期以来,教机器人做这件事就像是在试图教一个学生同时阅读地图并感知地形,却不告诉他们何时该切换档位。机器人的大脑(通常是一个复杂的 AI,称为 Transformer)试图猜测何时该听从眼睛,何时该听从皮肤,由于“感觉”部分往往只发生在任务的一小部分时间内,它经常会感到困惑。

这篇论文介绍了一个巧妙的新技巧,叫做 CAAT(接触感知注意力缩放与触觉掩蔽),旨在帮助机器人弄清楚究竟何时切换模式。把 CAAT 想象成机器人的感官中的一位智能交通控制器。CAAT 不让机器人去猜测何时该关注触觉,而是使用一个简单的规则:“如果你没碰到任何东西,就相信你的眼睛;如果你正在接触物体,就相信你的皮肤。”它还拥有第二个超能力:它充当了机器人触觉感官的“降噪耳机”。当机器人的手指没有接触到任何东西时,皮肤传感器仍然会感受到背景(比如空气或桌面),这是无聊且具有干扰性的。CAAT 会立即消除这些背景噪声,使机器人只能听到实际接触时的“响亮”信号。通过结合这两个技巧,机器人学习得更快,并且在即使没有见过许多示例的情况下,也能更好地完成复杂任务。

问题所在:机器人的感官混乱

机器人在空旷空间中移动时表现出色,因为它们可以使用摄像头。它们可以看到杯子、瓶子或钥匙,并确定抓取位置。但一旦它们开始接触物体,游戏规则就改变了。在现实世界中,像拧开罐盖或将钥匙插入锁孔这样的任务,依赖于极其细微的物理感受——比如轻微的滑动或压力的变化——而这些是摄像头根本无法看到的。

问题在于,机器人往往难以知道何时从“视觉模式”切换到“触觉模式”。目前大多数机器人使用标准的 AI 大脑,只是将所有信息混合在一起,寄希望于能自行找出平衡点。这就像要求一名学生在解数学题的同时还要听收音机;机器人必须在每一秒钟都猜测哪种感官更重要。由于“触觉”部分在整个任务中通常非常短暂且稀少,机器人的大脑会被大量的视觉数据淹没,从而忽略了至关重要的触觉线索。这使得学习过程缓慢且效率低下,尤其是在机器人没有数千次练习尝试可以学习的情况下。

解决方案:CAAT 的两步魔法

作者提出了 CAAT,这是一个轻量级的框架,充当机器人感官的智能过滤器。它并不取代机器人的大脑,只是为它提供了更好的聆听指令。CAAT 通过两个截然不同的步骤工作:

1. “降噪式”触觉(动态触觉掩蔽)
想象一下,你试图在嘈杂的房间里听清一个耳语。如果房间里充满了持续的背景嘈列,你就听不见耳语了。同样,机器人的触觉传感器始终在“感觉”着某些东西,即使它没有接触到物体(比如感觉到空气或桌面)。这是静态背景噪声。
CAAT 引入了一种“参考”触觉——即机器人的手指在没有接触任何东西时的感觉。随着机器人的移动,CAAT 会不断将当前的触觉与该参考值进行比较。如果某个传感器部分的感觉与参考值完全相同,CAAT 就认为那是背景噪声并将其静音。如果某个传感器部分的感觉不同(因为正在挤压物体),CAAT 就会调高音量。这使得机器人能够仅专注于其手指真正与世界交互的部分,忽略其余部分。

2. “智能交通控制器”(接触感知注意力缩放)
噪声消除后,机器人仍需决定是看还是感觉。CAAT 使用一个简单的预设规则:

  • 接触前: 当机器人正向物体靠近时,CAAT 告诉大脑:“相信你的眼睛!”它会提升视觉信息的重要性,以便机器人进行导航和对齐。
  • 接触期间: 一旦机器人接触到物体,CAAT 就会切换开关。它说:“相信你的皮肤!”它会提升触觉信息的重要性,以便机器人调整抓握力和力度。

这不是一种复杂的猜测,而是构建在系统中的结构化规则。机器人不需要学习何时切换;系统会根据机器人是否接触到物体自动处理这一切。

研究发现:更快的学习,更好的结果

研究人员通过两种方式测试了 CAAT:在计算机模拟中,以及在带有物理机器人手的真实世界中。

在模拟中:
他们使用了名为 UniVTAC 的基准测试,包含五个不同的任务,如拿起瓶子或插入管子。

  • 在没有 CAAT 的情况下,标准方法(仅混合视觉和触觉)的平均成功率约为 51.6%。
  • 使用 CAAT 后,成功率跃升至 69.6%。
  • 这比标准方法提高了 18.0 个百分点,比其他试图自行学习切换规则的高级方法提高了 10.0 个百分点。
  • 至关重要的是,即使在机器人仅有极少数据(仅 25 次演示)进行学习时,CAAT 的表现依然最优,证明了这种“智能切换”有助于机器人更快地学习。

在现实世界中:
他们在三个棘手任务上测试了机器人:拿起瓶子、打开盒子和取出充电宝。他们尝试将 CAAT 与三种不同类型的机器人大脑(ACT、Diffusion Policy 和 π0\pi_0)结合使用。

  • 标准的“混合一切”方法成功率仅为 25% 到 36% 左右。
  • 使用 CAAT 后,成功率飙升至 55% 到 66%,具体取决于所使用的“大脑”。
  • 平均而言,CAAT 比现有的最佳方法高出 21.1 个百分点。
  • 最显著的改进是在“开箱”任务中,标准方法几乎完全失败(10% 到 35% 成功率),但 CAAT 的成功率达到了 50% 到 60%。

为什么这很重要

论文指出,提升机器人操控能力的诀窍不仅仅是给它们更多的数据或更大的大脑,而是要给它们关于感官如何工作的正确“常识”。通过明确告知机器人何时该看、何时该感觉,并通过过滤掉触觉传感器中无聊的背景噪声,CAAT 使机器人变得更加高效。

作者发现,这种方法适用于不同类型的机器人大脑,这意味着它是一个可以添加到许多现有系统中的灵活工具。虽然结果非常令人鼓舞,但论文也指出,这些结果是针对所测试的任务(如拿起和插入物体)以及特定的机器人设置而言的。然而,核心观点——即机器人需要明确的规则来决定何时信任眼睛而非皮肤——似乎是让机器人能够处理这类复杂的、高度依赖接触的任务,并无需多年练习的一个强有力的进步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →