TacBPM: A Tactile-conditioned Behavior Prior Model for Dexterous Reorientation
本文介绍了 TacBPM,这是一种触觉条件的行为先验模型,它将多尺度球体专家模型(multi-scale sphere specialists)蒸馏到一个潜控制器中,以加速训练并实现复杂灵巧手内重定向及臂手协同操控任务中稳定的、成功的从模拟到现实的迁移。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,一个机器人手正试图拿起一个脆弱的鸡蛋、一个光滑的柠檬或一把沉重的锤子。与人类不同——人类的手指能本能地感知物体的纹理、重量和光滑度,从而在瞬间调整抓握力度——机器人通常依赖摄像头或预设指令。如果物体即使只是轻微移动,或者表面比预期的更光滑,机器人往往会失去抓力。几十年来,科学家们一直试图教会机器人像人类手部那样灵活地操纵物体,这项任务需要协调数十个微小的关节,并对不断的物理接触做出反应。挑战不仅在于将手移动到某个位置,还在于在物体于抓握中转动、滚动或滑动时,保持一种微妙且不断变化的压力平衡。
Sharpa Robotics 的一个研究团队开发了一种新方法来解决这个问题,重点研究机器人如何利用触觉作为主要引导来学习重新定向物体——即翻转或旋转物体。他们的研究名为 TacBPM,旨在解决机器人学习中的一个特定瓶颈:即如何教机器人在不中断接触或掉落物品的情况下,发现正确的指部动作序列。研究人员并没有强迫机器人从头开始学习每一种可能的动作,而是创建了一个“行为先验”(behavior prior),它充当了安全、富含接触感的动作基础库。这个库是通过训练机器人在许多不同尺寸的球体上进行构建,教会它如何滚动和握持不同规模的物体。其核心创新在于,这个库不仅仅是一套视觉指令;它是以触觉反馈为条件的,这意味着机器人的内部引导系统会不断检查指尖的感觉,以决定下一步动作。
研究人员使用一种称为“蒸馏”(distillation)的方法训练了该系统,即他们提取了八个不同的专家策略(每个策略都专门针对特定尺寸范围内的球体),并将它们的知识压缩成一个紧凑的控制器。该控制器并不输出针对机器人手部二十二个关节的原始电机指令,而是生成一个高层级的“潜在”(latent)动作,这是一种代表安全、接触稳定的运动模式的简化指令。随后,机器人学习根据具体任务对这一指令进行微调。通过保持核心触觉引导不变,仅允许机器人学习微小的修正,该系统避免了通常会导致机器人掉落物体的混乱试错过程。研究表明,当机器人面对从未见过的物体(如方块、瓶子或形状不规则的工具)时,由于它依赖于从球体中学到的触觉模式,仍然能够成功。
在一系列测试中,研究人员评估了这种方法是否能处理非球形物体以及比简单旋转更复杂的任务。他们要求机器人将物体转动到特定角度、绕特定轴旋转,甚至执行一系列完整的动作:抓取物体、提起、移动并将其放置在新的位置。与那些试图通过随机移动关节来从头学习这些任务的机器人相比,TacBPM 系统表现得显著更好。在模拟中,标准方法经常无法找到稳定握持物体的方法,导致掉落或卡住,而基于触觉调节的系统在绝大多数尝试中都能成功完成任务。例如,当被要求将方块或瓶子旋转到目标方向时,新方法的成功率接近 90%,而标准方法甚至难以达到 10%。
研究还将在模拟中学习的策略直接迁移到了配备相同灵巧手的真实机器人手臂上,无需在物理硬件上进行额外训练。机器人成功抓取了包括橡胶锤和蓝色刷子在内的各种工具,并将它们提起并移动到目标位置。它还能按照指令左右、上下旋转网球或角块等物体。在这些现实世界的试验中,使用触觉先验的机器人能够在单次尝试中将一个角块旋转超过 600 度,而其他方法往往会失去接触或完全弄丢物体。研究人员指出,当物体的形状或大小发生变化时,该系统表现得尤为鲁棒,这表明触觉引导帮助机器人适应了新的几何形状,而无需重新学习如何握持物体的基本原理。
其中最重要的发现之一是,即使机器人处理的是训练期间从未见过的物体,该系统依然有效。研究人员测试了机器人处理垃圾桶、草莓和多面体方块等形状,而这些形状并未用于构建最初的球体运动库。机器人能够泛化其知识,利用从球体中学到的触觉模式来搞清楚如何抓取和转动这些陌生的物品。这表明,触觉提供了一种超越特定形状的通用操纵语言。研究还探索了一种场景,即机器人需要遵循紧凑的指令(如“绕垂直轴旋转”),而不是被告知一个具体的最终角度。系统学会了理解这些方向并据此调整其手指动作,在物体旋转时保持稳定的抓握。
研究人员非常谨慎地展示了该方法的成功高度依赖于触觉信息。当他们移除系统中的触觉传感器,仅依靠机器人关节的位置时,性能显著下降,尤其是在处理光滑或形状不规则的物体时。这证实了机器人需要通过“感觉”物体,才能知道何时调整抓握力或改变策略。研究还证明了该系统可以适配不同的机器人。在涉及机械臂与手协同工作的另一项测试中,相同的训练范式允许机器人抓取、提起并运输各种工具,证明了该方法可以扩展到比单手更复杂的机器人躯体。
这项工作并不声称解决了机器人操纵的所有问题,研究人员也承认,对于处理与训练示例差异极大的物体,该系统在推断能力上仍存在局限性。例如,当机器人被要求处理一个明显大于其所见过的任何球体的球体时,其成功率有所下降,这表明该系统仍然存在边界。然而,结果清晰地表明,通过将机器人的学习建立在触觉反馈之上,并提供一个稳定的、富含接触感的行为基础,让机器具备以往难以企及的灵巧操纵能力是完全可能的。这项研究表明,机器人操纵的未来可能不在于教会机器人“看清”物体的每一个细节,而在于教会它们通过“感觉”来完成任务,将触觉作为稳定性与控制的主要引导。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。