UniDex-ViTac: Learning Unified Visuo-Tactile Dexterous Manipulation Policy from Human Video Data
UniDex-ViTac 是一个利用人类视频演示来生成富含触觉反馈的模拟机器人轨迹的框架,该框架能够训练出一个统一的视觉-触觉策略,与仅基于视觉的基准模型相比,该策略在处理已知和未知物体时均能显著提高灵巧操作的成功率,且无需任何真实机器人演示或微调。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
长期以来,机器人一直是工厂中重复性任务的大师,能够沿着预设的路径进行完美的精准移动。然而,赋予机器人像人手一样灵活地拿起一个脆弱的鸡蛋或一个光滑瓶子的能力,仍然是现代科学中最困难的挑战之一。难点不仅在于“看到”物体,更在于“感觉到”物体。人类的手部布满了传感器,能瞬间告诉我们何时触碰到了物体、按压的力量有多大,以及抓握是否正在打滑。相比之下,机器人往往难以将所见转化为正确的力度,经常会导致试图抓取的物体被压碎或直接掉落。为了教会机器人这些技能,科学家通常需要通过人类物理控制机器人来收集数小时的数据,这是一个缓慢且昂贵的过程,难以规模化。此外,记录人类执行任务的标准视频缺乏触觉的关键数据,导致机器人在“视觉”与“触觉”之间存在鸿沟。
一组研究人员开发出一种新方法来弥补这一差距,创建了一个系统,使机器人能够从普通的真人视频中学习复杂的抓取技能,尽管机器人从未真正“观看”过人类触摸物体的过程。他们的方法被称为 UniDex-ViTac,利用计算机模拟和一种特定学习方式的巧妙结合,生成了数千次的练习尝试。该系统并非直接模仿人类动作,而是首先将人类手的视频转化为机器人的粗略指南。随后,它将这一指南带入一个高速运行的虚拟世界,让机器人在其中尝试完成任务。如果机器人失败了,一种专门的学习算法会对动作进行微调,直到成功为止。至关重要的是,由于这一切发生在模拟环境中,系统可以记录机器人在每一次成功的尝试中,其指尖感受到的确切触感,从而创造出了一个原始视频中并不存在的“触觉”数据集。这种大规模的模拟经验随后被用于训练一个单一且通用的机器人“大脑”,使其仅凭摄像头和自身的触觉就能拿起并举起各种各样的物体。
研究人员在十种不同的物体上测试了这种方法,范围从沉重的电钻到精致的马克杯。他们最初仅使用了五十段人类与这些物品互动的短视频。通过这些视频,系统生成了一万条模拟轨迹(即练习运行),机器人借此学习如何将其自身的机械结构与人类动作相适配。最终的结果是一个单一的策略(即一套指令),它可以处理所有十种物体,而无需为每种物体重新进行训练。在虚拟环境中,这个具备触觉感知能力的机器人成功举起物体的概率为 68.3%。这比仅依赖视觉数据的机器人版本有了显著提升,后者的成功率仅为 55.5%。这一差异凸显了仅仅看到物体是不够的;了解手指何时以及何处接触物体,对于稳固的抓握至关重要。
为了确保这不仅仅是模拟环境中的人为现象,团队将训练好的机器人带到了现实世界。他们测试了六个在训练期间见过的物体,以及五个从未遇到过的全新物体。在没有任何进一步微调或现实演示的情况下,机器人在 110 次物理试验中成功了 73 次,成功率为 66.4%。能够感知指尖触感的机器人版本表现得始终如一地更好,其成功率比仅靠视觉的机器人高出近 12 个百分点。即使面对新物体,这种差距依然存在,证明了机器人学习到的是一种通用技能,而非仅仅是记忆特定的动作。该系统通过结合场景的 3D 视图与来自四个指尖传感器的简单信号(每个传感器仅指示是否接触到了物体)来运作。这种二进制信息结合机器人对其自身手臂位置的认知,足以引导其完成成功的抓取。
这项研究表明,只要有办法通过模拟生成缺失的触觉感官,利用人类视频作为起点来教授机器人复杂的触觉技能是完全可能的。研究人员指出,他们目前的系统使用的是非常基础的触觉形式,依赖于简单的“开/关”信号,而非详细的压力分布图。他们还指出,用于训练的虚拟世界与现实并不完全匹配,这也是为什么某些物体比其他物体更难抓取的原因。尽管存在这些局限性,这项工作展示了一条清晰的前进路径:通过利用人类视频来引导模拟过程,进而生成丰富的感官数据,机器人可以操控物理世界,达到以往无法企及的灵巧程度,且无需人类在每一次尝试中都“手把手”地进行指导。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。