← 最新论文
💻 computer science

Dex-X: Learning Visual-Tactile Dexterous Manipulation From Human Videos with Simulated Interaction

DEX-X 是一个利用仿真作为触觉补全引擎,从单目人类视频中重建具有物理基础的手物交互的框架,从而实现无需机器人端数据采集的视觉-触觉灵巧操控策略的训练与零样本现实世界部署。

原作者: Ruoqu Chen, Feixiang Ruan, Liu Cao, Zihao Wang, Botian Xu, Shiqin Tong, Jiajun Liu, Mingzhi Pei, Chenyu Zhang, Wanli Xing, Kaifeng Zhang, Mengdi Xu

发布于 2026-09-09
📖 1 分钟阅读☕ 轻松阅读

原作者: Ruoqu Chen, Feixiang Ruan, Liu Cao, Zihao Wang, Botian Xu, Shiqin Tong, Jiajun Liu, Mingzhi Pei, Chenyu Zhang, Wanli Xing, Kaifeng Zhang, Mengdi Xu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是工厂车间的专家,能够沿着固定路径精准地移动,以组装汽车或堆叠箱子。但一旦走出那个受控的环境,同样的机器往往会显得力不从心。人类的手是适应能力的奇迹,能够拿起脆弱的鸡蛋、转动门把手或擦拭桌面,同时不断调整以应对接触产生的无形推力和拉力。为了复制这种能力,科学家们转向了两个主要的数据来源:直接的机器人实验(既缓慢又昂贵)和人类视频(既丰富又免费)。挑战始终在于缺失的一块拼图。人类视频向我们展示了手在移动时的样子,但却隐藏了对机器人而言最关键的信息:触觉。如果不知道该用多大的力气挤压,或者不知道物体何时正在滑动,机器人就无法学会像人类那样操作工具或以复杂且充满接触的方式与世界互动。

来自清华大学及其他机构的研究团队提出了一个解决这一差距的方案,引入了一个名为 DEX-X 的系统。他们的研究提出了一个根本性的问题:机器人能否仅通过观看人类视频,就在无需预先收集任何物理数据的情况下,学会执行精细的、基于触觉的任务?他们发现的答案依赖于对计算机模拟的巧妙运用。研究人员并没有试图仅凭视频来猜测缺失的触觉信息,而是利用视频在虚拟世界中引导机器人。在这个数字沙盒中,物理定律被严格执行。当虚拟机器人接触物体时,计算机计算出所涉及的精确力量,有效地“填补”了原始视频中所缺失的触觉感知。这一过程将一个被动的视觉记录转化为了一个主动的物理课程。

研究人员首先采集了人类执行各种任务(如拿起杯子、使用刮板清洁桌面或用锤子钉钉子)的单目视频。他们利用计算机视觉追踪人类手部和所持物体的运动,并重建其三维运动。这种重建的运动随后被转移到一个数字机器人手臂和手部,该设备拥有二十九个运动部件,高度模拟了人类肢体的复杂性。然而,仅仅复制人类的动作是不够的。在现实世界中,一个盲目跟随人类路径的机器人往往会失败,因为它无法感知自己是否按压过重,或者物体是否正在滑动。为了解决这个问题,团队在模拟器中训练了一个“教师”机器人。这位“教师”观察人类运动作为引导,但可以根据其指尖感受到的模拟力来探索并调整自己的动作。通过在虚拟世界中进行数千次尝试,这位“教师”学会了通过对接触产生的无形推力和拉力做出反应,从而保持稳定的抓握并操纵物体,而这正是原始人类视频本身无法教授的技能。

一旦“教师”在模拟中掌握了这些技能,研究人员就将其知识提炼到了一个“学生”策略中。这个“学生”被设计为可部署在真实的硬件上。与拥有模拟器完美知识的“教师”不同,“学生”必须仅依靠真实机器人能感知到的东西:场景的摄像机视图、自身关节的位置以及指尖的压力传感器。学生学习如何解读代表周围世界的点云,将物体的视觉形状与来自传感器的力数据相结合。这使得学生能够在不需要模拟器内部完美知识的情况下进行操作,使其能够应对现实世界的复杂情况。

研究结果在一台配备了二十九自由度手部和手臂的真实机器人上进行了测试。研究人员要求机器人执行它从未见过的任务,仅使用从人类视频中学到的策略。在拿起一个立方体的测试中,机器人的成功率为二十八次中的二十八次,即 93% 的成功率。它也能同样可靠地完成从杯中倒水和提升物体等任务。该系统甚至表现出了对从未遇到的物体的泛化能力。当面对一个与训练物体不同的薄立方体或一个玩具鸭子时,机器人仍然能够将其捡起,尽管成功率略有下降,这证明了所学的技能并非仅仅是记忆动作,而是具有适应性的策略。

然而,该系统并非没有局限性。研究人员指出,需要长时间持续接触的任务(例如使用刮板清洁桌面)被证明更加困难。机器人在这类试验中的成功率约为 53%,失败通常发生在机器人失去抓握或在运动过程中与桌面发生碰撞时。这表明,虽然模拟为学习提供了强大的桥梁,但维持接触的复杂性仍然是一个重大障碍。团队还发现,移除视觉输入或触觉反馈都会导致性能大幅下降,这证实了两种感官对于机器人有效导航物理世界都是必不可少的。

这项工作表明,模拟的物理交互可以作为连接互联网上丰富的视频库与开发高性能、可部署机器人之间的重要纽带。通过利用模拟来生成缺失的触觉数据,研究人员已经证明,机器人可以在无需昂贵、专门的数据采集的情况下,学会复杂的、富含接触的技能。研究结果指出了一条前进的路径,即通过虚拟世界的严格测试,将人类活动的丰富视觉演示转化为物理能力。尽管在处理最复杂的交互方面仍存在挑战,但能够直接将这些技能转移到真实硬件而无需进一步微调,标志着向更通用、更自主的机器迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →