← 最新论文
🤖 machine learning

DexSim2Real: Foundation Model-Guided Sim-to-Real Transfer for Generalizable Dexterous Manipulation

本文提出了 DexSim2Real,这是一个集成框架,它利用视觉 - 语言基础模型进行域随机化、触觉 - 视觉交叉注意力策略以及渐进式技能课程,通过显著缩小仿真到现实的性能差距,在可泛化的灵巧操作任务中实现了 78.2% 的平均成功率。

原作者: Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

发布于 2026-05-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Zijian Zeng, Fei Ding, Huiming Yang, Xianwei Li, Yuhao Liao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,教导一只机械手执行精细任务,比如堆叠积木或倒水。在现实世界中这样做既缓慢、昂贵,又充满风险(机器人可能会弄坏东西)。因此,科学家通常先在视频游戏模拟中教导机器人。但问题在于:模拟永远无法完美地还原现实。光线略有偏差,桌面的摩擦力不同,相机角度也不够准确。这种差异被称为"模拟到现实的鸿沟"。当机器人从游戏环境转移到现实世界时,它往往会失败,因为它学会的是如何玩游戏,而非如何应对现实。

本文介绍了DexSim2Real,这是一个旨在缩小这一鸿沟的新系统,使机器人能够在游戏中学习,并立即在现实世界中成功执行任务,而无需人类教师示范如何操作。

以下是其工作原理,通过三个简单的部分及日常类比进行拆解:

1. “艺术评论家”(FM-DR)

问题:通常,当科学家让模拟看起来更真实时,他们只是猜测设置(例如“让光线亮一点”或“让地板滑一点”)。他们可能运气好,也可能花几周时间猜错。

解决方案:作者利用基础模型(一种能同时理解图像和文本的超级智能 AI)作为艺术评论家

  • 工作原理:系统生成一张机器人在模拟环境中的图片,然后将这张图片与一张现实世界的照片一起展示给 AI 评论家。
  • 类比:想象你正在尝试画一幅朋友的肖像。你把画作展示给一位专业艺术评论家。评论家不会只说“还不错”,而是会指出:“光线太刺眼了,衬衫的质感看起来像塑料,而不是棉布。”
  • 结果:系统根据这些反馈自动调整模拟设置(光线、纹理、物理属性),直到模拟画面与现实照片无法区分。这一过程完全自动化,无需人类猜测。

2. “超级感官”(TVCAP)

问题:机器人通常仅依赖摄像头(视觉)。但当机械手接触物体时,仅靠视觉是不够的。它需要感知压力和滑动。

解决方案:该系统赋予机器人一个结合视觉触觉的大脑,利用一种特殊的“交叉注意力”机制。

  • 类比:想象一个人试图拿起一杯水。如果只看杯子,一旦杯子很滑,他们可能会失手。但如果他们在注视的同时用手指感受抓握力,就能立即做出调整。
  • 工作原理:机器人的“大脑”并非简单地将视觉数据和触觉数据堆叠在一起,而是让“眼睛”询问“手指”:“这滑吗?”,同时让“手指”询问“眼睛”:“边缘在哪里?”。它们动态地相互沟通。这有助于机器人处理棘手任务,例如在手中旋转物体或将销钉插入紧密的孔中。

3. “智能教练”(PSC)

问题:试图一次性学会复杂技能是令人难以承受的。如果你要求机器人“立即将水从杯子倒入碗中”,它很可能会洒出一切并放弃。

解决方案:该系统使用渐进式技能课程,扮演智能教练的角色。

  • 类比:想象学习骑自行车。你不会一开始就冲下山坡。你会先使用辅助轮,然后在平坦的车道上练习,接着是轻微的斜坡。
  • 工作原理:一个大语言模型(教练)将大任务分解为微小步骤:"1. 抓住杯子。2. 举起它。3. 移到碗上方。4. 倾斜。”机器人先掌握第 1 步,然后是第 2 步,依此类推。一旦它熟练掌握这些小步骤,教练就将它们串联成完整任务。这使得学习更快、更高效。

结果:有效吗?

研究人员使用一只拥有 16 根手指的真实机械手,在六项高难度任务(如堆叠积木、将销钉插入微小孔洞、倒水)上测试了该系统。

  • 得分:机器人在现实世界中的成功率达到了78.2%
  • 对比:这远优于以往的方法(得分约为 50–65%)。
  • 鸿沟:机器人在游戏中与现实世界表现之间的差异微乎其微(仅8.3%)。以往的方法存在巨大鸿沟(通常超过 20–30%),意味着它们在模拟中表现极佳,但在现实中却失败了。
  • 零样本:关键在于,机器人完全在模拟环境中学习。它从未见过人类在现实世界中的任何示范。它纯粹通过系统的智能调整学会了技能迁移。

总结

DexSim2Real 就像一个机器人训练营,利用三种工具确保成功:

  1. 一位AI 艺术评论家,让训练视频游戏看起来与现实世界完全一致。
  2. 一个多感官大脑,让机器人能够同时“看”和“感”。
  3. 一位智能教练,将庞大、令人畏惧的任务分解为细小、可管理的步骤。

其结果是一个机器人,能够在计算机中学习复杂、精细的手部动作,然后直接走出实验室,在现实世界中近乎完美地执行这些动作。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →