← 最新论文
🤖 AI

Mask2Real-WM: Segmentation Masks as a Sim-to-Real Bridge for Controllable Dexterous World Models

Mask2Real-WM 是一种用于灵巧操作的两阶段动作条件世界模型,它通过将分割空间中的动力学预测与写实渲染解耦,从而弥合了从模拟到现实的差距,并利用大规模合成预训练和极少量的现实世界微调,实现了精确的逐关节控制。

原作者: Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

发布于 2026-08-20
📖 1 分钟阅读☕ 轻松阅读

原作者: Riccardo O. Feingold, Davide Liconti, Chenyu Yang, Robert K. Katzschmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

长期以来,机器人一直是工厂车间的专家,在每一个物体都固定不动、每一条路径都预先编程的环境中精准地移动。但一旦机器人步入混乱、不可预测的家庭或杂乱的车间,其自信心往往会瞬间瓦解。为了在现实世界中导航,机器需要的不仅仅是传感器;它需要一种对“接下来会发生什么”的感知能力。这就是“世界模型”(world models)所承诺的前景——这是一种机器人领域的概念,即人工智能学习去想象未来。机器人不再仅仅是对当前所见做出反应,而是构建一个关于当它移动手臂或抓取物体时,世界如何变化的心理模拟。如果机器人能在脑海中可靠地预测其行为的结果,它就可以在不冒险损坏自身或周围环境的情况下测试不同的策略,从而在真正接触物理物体之前,有效地在脑中“梦见”解决问题的最佳方案。

当机器人拥有一只拥有许多运动部件的手(如人类的手),而非简单的两指夹持器时,挑战会呈指数级增加。这些灵巧手提供了惊人的多功能性,能够操纵精细物体或执行复杂任务,但也引入了令人眼花缭乱的变量。一只手可能拥有二十三个可以独立移动的不同关节,创造了一个极其广阔的可能动作空间。预测这样一个复杂的系统将如何与世界互动是非常困难的,因为视觉上的变化是微妙且复杂的。手指的一个微小移动都可能剧烈改变物体的抓握方式,然而标准的视频预测模型往往会模糊这些精细细节,无法捕捉到特定关节运动与物体随之运动之间的精确因果关系。

苏黎世联邦理工学院(ETH Zurich)的研究人员开发了一种应对这一问题的新方法,创建了一个名为 Mask2Real-WM 的系统。他们的目标是构建一个能够准确预测灵巧机器人手与物体交互的未来世界的模型,即使是在仅使用极少量真实世界数据进行训练的情况下。其创新的核心在于他们拆解预测任务的方式。他们并没有试图一次性预测出完整的、写实的未来视频,而是将过程分为两个截然不同的阶段。第一阶段专注于场景的结构,预测手和物体位置的简化地图。第二阶段则利用这张地图,将其绘制成一段真实的视频。

这种分离至关重要,因为它允许研究人员使用大量的模拟数据来教机器人如何运动,同时仅使用极少量的真实世界影像来教它如何呈现外观。在第一阶段,系统学习预测“分割掩码”(segmentation masks),这本质上是显示手、物体和背景的颜色编码轮廓。由于这些轮廓是简单的形状而非复杂的照片,计算机模拟出的样子与真实世界之间的差距大大缩小。这使得研究人员可以在超过五十小时的合成数据上训练系统的运动预测部分。在这个虚拟环境中,机器人可以练习以每一种可能的路径移动手指,涵盖了在真实实验室中收集多年数据也难以企及的运动范围。

一旦系统通过这庞大的模拟库学会了运动物理学,它就会通过仅两点五个小时的真实世界视频进行微调。这就是第二阶段发挥作用的地方。系统获取第一阶段预测的轮廓,并使用专门的渲染模型将其填充为具有真实色彩、纹理和光影的视频。由于理解运动的重任已经在模拟中完成,渲染模型只需要学习真实环境的具体外观,而这是一个可以通过极少数据就能掌握的任务。结果是一个能够观察机器人手部的运动、想象未来几秒钟的动作,并生成写实视频的系统,同时还能保持每个手指的运动清晰且分明。

研究人员在一个涉及拿起并放置日常小物品的基准任务上测试了这个系统。他们发现,这种两阶段方法远优于以往试图一步完成视频预测的方法。旧方法通常只能猜出手的概略路径,但在处理精细细节时却表现不佳,要么将手指模糊在一起,要么无法展示特定关节运动如何改变抓握。相比之下,新系统展示了高度的控制力:当研究人员要求模型仅移动其中一个特定的手指时,模型能准确预测该手指的运动,而不会与其他手指混淆。这种水平的精确度对于机器人真正理解其行为后果而言至关重要。

研究还表明,大规模模拟训练不仅是一个有益的加分项,更是一种必然。当研究人员尝试仅使用少量真实世界数据来训练系统的运动预测部分时,系统无法学会对手指的独立控制。它并没有足够的孤立手指运动案例来理解其运作方式。模拟数据提供了缺失的多样性,让系统接触到了手部所有可能的角度和动作。通过将这种广泛的模拟经验与少量的真实世界视觉训练相结合,研究人员创建了一个能够泛化到新场景(例如不同的光照或从未见过的物体)的模型,其可靠性是以往模型无法比拟的。

最终,这项工作展示了一条教导机器人“先思考后行动”的切实可行之路。通过使用简化的表示形式来弥合模拟与现实之间的鸿沟,研究人员证明了机器人可以在无需数千小时真实世界试错的情况下,学习复杂的物理交互。该系统不仅仅是在猜测下一帧视频看起来像什么;它理解了运动的底层机制,足以自信地预测未来。这种能力为机器人开辟了大门,使其能够在自己的思维中安全地探索新任务,在真正介入物理世界之前,评估不同的策略并从想象中的错误中学习。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →