← 最新论文
💻 computer science

GeniWorld: A Generalizable Interactive World Model for Robotic Manipulation via Visual Actions

GeniWorld 是一个用于机器人操控的可泛化交互式世界模型,它利用基于 URDF 的视觉动作表示和解耦运动学,在未见环境中实现鲁棒的零样本泛化,并作为一个可扩展的策略评估器和数据生成器,用以提升下游机器人的性能。

原作者: Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Zhi Wang

发布于 2026-08-07
📖 1 分钟阅读☕ 轻松阅读

原作者: Chenghao Gu, Hanyang Yu, Jingbo Zhang, Haitao Lin, Wenyao Zhang, Jinghe Wang, Hanglei Jin, Shuzhao Xie, Jingyan Jiang, Zhi Wang

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 ✨ 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在试图教一个机器人做家务,比如折叠毛巾或拿起一个碗。在机器人领域,这有点像教一个孩子骑自行车。你可以演示一次如何骑车,但如果你把自行车移到另一个房间,或者改变墙壁的颜色,或者在座垫上放一个新玩具,孩子可能会感到困惑并摔倒。这就是科学家们试图解决的大问题:我们如何让机器人变得足够聪明,能够处理混乱、不可预测的现实世界,而不需要为每一个新情况都重新进行训练?

为了实现这一点,研究人员经常使用一种叫做“世界模型”(world model)的东西。把世界模型想象成机器人的“想象力”。机器人不仅仅是根据它现在看到的东西做出反应,它还会利用自己的想象力来预测如果它以某种方式移动手臂,接下来会发生什么。这就像是在玩电子游戏,你可以暂停,在脑海中尝试一个动作,看看是否会撞到墙,然后再实际去做。然而,大多数目前的“想象机器”都有些笨拙。它们经常搞错物理规律,或者在背景变化时感到困惑,因为它们试图通过不具备真实世界形态的抽象数字来理解机器人的运动。

这就是名为 GeniWorld 的新项目介入的地方。该项目的研究人员想要构建一个更好的想象机器——一个能够通过仅仅几次练习进行学习,并能泛化到处理完全陌生的、混乱环境中的模型。他们不仅希望机器人去猜测,更希望它能在脑海中清晰地“看到”自己的动作。

“视觉动作”的魔力

GeniWorld 的秘诀在于作者称之为视觉动作(visual actions)的东西。通常,当我们命令机器人移动时,我们会给它一组数字(例如“手臂向上移动 5 厘米,旋转 10 度”)。问题在于这些数字是抽象的;它们看起来既不像机器人,也不像房间。这就像是只通过列出跳舞需要走多少步的数字来描述一段舞蹈,却从未向别人展示过舞蹈本身。

GeniWorld 改变了游戏规则,它将这些数字转化为运动的图像。在机器人甚至开始预测未来之前,系统会将机器人的运动指令渲染成一个视觉序列——本质上是一个机器人骨架运动的视频,但没有背景或物体。这就像是将一个幽灵般的、透明版本的机器人手臂投影到屏幕上。

通过将这个“幽灵视频”输入到世界模型中,机器人学会了将运动的“外观”与运动的“结果”联系起来。这使得模型能够理解“当手臂这样移动时,碗就会那样移动”,即使碗的颜色不同,或者桌子在不同的房间里。研究人员发现,这种方法在保持物理规律准确性方面比使用原始数字要好得多。

“想象力”测试

为了验证这是否有效,团队让 GeniWorld 经历了一系列测试。他们首先在一个只有少量物体的非常简单、干净的桌子上训练模型。然后,他们把它扔进了深水区:他们在带有随机物体、不同光照和杂乱背景的桌子上对其进行了测试——这些都是机器人从未见过的场景。

结果令人印象深刻。当其他模型开始出现奇怪的幻觉(比如物体消失或机器人的手臂穿过实心桌面)时,GeniWorld 保持了冷静。它成功预测了在这些混乱的、“分布外”(out-of-distribution)场景中会发生什么。事实上,当他们测量预测结果与现实的接近程度时,GeniWorld 的表现显著优于其竞争对手,即使在环境完全随机的情况下,也能保持极高的准确度。

超强能力的训练场

但研究人员并没有止步于仅仅做一个好的预测器。他们提出了第二个问题:这种想象机器能否真的帮助机器人学得更快?

在现实世界中,收集数据既昂贵又缓慢。你必须布置摄像头、移动物体,并让机器人运行数千次。GeniWorld 提供了一个捷径。团队展示了他们可以利用极少量的现实世界数据(每个任务仅 25 个示例),并利用 GeniWorld 生成数百个新的、多样化的训练场景。他们可以告诉模型,“想象桌子很乱”,或者“想象碗在一个奇怪的位置”,模型就会生成一段描述这幅景象的逼真视频。

当他们使用这些生成的视频来训练机器人策略时,机器人处理新情况的能力变得更强了。它不仅仅是在死记硬背看到的 25 个例子,它已经学习了在混乱世界中运动的“原则”。数据表明,将现实世界的实践与这种“合成想象力”相结合,会让机器人变得更加鲁棒,帮助它在面对从未见过的任务(如处理随机杂物或不同的光照条件)时取得成功。

为什么这很重要

GeniWorld 的美妙之处在于,它弥合了机器人僵化的数学逻辑与现实世界流动且混乱的本质之间的鸿沟。通过教机器人将自己的动作视为视觉故事而非仅仅是数字,它创造了一个更可靠的想象力。这意味着我们很快就能看到,机器人不再仅仅能在完美的实验室里工作,而是真正能在我们凌乱的厨房、杂乱的车库以及不可预测的家中提供帮助,通过寥寥数例的学习便能适应并随时调整。这是迈向那些不仅能听从指令,而且能真正理解其所处运动世界的机器人的重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →