← 最新论文
💻 computer science

World-in-World: World Models in a Closed-Loop World

本文介绍了“World-in-World”,这是首个用于在闭环具身设置中基准测试生成式世界模型的开放平台,研究表明,可控性、动作-观测缩放以及推理时计算对于任务成功的关键性高于单纯的视觉质量。

原作者: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Y
发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Jiahan Zhang, Muqing Jiang, Nanru Dai, Taiming Lu, Arda Uzunoglu, Shunchi Zhang, Yana Wei, Jiahao Wang, Vishal M. Patel, Paul Pu Liang, Daniel Khashabi, Cheng Peng, Rama Chellappa, Tianmin Shu, Alan Yuille, Yilun Du, Jieneng Chen

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个机器人正试图在一个杂乱的房间里导航,以寻找一个特定的物体。为了成功,它不能仅仅对眼前所见做出反应;它必须预判如果向前迈一步、向左转或伸手去拿会发生什么。它需要一个关于世界的心理模型,一种在实际发生之前模拟未来的方法。多年来,科学家们一直在构建能够生成极其逼真的动态场景视频的人工智能系统。这些被称为“世界模型”的系统可以创造出汽车在街道上行驶或杯子从桌上掉落的图像,其视觉保真度之高,看起来就像真实的录像。然而,一个关键问题一直悬而未决:这种视觉上的美感是否真的能帮助机器人做出更好的决策?直到现在,该领域一直由仅凭生成的视频看起来有多漂亮来评判这些模型的基准测试所主导,而忽略了这些视频对于试图完成真实任务的机器人是否有用。

一个研究团队引入了一种名为“世界中之世界”(World-in-World)的新方法,该方法将焦点从视觉完美转向了实际效用。他们不再问“这个视频看起来有多好?”,而是问“这个视频能否帮助智能体成功?”研究人员构建了一个闭环测试平台,人工智能智能体必须执行四种不同的物理任务:通过主动观察来寻找隐藏物体、根据单张参考图像导航到特定位置、在探索 3D 环境后回答相关问题,以及控制机械臂移动物体。在这种设置下,世界模型充当了模拟器的角色。在机器人投入物理行动之前,它会利用该模型来想象几种可能的未来。然后,它通过评估这些想象出的场景,来选择最有可能导致成功的路径,从而有效地在行动前进行思考。

这种新评估的结果揭示了视觉质量与任务性能之间令人惊讶的脱节。研究人员测试了一系列最先进的视频生成器,其中包括一些能产生极高清晰度和极具美感的片段的模型。他们发现,高视觉质量本身并不能保证机器人能成功完成任务。一个模型可能会生成一段精美的房间视频,但如果视频中的物理规律稍有偏差,或者如果机器人无法在模拟中精确控制摄像机运动,机器人就会做出错误的决策。事实上,研究表明,可控性(即通过特定的低级动作来引导模拟的能力)比单纯的图像美感重要得多。一个能够可靠响应“向前走两步”指令的模型,比一个能产生华丽但不可控视频的模型更有价值。

此外,团队发现,仅仅使用更强大的预训练视频生成器并不是提高机器人性能的最佳途径。相反,他们发现,通过使用与机器人的环境和动作相关的相对较少的数据对标准的视频生成器进行微调,会产生更好的结果。这个过程被称为“后训练”(post-training),它使模型的预测与机器人所处的特定物理世界规则保持一致。数据还显示了一个清晰的缩放法则:在微调过程中,模型看到的动作与观察的示例越多,它在帮助机器人成功方面的表现就越好。此外,给系统更多的计算时间——允许它在做出决策前模拟更多潜在的未来——显著提高了其成功率。

研究结论指出,对于世界模型要真正对机器人技术和具身智能有用,必须通过它们支持闭环决策的能力来衡量,而不是通过它们创造完美视觉的能力。虽然目前的模型在处理机器人操作的复杂物理特性(如物体之间精确的摩擦力和接触)方面仍存在困难,但新的框架提供了一条清晰的前行之路。通过优先考虑可控性,并通过后训练使模型适应特定任务,研究人员可以构建出不仅看起来像真实世界,而且实际上理解如何与现实世界互动的系统。这种从评判图像到测试计划的转变,标志着在创造能够可靠地在物理世界中导航和操作的智能体方面迈出了重要一步。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →