← 最新论文
🤖 machine learning

MOSH-WM: Mask-Grounded Soft-Hamiltonian Dynamics for Object-Centric World Models

MOSH-WM 引入了一种掩码引导的软哈密顿世界模型,该模型通过利用槽位拥有的图像掩码的空间矩来显式约束物体动力学,从而在 OBJ3D 和 CLEVRER 数据集上,相比现有的以物体为中心的基准模型,在长期视频预测准确性和误差累积方面取得了显著改进。

原作者: Zhekai Wang, Haoxiang Huang, Xiang Liu, Zhikang Chen, Yueqing Sun, Qi Gu, Shiji Zhou, Miao Liu, Sen Cui

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhekai Wang, Haoxiang Huang, Xiang Liu, Zhikang Chen, Yueqing Sun, Qi Gu, Shiji Zhou, Miao Liu, Sen Cui

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

要理解计算机如何学习观察世界,我们必须首先了解它目前在这一方面面临的困境。当人工智能观看视频时,它通常将场景视为随时间变化的单张扁平图像。它通过识别像素中的模式来预测下一帧,就像一个孩子通过听单词的节奏来学习完成句子一样。然而,当场景变得复杂,或者计算机必须预测遥远的未来时,这种方法往往会失效。系统可能会预测一个滚动的球突然变成了另一种颜色或消失了,因为它并没有真正学习到物体移动和交互的规则。它看到了表面,却忽略了结构。为了构建更可靠的视觉,研究人员正转向“以物体为中心”的学习,这种方法教计算机将场景分解为不同的、独立的个体——例如一个红色的球、一个蓝色的盒子和一个绿色的桌子——并分别追踪每一个物体。其目标是创建一个“世界模型”,即一种心理模拟,通过根据物理定律演化这些独立的物体,从而让计算机能够想象未来的事件,而不仅仅是猜测下一张图片。

一个研究小组推出了一种名为 MOSH-WM 的新系统,试图解决这些基于物体的模型中的一个特定弱点。虽然之前的系统可以追踪物体,但它们经常会将物体的物理位置与其视觉外观混淆。想象一下,如果你仅通过观察汽车的车漆来描述汽车的运动;如果车漆发生了变化,系统可能会认为汽车本身发生了移动或变形。这个新模型将这两个概念完全分离。它为每个物体创建了一个独特的“物理状态”,该状态仅追踪物体在哪里以及移动速度有多快,而忽略物体的外观。这个物理状态植根于一个“掩码”(mask),即一个显示视频中哪些像素属于该特定物体的数字轮廓。通过使用这个轮廓来计算位置和速度,系统构建了一个稳定的、几何意义上的场景理解,不会被颜色或纹理的变化所迷惑。

研究人员在物体运动的视频上测试了这种方法,要求计算机观看一段包含六帧的短序列,然后预测接下来的三十帧。在这些测试中,新系统显著优于现有的最佳方法。在衡量预测图像与真实未来帧的匹配程度时,新模型将视觉误差降低了 25%,并将物体物理布局的误差降低了 33%。这种进步并非昙花一现;该系统在整个三十帧序列中都保持了准确性,而旧模型则开始出现偏差,导致物体在预测过程中失去形状或改变颜色。这种稳定性的关键是一种受物理学启发的技术,其中系统使用一个“软性”引导来确保物体以现实的方式运动,将数学规则与学习到的模式相结合。这个引导就像一只温柔的手,将预测向运动定律的方向轻微引导,而不会将其强行套入一个在面对视频中不完美细节时可能会崩溃的僵化公式。

至关重要的是,该系统将视觉细节与运动计算分开处理。一旦计算机预测出物体将处于何处,它就会使用一个包含过去外观的独立记忆库来填充细节,从而确保红色的球保持红色,蓝色的盒子保持蓝色。这种两部分的过程使模型既能保证物理上的准确性,又能保持视觉上的丰富性。研究人员发现,移除物理引导或视觉记忆中的任何一个都会导致系统失效,这证明了这两个部分对于模型的运作都是必要的。在涉及碰撞和复杂交互的测试中,该模型依然表现稳健,这表明通过将计算机对运动的理解建立在物体的实际形状而非仅仅是其视觉特征之上,是教机器理解物理世界的一种鲁棒的方法。这项工作并不声称已经解决了视频预测的所有问题,但它证明了通过将计算机对运动的理解扎根于物体的实际形状而非仅仅是它们的视觉特征,我们可以创造出在时间维度上更加稳定且可靠的模拟系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →