PAN: A World Model for General, Actionable, and Long-Horizon World Simulation
本文介绍了 PAN,这是一个基于生成式潜在预测(GLP)架构构建的世界模型,它通过结合有状态的潜在表示、闭环信息流以及混合 LLM/扩散模型骨干网络,克服了现有在通用、开放领域、动作驱动预测及长程一致性方面的局限性,从而实现先进的模拟推理与规划。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个不仅仅是在对世界做出反应,而是在预判世界的头脑。几十年来,科学家们一直试图构建能够超越识别照片中的猫或撰写诗歌的人工智能;他们希望机器能够理解当你推一下杯子、转动方向盘或打开一扇门时,物理世界是如何变化的。这种基于当前行动来预测未来的能力被称为“世界模型”(world model)。它是让生物能够进行规划、构思“如果……会怎样”以及在危险发生前进行规避的认知引擎。虽然现代计算机在生成图像和文本方面已变得非常出色,但它们往往难以模拟现实中的因果逻辑。它们可以创造一段汽车行驶的美丽视频,但却无法可靠地预测如果那辆车突然转向以避开一个坑洼会发生什么。如果没有这种预测能力,人工智能仍然只是一个被动的观察者,而不是一个能够在复杂多变的环境中进行决策的主动参与者。
来自穆罕默德·本·扎耶德人工智能大学(Mohamed bin Zayed University of Artificial Intelligence)的一个研究小组推出了一种名为 PAN 的新系统,旨在弥补这一差距。PAN 并非简单地从头开始生成视频,而是作为一个模拟器,学习世界如何响应特定指令而演变。研究人员将该系统建立在一种称为“生成式潜空间预测”(Generative Latent Prediction)的基础之上,这种方法迫使计算机在预测未来时保持一个一致的内部世界记忆。它不是试图一次性猜出未来图像的每一个像素,因为这往往会导致随着时间的推移产生混乱和错误,而是将任务分解。它首先创建一个关于当前场景和正在进行的动作的紧凑、抽象的摘要。然后,它使用一个强大的基于语言的推理引擎来预测该摘要将如何变化。最后,它将这个新的摘要转换回视频。这个三步过程使系统能够在长时间内追踪物体、人物和物理规律,确保即使在经过许多秒的模拟时间后,树木依然是树木,汽车依然是汽车。
研究人员在包含八百万个视频片段的大规模数据集上训练了 PAN,这些片段都配有对其中发生的动作的详细描述。这些视频涵盖了从日常人类活动到人与周围环境之间复杂交互的一切内容。通过教导系统根据诸如“在雪林中驾驶”或“拿起一个蓝色杯子”之类的语言指令来预测视频的下一刻,团队使 PAN 能够学习物理因果律。在测试中,该系统展示了在长序列中保持一致性的卓越能力。在一组实验中,研究人员要求模型模拟一系列动作,例如机器人将物体在托盘之间移动。当其他系统在几步之后就会迅速丢失对物体的追踪或产生不可能的物理现象时,PAN 能够持续生成连贯、逻辑清晰的结果超过十步。它成功地预测了如果一个机器人抓取一个黄色罐子并将其移动到新托盘,那么在下一帧中,罐子会出现在那个新托盘里,而旧托盘则是空的。
为了验证 PAN 确实是在模拟现实而非仅仅是在创造漂亮的图片,研究人员使用了一个名为“世界推理竞技场”(World Reasoning Arena)的严格基准对其进行了评估。该测试衡量了三个具体的技能:系统模拟动作即时结果的准确性、在长时间内维持一致世界的能力,以及其预测是否能帮助另一个计算机程序做出更好的决策。结果显示,PAN 超越了其他开源模型,并能与领先的商业系统进行竞争。在需要机器规划一系列动作以实现目标的任务中(例如在桌子上对物品进行分类),集成 PAN 使规划智能体的成功率比使用标准模型提高了百分之二十以上。这表明该系统的预测不仅在视觉上具有合理性,而且在因果上是准确的,为决策智能体提供了一张可以信任的可靠未来地图。
这项研究还强调了当这些系统缺失关键组件时会发生什么。研究人员进行了测试,在移除基于语言的推理引擎或用于平滑视频片段之间过渡的专门方法后进行对比。如果没有推理引擎,系统将难以理解涉及智能体(如人或机器人)的复杂指令,且视频过渡会变得生硬。如果没有平滑机制,随着模拟时间的延长,视频质量会迅速下降,物体会出现变形或消失。这些发现证实了将“推理大脑”与细致的逐步生成过程相结合,对于长期稳定性至关重要。该系统并不依赖于单一的技巧,而是依赖于一个闭环,即预测必须不断对照“必须看起来像是现实中可观察到的变化”这一要求进行检查。
尽管取得了成功,研究人员也明确了该系统的当前局限性。PAN 在动作被描述为自然语言(如“左转”或“开门”)时表现最佳。它尚未被设计用于处理精细机器人任务所需的精确、连续的肌肉指令,例如控制机械手的确切力量。此外,虽然该系统比之前的尝试要稳定得多,但在极长时间内仍会出现漂移,偶尔会丢失微小的细节或凭空创造出不存在的物体。作者指出,该系统继承了一些构建它的视频生成模型的视觉习惯,这些模型优先考虑的是看起来真实而非物理上的完美。这意味着虽然模拟过程通常是可靠的,但它还不是一个完美的物理表现。
这项工作代表了在教导机器思考未来方面迈出的重要一步。通过将语言推理能力与生成视觉序列的能力相结合,PAN 提供了一种让人工智能探索各种可能性而不必承担现实后果的新途径。它允许一个智能体进行“思想实验”,测试不同的行动方案,以观察哪一种能导致预期的结果。研究人员计划向公众发布其代码和数据,邀请他人在此基础上进行开发。随着领域的发展,目标始终是创造出不仅能看到世界,而且能理解世界运作方式的系统,为能够像人类一样进行导航、规划和行动的智能机器铺平道路。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。