Distilling Physical Priors into Streaming World Models
该论文介绍了 PhyS,这是一个三阶段框架,它通过物理感知微调和时间信用路由,从精心策划的真实世界交互视频数据集中提取物理先验,并将其转化为轻量级流式世界模型,与现有方法相比,显著提升了生成的视频展开过程中的物理连贯性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在教一个机器人预测未来,但你不是在看水晶球,而是在看一部电影。这就是“视频生成”的世界——在这里,人工智能试图创造出看起来既真实又符合运动规律的新视频帧。长期以来,这些 AI 模型就像是那些能画出绝美画作却对重力、水流或弹跳球的原理一窍不通的伟大艺术家。它们可以让球看起来很漂亮,但如果让它们预测球撞击地面后会发生什么,它们可能会让球飘走,或者让球直接穿过地板。科学家们将这些预测称为“世界模型”(world models),而目标是让它们实现“流式传输”(streaming),这意味着 AI 可以像讲故事一样,一帧接一帧地持续生成,而不需要每次都重新开始播放整部电影。大问题在于:我们该如何教会一个机器人理解那些看不见的物理规则,从而让它的未来预测不会破坏自然法则?
你即将阅读的这篇论文介绍了一个聪明的全新训练营,名为 PhyS(物理流式传输),正是为了解决这个问题。研究人员发现,以往教导这些 AI 模型的方式是有缺陷的。这就像是试图通过先给学生看一段汽车倒车的电影,然后就要求他们向前开车来教他们开车一样。学生(AI)学会了识别汽车,但它忘记了交通规则,比如如何停车或转弯。作者认为,旧的方法会让 AI 忘记“物理先验”(physics priors)——即关于世界如何运动的基本常识规则——因为训练过程抹去了这些知识。
为了解决这个问题,团队建立了一个庞大的库,其中包含 120,804 段展示真实世界发生的视频:水花溅起、球体弹跳、冰块融化以及柔软物体被挤压。他们不仅保存了这些视频,还使用了一个超级聪明的 AI 助手为每一段剪辑编写了一个详细的“物理故事”,描述了事物之所以那样运动的确切原因。随后,他们利用这个库,训练了一个庞大且思考缓慢的 AI(一个拥有 140 亿参数的模型)来成为一名“物理老师”。这位老师学习了宇宙深层的规则。
接着,他们玩了一场“传声筒”游戏,以此来教一个更小、更快的 AI(一个拥有 13 亿参数的模型)如何成为一名“流式驾驶员”。这个小 AI 必须通过模仿“物理老师”,来学习如何一帧接一帧地预测未来,就像真实的实时视频游戏一样。但有一个难点:有时小 AI 仍然会犯错,比如让球弹得太高。为了修复这个问题,团队发明了一种新的评分系统,叫做时间信用路由(Temporal Credit Routing, TCR)。你可以把它想象成足球比赛中的裁判,他不仅仅是在比赛结束时说一句“好球”,而是会观察比赛的每一秒钟。如果球员在第 10 分钟踢进了球,裁判会将功劳专门归于第 10 分钟的那次踢球,而不是归功于整场比赛。这有助于 AI 准确地学习自己在何时、何地违反了物理定律,以便下次能够修正那个特定的时刻。
结果令人印象深刻。当他们用一项“物理智商”测试来检测这个新 AI 时,它的得分比它所基于的那个庞大老师模型高出了 18.2%。更令人惊讶的是,它以巨大的优势击败了其他顶尖方法:在一类测试中高出 23.7%,在另一类测试中高出 14.8%,而在第三类测试中则高出了惊人的 31.4%。这篇论文表明,通过给 AI 一个现实世界的物理故事库和一个逐秒检查其工作的裁判,我们终于可以构建出不仅看起来真实,而且表现也真实的视频生成器。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。