← 最新论文
💻 computer science

StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

StateFlow 是一个以状态为中心的生成式预可视化框架,它通过构建、演化并访问一个持久且可编辑的 3D 世界状态,克服了一次性合成的局限性,从而实现对场景结构、动态以及摄像机轨迹的迭代优化。

原作者: Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

发布于 2026-08-13
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图讲述一个故事,但你不是在用文字书写,而是在用粘土、玩具和纸箱搭建一个电影场景。在现实世界的电影制作、游戏设计和建筑领域,创作者并不会仅仅凭空变出一个完成的电影;他们会经历一个混乱而神奇的中间步骤,叫做“预可视化”(previsualization)。这就像是一个数字沙盒,导演和设计师可以在其中移动演员、改变光照以及测试摄像机角度,而无需在实际制作前花费数百万美元。长期以来,计算机在生成精美的图片或简单的短视频方面表现出色,但在处理这种“沙盒”工作时却表现得很糟糕。如果你要求计算机“把机器人向左移动”,它往往只是画了一张新的图片,让机器人在另一个位置,却忘记了机器人之前在哪,或者让背景看起来很诡异。这就像是试图通过每次都把雕塑融化并重新浇筑新粘土来修改一个手指一样。研究人员一直在思考的一个大问题是:我们如何给计算机一个持久且可编辑的“世界”,让它能记住一切,从而让创作者能够真正地在场景中进行创作,而不只是旁观?

于是有了 StateFlow,这是一个试图通过改变游戏规则来解决这一问题的全新系统。StateFlow 不再要求计算机以一种巨大且混乱的方式“生成一段视频”,而是先要求计算机构建一个持久的 3D 世界状态(persistent 3D world state)。把它想象成一套数字乐高积木,它始终保持组装状态。当你想要改变某些东西时,你不需要把整个东西都融化掉;你只需要拿起一个特定的积木(物体),移动它或更换它,而世界的其余部分会保持原样。

以下是 StateFlow 如何运作的分解,分为三个有趣的步骤:

1. 构建世界(状态构建)
想象一下,你想在月球上建造一个科幻基地。如果你只是要求计算机“画一个月球基地”,它可能会画出一张从正面看很酷的图片,但建筑物可能会悬浮在空中,或者布局在走动时显得毫无逻辑。StateFlow 变得非常聪明,它同时从两个角度观察场景:一个前视图(用于观察物体的外观)和一个鸟瞰图(用于观察它们在地面上的位置)。然后,它扮演一个超级聪明的裁判,检查前视图和鸟瞰图是否一致。如果前视图说“有三个机器人”,但鸟瞰图只显示有两个机器人的空间,系统就会修复这个冲突。它构建了一个坚实的 3D 世界,其中的每个物体都有真实的位置、真实的形状和真实的身份,随时准备被移动。

2. 改变故事(状态演变)
一旦世界构建完成,创作者可能会说:“好了,现在飞船坠毁了!”或者“让我们把整个基地看起来像 1980 年代的风格。”旧的视频生成器会尝试从头开始幻觉出一段全新的视频,经常会导致角色丢失或背景出现闪烁错误。然而,StateFlow 将这个世界视为一个活的数据库。它更新一个“状态表”——即每个物体及其属性的列表。如果飞船坠毁了,系统不会重画整个月球,它只是更新飞ks的条目,将其改为“现在是一堆废铁”,并可能改变其位置。如果你想改变风格,它只需更新整个场景的“颜色”或“材质”标签。这意味着世界会记住之前发生的一切,因此即使事物发生变化,故事也会保持连贯性。

3. 观看电影(状态访问)
最后,你想从一个酷炫的摄像机角度观看场景,比如一架无人机穿过基地。如果你只是要求计算机“移动摄像机”,它可能会撞到墙上或者对着天空,因为它并不“理解”3D 几何结构。StateFlow 使用了一个“渲染反馈”循环。它首先猜测一条摄像机路径,然后快速渲染出该路径看起来的微型预览。如果摄像机即将撞到建筑物,系统会在预览中发现碰撞,并自动将摄像机推到一个安全的位置。它不断进行这种“猜测-检查-修正”的循环,直到摄像机路径完美为止,确保镜头在 3D 世界中是切实可行的。

研究结果显示
作者将 StateFlow 与其他仅生成视频或 3D 场景的方法进行了对比测试。他们发现,虽然其他方法生成的视频中物体经常消失、变形或漂移(即时空不一致性),但 StateFlow 能保持世界的稳定性。在测试中,StateFlow 在保持物体随时间变化的一致性以及维持逻辑布局方面得分更高。该系统表明,通过将预可视化视为管理一个持久的 3D 状态而非仅仅是制作视频,创作者可以获得更多的控制权。他们可以使用同一个世界来制作电影分镜、规划电影拍摄镜头,甚至原型化交互式游戏关卡。

虽然该系统是一个巨大的进步,但作者指出它还称不上是“魔法”。它依赖于其他 AI 模型来进行繁重的计算工作,因此目前还无法实现像视频游戏那样实时、即时的交互。但这预示着一个充满希望的未来:我们不再只是观看 AI 创作艺术,而是真正步入并玩转它所构建的世界。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →