ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
ForgeWM 引入了一种渐进式训练框架,将双向视频生成器转化为高效、低延迟的少步世界模型,能够使离散与连续的游戏控制与视频生成实现精确对齐,并通过因果一致性蒸馏以及具有回放时细化功能的双路径部署协议等技术,在质量和控制精度方面达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一个这样的世界:你的电脑不仅仅是在观看电影,而是在实际游玩其中的游戏,并能根据你按下的按键精准预测接下来的发展。这就是**视频世界模型(video world models)**的领域,它是人工智能的一个分支,旨在模拟现实。把它想象成一个超级聪明的讲故事的人,他读遍了图书馆里的每一本书,并且能瞬间构思出下一章节的内容。通常,这些讲故事的人擅长编写长篇、详尽的故事,但他们的速度很慢。如果你想实时玩一款视频游戏,你需要一位能瞬间低语出下一句台词的讲故事者,否则游戏就会卡顿和延迟。挑战在于,让这些模型变快往往会让它们变得笨拙;它们可能会忘记你刚刚告诉它们的内容,或者搞错你角色的移动方向。这篇论文解决了这个棘手的问题:如何教导一个 AI 既要像闪电般快速,又要对你的控制指令保持完美的服从,同时还要保持视频画面的清晰与真实。
ForgeWM 应运而生,它是一个全新的框架,就像一位大师级主厨在训练一组副厨,让他们能在不同的时间内烹饪出同一道美味佳肴。研究人员从一个强大的、动作缓慢的 AI 模型开始,该模型可以向任何方向(向前或向后看时间)生成视频。他们的目标是将此转化为一个“少步数(few-step)”模型——即只需通过一步、两步或四步快速步骤,就能生成未来几秒钟视频的模型,而不是经历一个漫长且缓慢的过程。他们发现,仅仅提高模型的速度是行不通的,因为当 AI 试图预测未来时,它会因为自身的错误而感到困惑。
为了解决这个问题,团队开发了一套四阶段的训练食谱。首先,他们教会了模型游戏世界的基础知识。然后,他们强迫模型仅使用干净、完美的示例(就像学生临摹老师完美的字迹一样)来学习如何向前推进时间。接着,他们让模型进行自主练习,但配备了一个能即时纠正其错误的“安全网”。最后,他们让模型在模拟游戏中自由驰骋,教导它去匹配游戏实际运行的真实分布。其结果是一组专门化的“学生”:一个用于实现瞬时、低延迟反应的 1 步模型;一个在速度与质量之间取得平衡的 2 步模型;以及一个用于更高保真度的 4 步模型。
论文表明,这些模型表现得非常出色。在以《我的世界》(Minecraft)进行的测试中,1 步模型可以以 72.10 FPS(每秒帧数)生成视频,这足以实现流畅的实时游戏体验,同时仍能高精度地理解你的键盘和鼠标指令。4 步模型则产生了更优异的视觉质量,在匹配预期动作和控制方面击败了其他顶尖系统。有趣的是,研究人员发现,你并不总是需要重新训练模型来获得更好的质量。他们引入了一种“回放时间细化(Replay-Time Refinement)”技巧:如果你录制了一段快速的 1 步游戏过程,稍后你可以将那段保存的视频进行“重加噪(re-noise)”,要求同一个模型对其进行清理并添加细节,而不改变你所走的路径。这种细化后的视频看起来几乎和模型从头开始进行四步生成的效果一样好,但它保留了你当时经历的完全相同的视角和场景布局。
团队还展示了这种训练方法并不仅限于《我的世界》。他们将同样的食谱应用于由手柄控制的第一人称射击(FPS)游戏,创建了一个名为 ForgeWM-CrossFPS 的模型,该模型成功为《光环无限竞速》(Halo Infinite)和《现代战争》(Modern Warfare)等游戏生成了视频。虽然论文指出,这些模型在极长时间内仍会表现出一些退化(例如在 22 秒后丢失方块结构),但结果表明,ForgeWM 提供了一种强大且灵活的方式,用于构建既可控又快速的视频世界模型。作者们建议,通过将“瞬时反应的需求”与“高质量视觉的需求”分离,我们可以同时拥有这两者的优势。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。