← 最新论文
💻 computer science

minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models

本文介绍了 minWM,这是一个全栈开源框架,通过微调、因果强制训练和蒸馏的综合流程,将现有的双向视频基础模型转化为实时、可相机控制、少步自回归的世界模型。

原作者: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

发布于 2026-05-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Min Zhao, Hongzhou Zhu, Bokai Yan, Zihan Zhou, Yimin Chen, Wenqiang Sun, Kaiwen Zheng, Guande He, Xiao Yang, Chongxuan Li, Fan Bao, Jun Zhu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位才华横溢的高端电影导演(即视频基础模型),他能根据剧本创作出令人惊叹的高质量影片。然而,这位导演工作非常缓慢:在向你展示任何一帧画面之前,他必须先逐场规划整部电影。如果你想在拍摄中途改变镜头角度,他就必须停下来,重新规划整部电影,然后从头开始。这对于制作一部打磨精良的电影来说很棒,但对于需要即时反应的视频游戏或实时聊天来说则糟糕透顶。

minWM 是一个全新的“训练营”和“工具箱”,旨在将这位缓慢、追求完美的导演转变为一位实时互动导演,使其能够即时响应你的指令,同时不损失其艺术质量。

以下是 minWM 的工作原理,分解为简单步骤:

1. 问题所在:“慢导演”

当前的视频 AI 模型就像这位慢导演。他们擅长制作精美的视频,但却是双向的。这意味着他们会同时审视视频的开头、中间和结尾,以确保一切完美契合。

  • 问题: 如果你想在实时中移动镜头或改变场景,这种模型无法快速做到。在向你展示第一帧画面之前,它需要花费太长时间来“思考”整个视频。

2. 解决方案:minWM“训练营”

minWM 是一个全栈框架(一套完整的工具集),它利用现有的慢导演,将其训练成快速、互动的表演者。它主要通过两个阶段来实现:

第一阶段:学习移动镜头(“镜头控制”课程)

首先,该框架教导慢导演如何遵循具体的镜头指令。

  • 类比: 想象教导导演如何在稳定器上持握摄像机。与其只是猜测摄像机应该放在哪里,他们学会了遵循你为他们绘制的精确路径。
  • 方法: 团队使用了一种名为 PRoPE 的特殊技术。这就像给导演戴上一副“智能眼镜”,能精确理解摄像机在三维空间中的位置。他们在摄像机运动完全已知(如 3D 动画)的视频上进行练习,因此导演学会了“向左移动”与“视角向左偏移”之间的确切关系。

第二阶段:加速过程(“蒸馏”课程)

现在导演已经能够跟随镜头移动,但他们仍然太慢。在展示任何一帧之前,他们仍然要规划整部电影。minWM 使用一种名为**因果强制(Causal Forcing)**的技术来加速他们。

  • 类比: 想象一名学生(新快速模型)坐在一位大师级教师(慢速、高质量模型)旁边。
    1. 教师强制(Teacher Forcing): 学生学会逐句(逐帧)地编写故事,而不是一次性规划整本书。这使他们变得更快。
    2. “小抄”(蒸馏): 为了让学生的速度更快,他们被训练跳过步骤。与其用 50 个小步骤来绘制一幅画,他们学会仅用 4 个大而自信的笔触来完成。
    3. 安全网(非对称 DMD): 加速存在风险,学生可能会开始画出杂乱的图画。为了解决这个问题,学生会偶尔对照原始大师教师检查他们的工作。如果学生的快速绘画看起来有点不对劲,教师会温和地纠正他们,确保最终结果仍然保持高质量。

3. 结果:从“电影”到“电子游戏”

论文表明,这一过程效果极佳:

  • 速度: 新模型展示第一帧的速度比原始慢模型快 200 多倍
    • 之前: 你需要等待超过 10 秒才能看到第一帧。
    • 之后: 你在大约 1 秒内就能看到第一帧。
  • 控制: 快速模型仍然可以完美遵循你的镜头指令。你可以让视频“向左平移”或“放大”,它会立即发生。
  • 灵活性: 团队在两种不同类型的“导演”(Wan2.1 和 HY1.5 模型)上测试了这一点,两者都有效,证明该方法是一个通用工具箱,而不仅仅是一次性修复。

4. 重要经验教训(“消融研究”)

论文还分享了他们在构建过程中发现的一些实用技巧,这些对于任何试图这样做的人来说就像是“经验法则”:

  • 优质数据是关键: 你不能仅凭模糊的、猜测的镜头运动来教导导演。你需要“真实值”数据——即摄像机路径在数学上完美的视频(如 3D 重建)。如果你使用杂乱的数据,导演就会感到困惑。
  • 熟能生巧: 导演需要训练一段时间(大约 8,000 步),才能真正理解如何移动镜头。如果你过早停止,他们将无法听从你的指令。
  • 不要吝啬班级规模: 你需要足够数量的示例(“批量大小”)供导演学习。如果班级太小(少于 4 个示例),他们将无法学会镜头移动。

总结

minWM 是一个开源方案,它将高质量但缓慢的视频 AI 转变为实时、互动的视频引擎。它教导 AI 遵循镜头指令,然后加速使其能够在你观看的同时生成视频,从而使构建交互式视频世界(如电子游戏或实时模拟)成为可能,而这是以前的标准视频 AI 无法实现的。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →