← 最新论文
💻 computer science

MobileWan: Closing the Quality Gap for Mobile Video Diffusion

MobileWan 引入了一种新颖的框架,通过循环重构、结构化注意力剪枝和蒸馏技术,使得在内存受限的移动设备上高效部署高质量的 5B 参数视频扩散 Transformer 成为可能,从而以低延迟实现了最先进的生成性能。

原作者: Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibi
发布于 2026-07-08
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohsen Ghafoorian, Denis Korzhenkov, Adil Karjauv, Ioannis Lelekas, Noor Fathima, Spyridon Stasis, Hanno Ackermann, Boris van Breugel, Markus Nagel, Fatih Porikli, Animesh Karnewar, Amirhossein Habibian

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你拥有一位大师级厨师(一个庞大、强大的 AI 模型),他能烹饪出令人惊叹的高清视频大餐。问题在于,这位厨师的厨房足有一个足球场那么大,需要一整仓库的食材。你想把这位厨师带到你的手机里,让他变成一个移动的小型餐车,在旅途中也能烹饪出同样美味的佳肴。

通常情况下,当你试图将一个巨大的厨师缩小到足以装进餐车时,你不得不解雇一半的员工并使用更小、更便宜的炉灶。结果是,食物还可以,但远没有在体育场版本中那样美味和细腻。

MobileWan 是团队给出的解决方案。他们不仅仅是缩小了厨师的体积,而是完全重新组织了厨房,使得那个拥有 50 亿参数的巨型“体育场厨师”(基于 Wan2.2 模型)能够在手机内高效运作,而不会耗尽空间或时间。

以下是他们是如何实现的,我们使用了简单的类比:

1. “内存黑洞”问题

视频 AI 模型通常试图同时记住视频中的每一帧,以保持动作流畅。在拥有巨大硬盘的电脑上,这没问题。但在手机上,这就像试图把一整个图书馆的书都装进兜里——这会导致手机崩溃(内存溢出)。

解决方法:“分块”策略
与其试图一次性记住整部电影,MobileWan 将视频分解成小的“块”(就像短场景)。它生成一个块,保存一个微小的摘要,然后移动到下一个块。

  • 类比: 想象你在写故事。你不需要把写过的每一个字都记在脑子里,而是写完一段,在便利贴上记下简短的摘要,然后继续写下一段。你只需要手里拿着这张便利贴,而不是拿着整本书。这让手机可以在不耗尽内存的情况下生成长视频。

2. “过度劳累的员工”问题

在 AI 内部,有很多“注意力头”(可以理解为观察视频的不同团队成员)。在一个 50 亿参数的模型中,有数百个这样的团队成员。其中一些工作出色,但许多人只是在重复别人的工作,或者几乎没做什么贡献。

解决方法:“精简裁员”
团队使用了一种特殊的方法,来识别哪些成员是必不可少的,哪些是可以被解雇的。

  • 类比: 想象一个由 100 人组成的委员会正在讨论菜单。团队发现其中 30 个人只是在点头附和或者重复同样的想法。于是,他们悄悄地移除了这 30 个人。剩下的 70 个人工作得更努力、更聪明,菜单(视频)依然非常美味,但会议速度更快,占用的空间也更少。

3. “烹饪太慢”问题

即使有了更小的团队和分块策略,制作一段 5 秒钟的视频通常仍需要 AI 进行 100 个步骤(就像吃一顿饭要吃 100 小口一样)。这对于手机来说太慢了。

解决方法:“快进食谱”
他们使用了名为“蒸馏”的技术。

  • 类比: 想象一个学生(移动端模型)正在向一位大师级老师(大型服务器模型)学习。与其让学生通过 100 个细小的步伐来学习一段舞蹈,老师直接展示了整段舞蹈,学生只需通过 3 个大而自信的步伐就能学会。动作效果是一样的,但速度快得多。

4. “模糊回放”问题

当你在手机上播放视频时,解码器(将 AI 的数学运算转化为实际图像的部分)有时会让动作看起来很卡顿或有闪烁感,就像糟糕的网络视频通话一样。

解决方法:“更好的相机镜头”
他们升级了解码器,使其在创建每一帧时能向过去回溯得更远。

  • 类比: 如果你在画一部电影,而你只看当前帧之前的紧邻那一帧,你的画作可能会看起来摇晃不稳。MobileWan 的解码器会回顾前 4 帧,以确保动作流畅,就像导演在检查前几组镜头以确保演员动作连贯一样。

结果

通过结合这些技巧,团队成功地将一个大规模、高质量的视频 AI 装进了由骁龙芯片驱动的商用智能手机中。

  • 性能: 它能在约 20 秒 内生成一段 5 秒钟的视频(分辨率为 480x832)。
  • 质量: 在测试中,生成的视频质量被评定为几乎与庞大的服务器版本一样高,并且在人类用户测试中,其表现比之前的最佳移动端模型高出 80%
  • 结论: 他们证明了你不需要牺牲质量也能在手机上实现视频 AI;你只需要让模型思考和记忆的方式变得更聪明。

简而言之,MobileWan 就像是将一艘豪华邮轮改装成一艘快艇,通过重新设计引擎、精简人员和优化航线,在不损失豪华体验的前提下实现了这一目标。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →