← 最新论文
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

本文介绍了 MOVA(MOSS Video and Audio),这是一个拥有 32B 参数量(推理时激活 18B)的开源混合专家(MoE)模型,能够实现高质量且音画同步的图像/文本到视听内容(IT2VA)生成。

原作者: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zh
发布于 2026-02-11
📖 1 分钟阅读☕ 轻松阅读

原作者: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

这是一篇关于人工智能领域非常前沿的研究论文。如果要把这个复杂的“MOVA”模型讲给普通人听,我们可以把它想象成一个**“正在学习如何演戏的超级数字演员”**。

以下是通俗易懂的解读:

1. 核心问题:以前的 AI 像是在“默片时代”演戏

想象一下你看一部电影,画面很精彩,但声音和画面完全对不上:主角明明在说话,声音却像是在隔壁房间传来的;或者主角明明在打鼓,声音却像是在切菜。

以前的 AI 生成视频,通常是“分两步走”:先用一个模型画出视频(像是在拍默片),再用另一个模型配音(像是在后期配音)。这两者之间没有“眼神交流”,所以很难做到完美的同步,尤其是说话时的嘴型(Lip-sync)。

2. MOVA 是什么?:一个“身心合一”的超级演员

MOVA(MOSS Video and Audio)不再是分两步走,它采用了一种**“身心合一”**的训练方式。

  • 比喻: 以前的 AI 像是“画师”和“乐师”各干各的;而 MOVA 就像是一个真正的演员。当这个演员在表演时,他的大脑(视频模型)和嗓子(音频模型)是实时连接在一起的。他一边思考动作,一边控制声带,动作和声音是同时产生的,自然而然就达到了“声画同步”。

3. 它是怎么做到的?(三个黑科技)

① “双塔结构”与“桥梁” (Dual-Tower & Bridge)

  • 比喻: 我们可以把 MOVA 想象成两个天才:一个是视觉天才(负责看和画),一个是听觉天才(负责听和唱)。
  • 为了让他们配合,研究人员在他们之间搭了一座**“超级桥梁”**(Bridge Module)。通过这座桥,视觉天才可以告诉听觉天才:“嘿,我现在要张嘴说话了,你准备好声音!”听觉天才也可以告诉视觉天才:“我要发出一声巨响了,你记得让画面抖一下!”

② “对齐的罗盘” (Aligned RoPE)

  • 比喻: 视频和音频的“节奏”是不一样的。视频是按帧跳动的,音频是连续的波浪。如果节奏对不上,就会出现“音画错位”。
  • 研究人员给他们装了一个**“同步罗盘”**,确保无论视频跳得多快,音频都能精准地踩在同一个时间点上,就像交响乐团里的指挥家,让所有人都在同一个节拍上。

③ “魔鬼训练营” (Data Engineering)

  • 比喻: 要想成为顶级演员,得看海量的优秀剧本。
  • 研究团队并没有随便找点视频就喂给 AI,而是建立了一个**“超级筛选流水线”**。他们用 AI 去检查成千上万小时的视频:这个视频画质好吗?声音清晰吗?声音和画面对得上吗?只有那些“演技精湛、声画完美”的素材,才会被选进“训练教材”里。

4. 它能做什么?(超能力展示)

  • 精准对口型: 不管是说中文还是英文,嘴型都能跟上说话的内容,不再有“假人感”。
  • 环境音感知: 如果画面里有人在森林里走,它能自动配上踩在落叶上的“沙沙”声,而不是干巴巴的背景音乐。
  • 文字变影音: 你只要输入一句话(比如“一个女孩在雨中奔跑”),它就能直接给你一个既有雨声、又有脚步声、画面还极其真实的短片。

5. 总结

MOVA 的意义在于:它打破了“看”与“听”的界限。

它证明了:如果我们让 AI 在学习时就同时理解视觉和听觉,它就能创造出真正具有“生命感”的内容,而不仅仅是两个不同模态的简单拼接。这为未来的虚拟电影、游戏和元宇宙技术打开了一扇巨大的门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →