← 最新の論文
💻 computer science

MOVA: Towards Scalable and Synchronized Video-Audio Generation

MOVAは、高品質で同期した映像と音声を同時に生成可能な、32BパラメータのMoE(Mixture-of-Experts)アーキテクチャを採用したオープンソースのマルチモーダル生成モデルです。

原著者: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zh
公開日 2026-02-11
📖 1 分で読めます☕ さくっと読める

原著者: OpenMOSS Team, Donghua Yu, Mingshu Chen, Qi Chen, Qi Luo, Qianyi Wu, Qinyuan Cheng, Ruixiao Li, Tianyi Liang, Wenbo Zhang, Wenming Tu, Xiangyu Peng, Yang Gao, Yanru Huo, Ying Zhu, Yinze Luo, Yiyang Zhang, Yuerong Song, Zhe Xu, Zhiyu Zhang, Chenchen Yang, Cheng Chang, Chushu Zhou, Hanfu Chen, Hongnan Ma, Jiaxi Li, Jingqi Tong, Junxi Liu, Ke Chen, Shimin Li, Shiqi Jiang, Songlin Wang, Wei Jiang, Zhaoye Fei, Zhiyuan Ning, Chunguo Li, Chenhui Li, Ziwei He, Zengfeng Huang, Xie Chen, Xipeng Qiu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

タイトル:動画と音の「完璧な合奏」を実現する魔法の指揮者「MOVA」

1. 今までの問題:バラバラな演奏者

想像してみてください。あなたは素晴らしいオーケストラの演奏を聴きたいと思っています。でも、これまでのAI技術は、**「バイオリン奏者(動画担当)」「ドラマー(音響担当)」**が、全く別の部屋にいて、お互いの顔も見えず、リズムも確認できない状態で演奏しているようなものでした。

バイオリン奏者は一生懸命に弾いていますが、ドラマーはそれとは違うテンポで叩いています。その結果、動画を見ても「音が少し遅れて聞こえる」「口の動きと声が合っていない」といった、なんだか違和感のある(ズレた)コンテンツが出来上がってしまっていました。

2. MOVAの解決策:最強の「指揮者」と「二人の天才」

そこで登場したのがMOVAです。MOVAは、バラバラだった奏者たちを一つのステージに集め、さらにその中心に**「超高性能な指揮者」**を配置しました。

  • 動画の天才(140億の脳細胞): 映像をリアルに描くプロ。
  • 音の天才(13億の脳細胞): 音をリアルに鳴らすプロ。
  • 指揮者(Bridgeモジュール): 二人の天才が「今、この瞬間に何をすべきか」を常に教え合うための橋渡し役。

この指揮者がいるおかげで、バイオリンの弦が震える瞬間に、正確にその音を鳴らすことができます。例えば、誰かが「こんにちは」と言ったとき、唇の動きと声がコンマ数秒の狂いもなくピタッと重なるのです。

3. MOVAのすごいところ(3つの魔法)

① 「耳」と「目」が同じリズムで動く(Aligned RoPE)
人間は目で見ているものと耳で聞いているものを、一つの「時間」として捉えています。MOVAは、映像のフレーム(コマ)と音の波形を、同じ「リズムの物差し」で測る仕組みを持っています。これにより、映像の動きと音のタイミングがズレるのを防いでいます。

② 段階的な特訓(Progressive Training)
いきなり難しい曲を演奏させるのではなく、MOVAはステップアップ形式で練習しました。

  • ステップ1: まずは低い解像度で、音と映像の「なんとなくのタイミング」を覚える。
  • ステップ2: 次に、より高品質なデータを使って「音の質感」を磨く。
  • ステップ3: 最後に、超高画質な映像で「細部まで完璧な演技」を仕上げる。
    この練習方法のおかげで、非常に高いクオリティに到達しました。

③ 魔法の「指示出し」機能(Dual CFG)
ユーザーが「キラキラした海辺で、子供が笑っている動画を作って」と頼んだとき、MOVAは「映像の美しさ」と「音の正確さ」のバランスを、まるで音量つまみを回すように調整できます。「映像をよりドラマチックにしたい時」や「音のタイミングをより厳密にしたい時」など、自由自在にコントロールできるのです。

4. まとめ:何が変わるのか?

MOVAが登場したことで、私たちは「言葉を入力するだけ」で、まるで映画のワンシーンのような、**「音と映像が魂でつながった」**リアルな動画を簡単に作れるようになります。

それは、ただの動画ではありません。キャラクターが本当に喋っているように見え、環境の音がその場の空気感まで伝えてくる、**「命が吹き込まれたデジタル世界」**の始まりなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →