← 最新の論文
💻 computer science

OmniForcing: Unleashing Real-time Joint Audio-Visual Generation

OmniForcing は、双方向依存による遅延を克服し、非対称ブロック因果整合やオーディオシンクトークンなどの新技術を用いて、高品質なリアルタイム音声・映像生成を実現する初のフレームワークです。

原著者: Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

公開日 2026-03-13
📖 1 分で読めます☕ さくっと読める

原著者: Yaofeng Su, Yuming Li, Zeyue Xue, Jie Huang, Siming Fu, Haoran Li, Ying Li, Zezhong Qian, Haoyang Huang, Nan Duan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

この論文は、**「OmniForcing(オムニフォーシング)」**という新しい技術について書かれています。

一言で言うと、**「これまで『完成してから再生』しかなかった、映像と音声を同時に作る AI を、まるでライブ配信のように『リアルタイムで流しながら』作れるようにした」**という画期的な研究です。

難しい専門用語を使わず、日常の例え話を使って解説しますね。


1. 従来の問題点:「完璧な料理」を作るには時間がかかりすぎる

これまでの最高峰の AI(LTX-2 など)は、映像と音声を同時に作るのが得意でした。しかし、その仕組みには大きな欠点がありました。

  • 例え話:
    想像してください。ある料理人が、1 時間分の料理を作るために、**「最初から最後まで全ての食材を一度にテーブルに並べ、全体を見渡してから、一口ずつ味見しながら調理する」**とします。
    • メリット: 出来上がりの味は最高級です。
    • デメリット: 最初の一口が出るまで、**197 秒(約 3 分半)**も待たなければなりません。
    • 現実: これでは、ライブ配信やゲームのように「今すぐ反応したい」場面には使えません。

2. OmniForcing の解決策:「流し作業」への転換

OmniForcing は、この「全体を見てから作る」方法を、「流れてくる食材をその都度調理して出す」方式に変えました。

  • 新しい仕組み:
    料理人が「全体を見渡す」のをやめて、**「1 秒分ずつの食材が流れてくるので、それを受け取って即座に調理し、次の瞬間に次の 1 秒分を作る」**というスタイルに変えたのです。
    • 結果: 最初の一口が出るまでの待ち時間が0.7 秒に短縮され、1 秒間に 25 枚の映像と音声を同時に作り出せるようになりました(これはテレビのフレームレートと同じ速さです!)。

3. 最大の難所と、3 つの「魔法の道具」

しかし、この「流し作業」への移行は簡単ではありませんでした。映像(3 枚/秒)と音声(25 枚/秒)では、情報の量が全く違うからです。これを解決するために、3 つの工夫がなされました。

① 「共通の土台」を作る(非対称ブロック・因果アライメント)

  • 問題: 映像はゆっくり、音は速く流れます。これを無理やり同じペースで合わせようとすると、音が欠けたり、映像がズレたりします。
  • 解決策: 「1 秒」という単位を共通の「箱(ブロック)」としました。
    • 映像は 1 秒に 3 個、音は 1 秒に 25 個入ります。
    • この「1 秒ごとの箱」を順番に繋げていくことで、映像と音が自然に同期するように設計しました。

② 「音のアンカー(錨)」を下ろす(オーディオ・シンク・トークン)

  • 問題: 音の情報は映像に比べて非常に細かいです。刚开始(最初の数秒)の音を作る際、AI は「過去の情報がほとんどない」状態で、パニックになって「何を作ればいいか?」と混乱してしまいました(これを「ソフトマックスの崩壊」と呼びます)。
  • 解決策: 「見えないけど、常に存在する『音のアンカー(錨)』」を最初から用意しました。
    • これは、実際の音ではありませんが、AI が「過去を忘れないように支えるための目印」です。
    • これがあるおかげで、AI は最初の数秒でも落ち着いて、安定した音を作れるようになりました。

③ 「自分自身で修正する」練習(ジョイント・セルフ・フォーシング)

  • 問題: 流し作業を長く続けると、小さな間違いが積み重なって、映像と音がズレてしまうことがあります(これを「露出バイアス」と呼びます)。
  • 解決策: 「練習中に、自分の作った間違いを直しながら進める」練習を取り入れました。
    • 先生(元の AI)の答えを見ながら、生徒(新しい AI)が「あ、ここズレてるな」と自分で気づいて修正する癖をつけさせたのです。これにより、長い動画を作ってもズレが起きません。

4. 結果:どうなった?

  • 速度: 197 秒かかっていたものが、5.7 秒で完了しました(約 35 倍の速さ!)。
  • 品質: 遅くなった代わりに画質や音質が落ちたか?というと、元の AI とほぼ変わらない高品質を維持しています。
  • リアルタイム性: 今、画面に映っている映像に合わせて、同時に音声が流れるような「ライブ感」が実現できました。

まとめ

OmniForcing は、「完璧な料理を作るために 3 分待たされる」時代から、「ライブキッチンで、流れてくる食材をその場で調理して、1 秒も待たずに提供できる」時代へと、映像と音声を作る AI を進化させた技術です。

これにより、将来の VR 会話、リアルタイムの動画生成、インタラクティブなゲームなど、「即座に反応する」マルチメディア体験が現実のものになることが期待されています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →