← 最新の論文
💻 computer science

OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars

OmniMateは、適応的な応答進行のための生成プログレスコントローラーと、長期的なクロスモーダルなアイデンティティの一貫性を確保するためのマルチリファレンス・コンディショニング・モジュールを導入することにより、高品質かつ低遅延でオープンエンドなリアルタイム・ストリーミング・オーディオビジュアル・アバター生成を可能にする統合フレームワークである。

原著者: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

公開日 2026-07-29
📖 1 分で読めます☕ さくっと読める

原著者: Quanyue Song, Yishan He, Yanbo Ding, Zhixiang He, Yongxiang Li, Caigui Jiang, Zhi Zhi Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピューター画面の中に住んでいる友人に、ただ話すだけでなく、まるで実在の人物のように、リアルタイムで手を動かし、瞬きをし、あなたの声に反応してほしいと想像してみてください。これは「インタラクティブ・アバター」という夢の姿です。長い間、こうしたデジタルキャラクターを作ることは、映画を撮影することに似ていました。再生ボタンを押す前に、すべてのセリフとジェスチャーをあらかじめ計画しておく必要があったのです。しかし最近、科学者たちは「拡散モデル(diffusion models)」を構築しました。これは、テキストから高品質なビデオや音声を瞬時に生成できる、魔法の絵筆のようなものです。この技術は非常に進化しており、キャラクターが音声に合わせて話し、動くことができるようになりました。しかし、一つ問題があります。これらのモデルは通常、会話が正確にどのくらいの長さになるのかを知っている場合に最もよく機能します。もし、コンピューターがいつ話し終えていつ聞き始めるべきかを推測しなければならないような、自由な流れのチャットをしようとすると、キャラクターは混乱し、話しすぎてしまったり、数分後には別人のようになってしまったりすることがあります。この論文は、まさにその問題に取り組んでいます。つまり、顔や声を変えることなく、遅延することなく、あなたと永遠にチャットができるデジタルな友人をどのように作るか、という問題です。

このプロジェクトの背後にいる研究者たち、すなわち西安交通大学とチャイナテレコムのチームは、「OmniMate」と呼ばれる新しいシステムを構築しました。OmniMateを、終わりのない会話を扱うことができる超スマートなデジタル・パペッティア(人形使い)だと考えてください。会話が長くなったり、ユーザーが話を遮ったりしたときに躓いてしまう従来のシステムとは異なり、OmniMateは、キャラクターの外見と声を全く変えることなく、瞬時に「話す」モードと「聞く」モードを切り替え、自然に流れるように設計されています。

OmniMateが成功した秘密は、常に機敏に動くために使用している2つの巧妙なトリックにあります。第一に、**生成進行制御(GPC: Generation Progress Controller)**と呼ばれるものを使用しています。物語の本を読んでいる場面を想像してください。残りのページ数がわからない場合、通常、あなたは最後まで読み進めてしまったり、早すぎるタイミングで止まってしまったりします。GPCは、アバターに対して、生成されるレスポンスのどれくらいが残っているかを伝える、組み込みのページカウンターのようなものです。これは、作成されるビデオと音声のあらゆる小さな塊に対して「プログレスバー」を提供します。これにより、アバターは正確にいつ文章を終え、次にあなたの入力を待つための「聞き手」のポーズへとスムーズに切り替えるべきかを知ることができます。これがないと、アバターは話し終えた後も話し続けたり、不自然に固まったりしてしまうかもしれません。

第二のトリックは、**マルチリファレンス・コンディショニング・モジュール(MRCM: Multi-Reference Conditioning Conditioning Module)**です。人の写真を奇妙な角度から見たとき、その人が少し違って見えることがあるのに気づいたことはありませんか?長いビデオでは、デジタルアバターはしばしば「アイデンティティの漂流(identity drift)」、つまり顔が徐々に別人のように変化したり、声のピッチが変わったりするという現象に陥ります。OmniMateは、キャラクターが誰であるかを常に自分自身に思い出させることで、これを解決します。ビデオの最初のフレームだけを見るのではなく、複数の参照写真とキャラクターの声のサンプルを含む「メモリバンク(記憶の貯蔵庫)」を保持します。ビデオが再生される間、システムはこれらのリファレンスを絶えずチェックします。それは、画家が鼻や目が正しいかどうかを確認するために、何度も肖像画を見直すようなものであり、10秒間話していても10分間話していても、キャラクターの外見と声が同じであることを保証します。

チームは、実際の会話をシミュレートするVerseBenchというベンチマークでOmniMateをテストしました。その結果は目覚ましいものでした。システムは、27.64フレーム/秒(FPS)の速度でビデオと音声を生成でき、「Time-to-first-frame」(ビデオを表示し始めるまでの時間)はわずか3.49秒でした。これは、実際のライブ会話のように感じられるほど高速です。テストにおいて、OmniMateは長期間にわたってキャラクターの顔と声を一定に保つという点で、他のトップモデルを上回りました。他のシステムが1分後にはぼやけ始めたり声が変わったりする可能性がある一方で、OmniMateは最大240秒に及ぶテストでも安定していました。

しかし、著者たちは、このシステムがまだ完璧ではないことも注意深く述べています。もしシステムがレスポンスの時間を誤って予測した場合、アバターが言葉を途切れさせたり、繰り返ししまったりすることがあります。また、キャラクターが外見を劇的に変えるような行動(例えば、大幅な衣装替えなど)をする必要がある場合、システムは一貫性を保つのが難しくなる可能性があります。しかし全体として、OmniMateは大きな前進を示唆しています。それは、リアルタイムで私たちとチャットができ、自分が誰であるかを記憶し、過去のぎこちないグリッチ(不具合)なしに私たちに反応してくれるデジタルな友人と出会うための道筋です。それは、今日の静的で計画されたビデオを、明日のダイナミックで生き生きとした会話へと変えるものなのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →