← 最新の論文
💻 computer science

InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars

InteractiveAvatarは、自己回帰蒸留、長短視覚メモリメカニズム、および推論・反応モジュールを活用することで、音声駆動型アバターに対して最先端の視覚的一貫性と意図を認識したインタラクションを実現する、リアルタイムかつ無限ストリーミング可能なビデオ生成フレームワークです。

原著者: Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

公開日 2026-06-23
📖 1 分で読めます☕ さくっと読める

原著者: Quanyue Song, Yishan He, Yanfei Zhang, Shihao Cheng, Zhixiang He, Zhizhi Guo, Chi Zhang, Xuelong Li, Caigui Jiang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ビデオ通話でデジタルな友人と話している場面を想像してみてください。通常、こうしたデジタルな友人は、少し壊れた操り人形のようなものです。あなたの声に合わせて唇の動きは完璧に合わせられるかもしれませんが、長く話し続けていると、顔が変に見え始めたり、5分前に自分がどんな姿だったのかを忘れてしまったりすることがあります。また、もしあなたが「時間を確認して」と言ったとしても、彼らはただ時間を口に出して言うだけで、実際に時計を見ることはできず、ただぼんやりと見つめたままかもしれません。

論文「InteractiveAvatar」は、これらのデジタルな友人が、見た目が崩れることなく永遠にあなたと話し続け、さらにあなたが指示したことを実際に「実行」できるようにするための、新しい構築方法を紹介しています。

以下に、その仕組みを簡単な比喩を用いて説明します。

1. 問題点:「記憶喪失」と「ロボット」

著者らは、現在のデジタルアバターには主に2つの問題があると述べています。

  • 「漂流する」顔: ビデオを長時間流し続けていると、アバターの顔が徐々に変化し始めます。例えば、目が大きくなったり、髪の色が変わったりすることもあります。これは、元のスケッチを見ずに新しい絵の具を塗り重ね続ける画家のようで、最終的には、最初に描いた人物とは似ても似つかない姿になってしまいます。
  • 「盲目の」ロボット: 現在のアバターは、主に「音声駆動」です。もしあなたが「時計を見て」と言ったとしても、彼らはその音を聞いて口を動かしますが、その「意味」までは理解していません。彼らは、あなたのリクエストについて「考える」ことができないため、実際に時計を見るために頭を動かすことはありません。

2. 解決策:二部構成の脳

この問題を解決するために、チームは2つの特別なツール、すなわち「メモリシステム」と「思考する脳」を構築しました。

メモリシステム:「短期的なノート」と「長期的なフォトアルバム」

アバターの顔が漂流するのを防ぐために、彼らは**長短視覚メモリ(LSVM)**と呼ばれるものを作成しました。

  • 短期的なノート: アバターが直近数秒間のビデオをノートに記録していると考えてください。これにより、頭を動かすときも、動きがぎこちなくなることなく、スムーズで自然に見えるようになります。
  • 長期的なフォトアルバム: これが巧妙な部分です。アバターはすべてのフレームを記憶しようとする(それは重すぎて動作が遅くなるため)のではなく、最も重要な瞬間を収めた「フォトアルバム」を持っています。
    • 仕組み: ビデオが再生されるにつれ、システムは常に「この新しいフレームは重要か?」と問いかけます。もしアバターが帽子を被ったり、コーヒーカップを手に取ったりすれば、システムはその「スナップショット」を撮ってアルバムに入れます。もしアサーがただ座って話しているだけなら、スナップショットの作成はスキップされます。
    • メリット: これは「錨(いかり)」のような役割を果たします。10分間話し続けても、アバターは自分の「アルバム」を振り返って、「ああ、そうだ、私は帽子を被っていた」「コーヒーカップを持っている」と思い出すことができます。これにより、キャラクターは最初から最後まで一貫した姿を保つことができます。

思考する脳:「ディレクター」と「ステージマネージャー」

アバターにあなたの意図を理解させるために、彼らは**推論・反応モジュール(RRM)**を追加しました。

  • ディレクター(LLM): あなたが話すと、強力なAI「ディレクター」があなたの言葉を聞きます。それは単に言葉を聞くのではなく、あなたの「意図」を理解します。もしあなたが「時間を確認して」と言えば、ディレクターは「ああ、ユーザーはアバターに時計を見ることを求めているのだ」と理解します。
  • 状態のサイクリング(State Cycling): システムは2つのモードを切り替えます。
    1. アクションモード: アバターが何か(時計を見る、座るなど)を行っている状態です。
    2. 安定モード: アクションが終わると、アバターは穏やかなポーズ(静かに座っているなど)に戻ります。これにより、不必要な動きを続けることがなくなります。
  • 高速切り替え(Cache-Switching): 通常、指示が変わるとコンピュータはすべてを再計算する必要があり、時間がかかります。このシステムは「高速切り替え」というトリックを使用します。現在のシーンの計算結果をバックアップとして保持しておきます。指示が変わったとき(例:「立つ」から「座る」へ)、古いバックアップを新しいものへと瞬時に入れ替えることで、反応を即座かつスムーズにします。

3. 結果:リアルタイムで無限の会話

これらのツールを、特別な学習方法(蒸留/Distillation。これは、学生に問題を1ステップではなく10ステップかけて解かせる代わりに、1ステップで解けるように教えるようなものです)と組み合わせることで、彼らは以下の特徴を持つシステムを作り上げました。

  • リアルタイムで動作: あなたが話しかけると、アバターは長い待ち時間なしに即座に反応します。
  • 永遠に続く: 何時間でも会話を続けることができ、アバターは同じ人物、同じ服装、同じアクセサリーの姿を保ち続けます。
  • あなたを理解する: もしあなたが何か行動をするよう頼めば、アバリーは単にそれについて話すだけでなく、実際にその行動を実行します。

要約すると: InteractiveAvatarは、デジタルな操り人形に、自分の顔を忘れないための長期記憶と、あなたの冗談やリクエストを理解する脳を与えることで、スムーズで無限、そしてリアルな会話を可能にするものです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →