← 最新の論文
💻 computer science

GestureFM : Compact Latent Flow Matching for Low-Latency Co-Speech Body-Motion Generation

GestureFMは、SMPL-Xポーズを潜在空間へと圧縮し、チャンク境界の不連続性を解消する軽量なスムーザーを採用することで、最小限の初回チャンク遅延で競争力のあるモーション品質を実現し、低遅延かつ高品質な音声同期型身体動作生成を可能にするコンパクトな潜在フローマッチングフレームワークである。

原著者: Jie Liu, Tianmei Sun, Zian Liu

公開日 2026-08-14
📖 1 分で読めます☕ さくっと読める

原著者: Jie Liu, Tianmei Sun, Zian Liu

原論文は CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人と話している場面を想像してみてください。あなたが話すにつれて、手や腕、そして体が自然に言葉に合わせて踊るように動いています。これは「共起ジェスチャー(co-speech gesture)」と呼ばれ、人間がコミュニケーションをとる上で非常に重要な要素です。では、ビデオゲームのキャラクターやバーチャルアシスタントが同じことをしたいと考えている場面を想像してみてください。課題は、コンピュータがあなたの声を聴き、何を言っているかを理解し、即座にキャラクターの体をその言葉に合わせて動かさなければならないということです。しかし、ここで問題が発生します。もしコンピュータが、あなたが文章を最後まで言い終えるのを待ってから動き始めると、キャラクターは常に一歩遅れているロボットのように見えてしまいます。リアルに感じさせるためには、あなたがまだ話している最中に、コンピュータが動き始める必要があります。これが「低レイテンシ・ストリーミング生成(low-latency streaming generation)」、つまりラグなしでデジタルヒューマンをリアルタイムに動かすという世界です。

これを行うために、科学者たちは特別な数学のトリックを使います。一つのトリックは「変分オートエンコーダー(VAE)」と呼ばれるもので、これは超効率的な圧縮アプリのようなものです。複雑で巨大な3Dの身体の動きを、コンピュータが扱うのがはるかに容易な、小さく単純なコード(「潜在空間」)へと凝縮します。もう一つのトリックは「フロー・マッチング(Flow Matching)」です。これは、ランダムな落書きから完璧な絵へと、まっすぐで滑らかな線を引くようなものです。ぼやけた絵を描くアーティストのようにステップごとに推測するのではなく、フロー・マッチングは取るべき正確な経路を学習するため、コンピュータは最終的な画像を非常に素早く描くことができます。研究者たちが解決しようとしている大きな問いは、「これらのツールを組み合わせることで、私たちが話している間でも、デジタルヒューマンを非常に速く、かつ滑らかに動かし、まるでそこに実在しているかのように感じさせることができるか?」ということです。

そこで、まさにその問いに答えようとする新しい研究、GestureFMが登場しました。研究者のJie Liu、Tianmei Sun、Zian Liuは、遅延をほとんど感じさせずに身体の動きを音声から生成するように設計されたシステムを構築しました。彼らは、圧縮された「潜在(latent)」空間の中でこの「フロー・マッチング」の魔法を使用していることから、このシステムを「GestureFM」と呼んでいます。

このシステムの仕組みを、簡単な例えで説明しましょう。電話越しに友人にダンスを説明しようとしている場面を想像してください。ただし、あなたは一度に1秒間の短い音声クリップしか送ることができません。あなたの友人は、今までに聞いた音に基づいて、すぐに踊り始めなければなりません。GestureFMは、この作業が非常に得意な「友人」なのです。まず、「Gesture VAE」を使用して、人間の身体の複雑な168次元の動き(関節の角度など)を、わずか44個のトークンによる小さなコードへと翻訳します。これは、長編映画を数枚の素早いスケッチノートに変換するようなものです。次に、「オーディオ条件付きフロー・マッチング・トランスフォーマー」があなたの声(具体的にはLog-Mel特徴と呼ばれる音のパターン)を聴き、それらのスケッチノートを使用して、次の1秒間の動きを描き出します。

彼らの発見の中で最もエキサイティングな部分は、その速さと効率性です。チームは、最初の動きの塊(チャンク)をわずか22ミリ秒で生成できることを発見しました。これを比較するために言えば、これは実時間の0.022倍の速度です。つまり、コンピュータは現実世界の約45倍の速さで動作しており、あなたが話している間、動きが即座に起こるための十分な余裕があることを意味します。

彼らはまた、コンピュータが動きを描くために何「ステップ」を必要とするかもテストしました。多くのAIシステムでは、ステップ数を増やすほど良い絵になりますが、速度は低下します。しかし、GestureFMは驚くべき発見をしました。ステップ数を増やしても、動きの質はそれほど向上しないのです。ステップ数が2ステップであっても32ステップであっても、動きの質(FGDと呼ばれるスコアで測定)はほぼ全く変わりませんでした。このため、彼らは、品質を損なうことなく可能な限り最速の速度を得るために、わずか2ステップ(K=2)を使用することを推奨しています。

ただし、一つだけ小さな不具合がありました。システムは1秒ごとの動きの塊を生成するため、一つの塊と次の塊の間の移行が、時々ビデオがカクつくように少しぎこちなく感じられることがありました。これを修正するために、彼らは「7フレームのローカル・スムーザー(local smoother)」を追加しました。これは、前の1秒間の動きの終わりと次の1秒間の始まりを優しくブレンドする、小さな編集者のようなものです。このシンプルな修正により、「速度の跳ね上がり(velocity jump)」(突然のぎこちなさ)が**85%**減少しました。これにより、音楽とのタイミングを崩すことなく、動きをより滑らかにすることができました。

研究者たちは、さらに改善できるかどうか、他のアイデアもいくつかテストしましたが、いくつかの手法は却下されました。例えば、前の動きの塊の終わりを次のものに渡すことで、システムに「記憶」を持たせようとしました。残念ながら、これによって動きの質は大幅に悪化してしまいました(FGDスコアが0.253から1.740へと跳ね上がりました)。彼らは、システムが完璧な現実世界の動きのデータで訓練されている一方で、テスト中に自分自身の「記憶」を使おうとすると、自分自身のミスによって混乱してしまうのだと気づきました。そのため、現時点では各チャンクを独立させておき、端の部分を修正するためにスムージングのテクニックを使用する方が良いという結論に至りました。

結局のところ、GestureFMは、文章の終わりを待つことなく、高品質で低レイテンシな身体の動きをバーチャルヒューマンのために作成できることを示しています。データを圧縮し、フロー・マッチングを使用し、シンプルなスムージング・フィルターを加えることで、彼らは、非常に高速(22msのレイテンシ)でありながら、音声のリズムに完璧に一致する、非常に正確なシステムを実現しました。これは、デジタルヒューマンがただ話すだけでなく、リアルタイムで私たちと共に真に動くための大きな一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →