InteractGesture: Progressive Chunk Guidance for Continuous Streaming Co-Speech Gesture Control
本論文は、境界における不整合を解消するためにチャンク間に制御勾配を伝播させるProgressive Chunk Guidanceを用いることで、連続的なストリーミング・シナリオにおいてきめ細かく空間的に制御可能な共話ジェスチャー生成を可能にする、モデルに依存しない推論時の手法であるInteractGestureを提案する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
デジタルヒューマンがあなたに話しかけている姿を想像してみてください。その唇は言葉に合わせて完璧に動き、手はポイントを強調するように自然にジェスチャーを交えています。長年、科学者たちは音声を聞くことでこうした動きを作り出すようコンピュータに教えてきました。その結果、キャラクターは驚くほどリアルに話し、動くことができるようになりました。しかし、重大な限界が依然として存在していました。コンピュータはキャラクターに手を振らせたり肩をすくませたりする方法は知っていても、その手が空間内の「どこ」に着地すべきかを正確に指示することはできなかったのです。もしアニメーターが、キャラクターの右の手首をテーブルの上の特定の物体に触れさせたい、あるいは肘が障害物を避けるために正確な経路を辿るようにしたいと考えたとしても、既存の技術ではそれに応えることができませんでした。動きは全体として生成されるため、個々の身体部位の具体的な位置は、命令による制御ではなく偶然に委ねられていたのです。自然な音声駆動の動きと、精密な空間制御との間のこの溝は、真にインタラクティブなバーチャルエージェントを作成する上での大きな障壁となっていました。
Metaとノースカロライナ大学シャーロット校の研究者によって導入された新しい手法「InteractGesture」は、この溝を埋めるものです。このシステムは、音声に基づいてキャラクターのジェスチャーを生成すると同時に、手首や肘といった特定の関節がどこに行くべきかという厳格な指示に従うことを可能にします。研究者たちは、コンピュータの動きの生成器を、優しく誘導できる「ブラックボックス」として扱いました。システム全体を再学習させたり内部の脳を変更したりする代わりに、彼らはコンピュータの予測をリアルタイムで調整しました。システムが動きを計画する際、研究者たちはそれらの計画を3Dスケルトンへとデコードし、手が正しい位置にあるかを確認し、もしそうでなければ、計画を望ましい場所へと押し戻してから最終決定を下します。このプロセスは非常に迅速に行われるため、コンピュータは音声の自然なリズムと、ユーザーの空間的な指示という厳格な要求との間でバランスを取ることを学習します。
音声が短いクリップではなく、長い会話のように連続している場合、課題は大幅に難しくなります。コンピュータは通常、長い音声を、重なり合う小さなセグメント(チャンク)として処理します。以前は、一度セグメントが生成されると、それは固定されてしまいました。もしユーザーがキャラクターの手を次のセグメントでターゲットに到達させたいと思っても、コンピュータはスムーズな遷移を実現するために前のセグメントの動きを調整しに戻ることができませんでした。これはしばしば、手が突然位置にスナップするような、ぎこちなく不自然なジャンプを引き起こしました。研究者たちは、この過去の動きを固定してしまう性質が、これらのエラーの主な原因であることを特定しました。これを解決するために、彼らは「Progressive Chunk Guidance(漸進的チャンク・ガイダンス)」と呼ばれる戦略を開発しました。過去を凍結させるのではなく、この手法は直近の動きの小さなウィンドウを編集可能な状態に保ちます。新しい音声が入ってくるにつれ、システムは前のセグメントのコンテキストを継続的に更新し、将来の指示が過去の動きを緩やかに整列へと導けるようにします。これは、映画を撮影しながら同時に編集しているようなもので、監督は映画全体が終わるのを待つことなく、次のステップが完璧に着地するように、俳優の前のステップを調整することができるのです。
このアプローチの結果は、記録された人間の音声と動きの膨大なデータセットを用いてテストされました。チームは、動きが生成された後に関節を強制的に位置させる一般的な手法や、各セグメントを独立して制御しようとする手法を含む、古い手法と比較を行いました。古い手法は、動きが硬かったり不自然に見えたりすることが多く、あるいはターゲットの位置に到達できず、場合によっては20センチ近くも目標を外してしまうことがありました。対照的に、新しい手法は、元の音声駆動のジェスチャーが持つ流動的で自然な質を維持しながら、平均誤差わずか6センチ強を達成しました。システムは、キャラクターの手を特定の点へと導き、腕の複雑な経路を辿らせ、さらにはキャラクターを特定の方向に向かせるところまで、音声のタイミングと動きのタイミングを完璧に同期させたまま成功させました。
この研究は、音声駆動のアニメーションが持つ自然な流れと、人間のアニメーターによる精密な制御の両立が可能であることを示しています。コンピュータが生成中に自らの計画を洗練させることを可能にし、かつ将来の指示に適応できるよう直近の過去を柔軟に保つことで、研究者たちは、動きの生命力溢れる質を損なうことなく、ユーザーの空間的なコマンドを尊重するシステムを作り上げました。この知見は、デジタルヒューマンが、実演家と同じレベルの詳細さで指示を受けることが可能であることを示唆しており、仮想の物体と相互作用したり、複雑な環境をナビゲートしたりする際にも、以前は手の届かなかったレベルの精密さを備えることができるようになることを示しています。研究者たちはこれらのツールを他の人々が利用できるように公開しており、将来のよりインタラクティブで応答性の高いバーチャルアシスタントやキャラクターへの扉を開いています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。