← 最新の論文
💬 NLP

SeMoCo: A Semantic-First Motion Codec for Motion Language Modeling

本論文は、再構成精度と言語条件付きモーション生成の両方を向上させるために、モーション・トークンをセマンティック成分とキネマティック成分に分離するセマンティック優先のモーション・コーデックであるSeMoCoを導入するとともに、大規模なΩ\Omega-MotionVerseデータセットの作成を紹介するものである。

原著者: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

公開日 2026-08-26
📖 1 分で読めます☕ さくっと読める

原著者: Tianlv Huang, Hetian Guo, Ziyi Cai, Song Wang, Yanping Zhang, Zipei Fan, Xuan Song, Guangming Wu, Xin Zheng

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータに人間の動きを理解させることは、言語と物理学が交差する領域にある問題です。長年、研究者たちは、単純な一文に基づいて人が歩いたり跳んだりするビデオを作成するよう、テキストによる記述から現実的な動きを生成することを機械に教えようとしてきました。これを行うには、コンピュータは、空間における身体の連続的で流動的な流れを、話し言葉を文字の列に変換するのと同様に、コンピュータが処理できる形式へと翻訳する方法を見つける必要があります。初期の試みは、動きを途切れることのない滑らかなデータのストリームとして扱っていましたが、より最近のアプローチでは、動きを文章の中の単語のように、離散的で個別の単位へと分解することで、コンピュータがより複雑で多様な動作を生成できることが示されました。しかし、大きな障害が残っていました。動きをこれらの単位に分解するために使用されるツールは、主にその動きをできるだけ正確に再構築するように設計されており、その動きが実際に何を意味しているのかを理解するためのものではなかったのです。それらは、体重のわずかな変化とスクワットのような大きな動作を同じ種類のデータとして扱い、コンピュータが試行錯誤を通じてのみその違いを学習することを強いていました。

ある研究チームは、この翻訳方法を変える「SeMoCo」と呼ばれる新しいシステムを導入しました。この新しい手法は、コンピュータが動きの意味を推測しながら再構築しようとするのではなく、最初からその2つのタスクを分離します。このシステムは、あらゆる瞬間の動きを、動作の一般的な意味を捉えるプライマリ・コードと、身体の細かな動きを補完する一連のセカンダリ・コードという、2つの明確に異なる部分を含む小さな情報のパケットとして扱います。このアプローチは、言葉の核心となる意味が話者の声の特定のニュアンスから分離される音声認識の仕組みに着想を得ています。動作の意味のための専用の「スロット」をコンピュータに与えることで、システムは動きの物語に基づいて次に何が起こるかを予測できる一方で、別のプロセスが関節の正確な幾何学形状を処理することができます。

研究者たちは、彼らが作成した「Ω-MotionVerse」と名付けた膨大な人間動作データのコレクションを用いて、このシステムを構築しました。このデータセットは、プロフェッショナルなモーションキャプチャやビデオからの再構成を含む、様々なソースからの約1,000時間の記録された動きを集約し、それらを単一の一貫した形式に標準化しています。彼らは、この新しいコーデックであるSeMoCoをこのデータで訓練し、動きをこれらの二層のパケットへと圧縮する方法を学習させました。その結果、このシステムは、以前の手法よりも高い精度で人物の動きを再構築でき、関節位置の誤差をほとんど気づかれないレベルまで減少させました。さらに重要なことに、研究者がこれらのパキレットを使用してテキスト記述から新しい動きを生成させたとき、コンピュータは物理的に現実的であるだけでなく、プロンプトの意図に高い信頼性で一致する、意味的に正しい動作を生み出しました。

核心となる革新は、システムが情報をどのように整理するかという点にあります。古い手法では、コンピュータは動きの意味と関節の詳細を同時に理解しなければならず、しばしば一方が他方のために犠牲になるという妥協が生じていました。SeMoCoは、「意味優先(semantic-first)」のアプローチを用いることでこれを回避します。システムは、短い間隔の動きを見ると、まず「座る」や「回転する」といった広範な動作を特定し、これを特定のトークンに割り当てます。そして、肢体の正確な軌道や足の接地を記述するために、別のトークンのセットを使用します。この分離により、言語モデルは、あらゆる関節角度の複雑な数学に足を取られることなく、動作の進行、つまりアクションのシーケンスという「物語」に集中することができます。モデルは前の動作に基づいて次の動作を予測し、次にその動作の具体的な詳細を埋めていくことで、効率的かつ精密な生成プロセスを実現しています。

彼らの成果をテストするために、研究者たちはモーション生成と予測の標準的なベンチマークを用いて、いくつかの既存モデルと比較を行いました。記録された動きを圧縮された形式から単純に再構築するというタスクにおいて、SeMoCoは他のすべての手法を上回り、予測された関節と実際の関節の間の距離を測定するエラー率において最も低い値を達成しました。テキストから新しい動きを生成するよう求められた際、システムは、生成された動きがテキストの記述と一致する能力において、特に強力な結果を示しました。研究者たちは、より大きなモデルの方が一般的にテキストベースの動きの生成には優れているものの、そのサイズの優位性が普遍的ではないことを発見しました。短い過去のクリップから将来の動きを予測する場合、彼らのモデルのより小さく特化したバージョンの方が優れた性能を発揮したのです。これは、情報の構造化の方法が、コンピュータのメモリの純粋な大きさと同じくらい重要であることを示唆しています。

この研究はまた、この新しい設計に内在するトレードオフについても強調しています。動きの意味を優先することで、意味を完全に無視するシステムと比較して、再構築の絶対的な精度においてわずかなコストが生じます。しかし、研究者たちは、コンピュータが言語に基づいて動作を理解し生成する必要があるあらゆるアプリケーションにおいて、これは必要かつ有益な交換であると主張しています。このシステムは、人間の動きの生成という問題を完全に解決したと主張しているわけではありませんが、「何であるか(what)」と「どのように行うか(how)」を分離することがより良い結果につながることを示すことで、明確な進むべき道を示しています。この研究は、コンピュータに動きの背後にある意図を理解するための明確で構造化された方法が与えられれば、物理的に妥当であるだけでなく、ユーザーの指示に対して真に反応する動作を生成できることを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →