← 最新の論文
💻 computer science

MoZoo:Unleashing Video Diffusion power in animal fur and muscle simulation

MoZoo は、粗いメッシュからリアルな毛並みと筋肉の動きを備えた高忠実度の動物動画を効率的に合成するための、Role-Aware RoPE や非対称デカップルド・アテンションといった革新的なアーキテクチャの革新を活用し、合成データから実データへのパイプラインと新しいベンチマークを併用する生成動力学ソルバーです。

原著者: Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

公開日 2026-05-15
📖 1 分で読めます☕ さくっと読める

原著者: Dongxia Liu, Jie Ma, Xiaochen Yang, Jiancheng Zhang, Bin Xia, Zhehan Kan, Nisha Huang, Jun Liang, Wenming Yang, Jin Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが映画のために、荒々しい灰色の粘土のパンダの彫刻を、写真のようなリアルさがあり、ふさふさとして生きている動物に変えようとしていると想像してください。

従来の方法(伝統的な CGI):
過去には、これは一軒一軒レンガを積み上げて家を建てるようなものでした。アーティストはすべての筋肉を手動で彫刻し、骨格を正しく動かせるようにリギングし、さらに毛並みをシミュレートするために何百万本もの小さな毛を個別に配置する必要がありました。これは時間がかかり、費用も高額で、髪の毛一本一本の物理挙動を調整するための専門家チームが必要でした。

新しい方法(MoZoo):
この論文は、3D 動物のための「魔法の筆」として機能する新しい AI ツール「MoZoo」を紹介しています。毛や筋肉をゼロから構築する代わりに、MoZoo は荒々しくテクスチャのない 3D モデル(「粘土」)と、写真、テキスト記述、または実際の動物の動画などのリファレンスを受け取り、瞬時にリアルな毛並みと筋肉の動きを描き加えます。

以下に、その仕組みを簡単な概念に分解して説明します。

1. 「レシピ」の問題:MoZoo-Data

AI に毛並みを描く方法を教えるには、「荒々しい粘土」と「実際の動物」のペアが数千必要です。しかし、実際の映画には「粘土」バージョンは付いておらず、完成した映画しか存在しません。

  • 解決策: チームは MoZoo-Data という特別なパイプラインを構築しました。彼らはビデオゲームエンジン(Unreal Engine 5)を使用して何千もの架空の動物動画を作成しました。その後、巧妙な「逆転のトリック」(逆モデル)を用いて、実際の野生動物ドキュメンタリーを分析し、数学的に毛と皮膚を「剥ぎ取る」ことで、その下の荒々しい粘土の骨格がどう見えたかを推測しました。
  • 結果: 彼らは AI を訓練するための「荒々しい粘土」と「実際の動物」の動画のペア 62,000 組からなる巨大なライブラリを作成しました。

2. 「指揮者」の問題:Role-Aware RoPE

AI に粘土のパンダを実際のパンダに変えるよう指示すると、AI は「いつ」何が起こるのかについて混乱します。

  • 混乱: もし AI に、走る実際のパンダの動画と、走る粘土のパンダの動画を見せると、AI は実際のパンダの毛の動きが、粘土のパンダの体の動きとは異なるタイミングで起こるべきだと考えるかもしれません。これは、ドラムとバイオリンが異なる曲を演奏しているオーケストラを指揮しようとしているようなものです。
  • 解決策: 彼らは Role-Aware RoPE というシステムを作成しました。これは、異なる入力に特定の「時間枠」を割り当てる厳格な指揮者だと考えてください。
    • 粘土動画(体)と ターゲット動画(制作中のもの)は、完全に同期して動くよう、正確に同じ時間枠を割り当てられます。
    • リファレンス動画(毛の質感)には「遅延した」時間枠が割り当てられます。これにより、AI は「このリファレンスから毛を使用するが、リファレンスの動きではなく、体の現在の動きに適用する」という指示を受けます。これにより、毛が滑り落ちたり、同期外に見えたりするのを防ぎます。

3. 「ノイズ」の問題:Asymmetric Decoupled Attention

AI が学習しようとする際、粘土の体の loud で明白な詳細(大きな筋肉や骨)が、毛の静かで小さな詳細を飲み込んでしまう傾向があります。

  • 混乱: これは、誰かが叫んでいる(粘土の体の構造)中で、ささやき(毛の細部)を聞こうとするようなものです。AI はしばしばささやきを無視して叫び声だけをコピーし、結果として滑らかで禿げたような動物ができてしまいます。
  • 解決策: 彼らは Asymmetric Decoupled Attention というフィルターを構築しました。一方向のガラスの窓を想像してください。
    • AI は、毛をどこに配置するかを知るために粘土の体を見ることができます。
    • AI は、毛がどのようなものかを知るためにリファレンス動画を見ることができます。
    • 重要なのは、粘土の体が毛の細部に「叫ぶ」ことができず、毛の細部も体の構造に「叫ぶ」ことができないことです。それぞれが自分のレーンにとどまります。これにより、AI は体の形状を確実に維持しつつ、ぼやけずに繊細で高品質な毛の質感を追加することができます。

4. 結果

チームは、新しいベンチマーク MoZooBench で MoZoo をテストしました。

  • 機能: 目標となる動物の画像や動画を見せるだけで、ライオンの荒々しい 3D モデルを実際のトラに変えたり、粘土のクマを実際のパンダに変えたりすることができます。
  • 優れている点: 他の AI ツールと比較して、MoZoo は動物の体の動きを正しく保ちます(毛の揺れやジッターがない)。また、他のツールが通常滑らかにしてしまうような、個々の毛や筋肉の伸縮といった微小な詳細も保持します。

まとめ:
MoZoo は、毛や筋肉のアニメーションにおける困難で手作業の多い作業を省略する生成 AI です。これは、巨大な自社製データセットと賢明な「交通整理」システムを用いて、荒々しい 3D モデルを、動きが完璧で毛並みが詳細な高解像度のリアルな動物動画に瞬時に変換します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →