← 最新の論文
💻 computer science

DiMo: Discrete Diffusion Modeling for Motion Generation and Understanding

DiMoは、反復的なトークン精緻化、残差ベクトル量子化、およびGroup Relative Policy Optimizationを通じて、柔軟な品質とレイテンシのトレードオフと多様なモーションタスクを可能にする、マスク付きモデリングを双方向のテキスト・モーション理解および生成へと拡張する統一された離散拡散フレームワークを導入する。

原著者: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

公開日 2026-02-09
📖 1 分で読めます☕ さくっと読める

原著者: Ning Zhang, Zhengyu Li, Kwong Weng Loh, Mingxi Xu, Qi Wang, Zhengyu Wen, Xiaoyu He, Wei Zhao, Kehong Gong, Mingyuan Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください、あなたは巨大で魔法のようなスケッチブックを持っています。かつて、説明に基づいて踊る人物を描いたり、ダンス動画に基づいて物語を書いたりしたい場合、2つの異なるスケッチブックを使うか、あるいは一度に一筆ずつ、左から右へとしか描けない非常に硬直したスケッチブックを使う必要がありました。もし最初のひと筆でミスをしてしまったら、絵全体が台無しになり、最初からやり直すことなしには簡単に修正することもできませんでした。

DiMoは、ルールの書き換えを行う新しい種類の「スマートなスケッチブック」です。これは、一度に2つのことができる単一のシステムです:

  1. 説明を読み取り、動きを描く(Text-to-Motion / テキストからモーションへ)
  2. 動きを見て、説明を書く(Motion-to-Text / モーションからテキストへ)

その仕組みを、日常的な例えを用いて説明します:

1. 「ぼやけた写真」ゲーム(生成の仕組み)

ほとんどの従来の手法は、人が一語ずつ文章を書いていくようなものです。一度言葉を書いてしまうと、もう書き直すことはできません。「犬が走った」と書いた後、「走った」を「跳んだ」に変えるには、文章全体を書き直さなければなりません。

DiMoはこれとは異なります。 ダンサーの写真を想像してください。しかし、その写真は静止画のノイズ(テレビの砂嵐のようなもの)で完全に覆われています。

  • プロセス: DiMoは、ダンサーを一筆書きで描くのではありません。代わりに、ぼやけた画像全体を一度に眺めます。まずダンサーがどのように見えるかを推測し、次に「次のバージョン」がどうあるべきかを推測し、何度も何度も洗練させていきます。
  • 魔法: これにより、画像のどこであっても即座にミスを修正できます。もし左腕の動きがおかしければ、右脚を崩すことなく、左腕だけを直すことができます。これは、ぼやけた写真を鮮明にするように、パラレル(並列)なステップで「デノイジング(ノイズ除去)」を行うことで実現しています。

2. 「速度 vs 品質」のダイヤル

DiMoはステップを踏んで画像を洗練させていくため、結果の出し方を自分で選ぶことができます。

  • 速さが欲しい? プロセスを途中で止めることができます(例えば5ステップ後)。ダンサーは少し粗い見た目になりますが、即座に結果が得られます。
  • 完璧さが欲しい? もっと多くのステップを実行させます(例えば30ステップ)。すると、ダンサーは驚くほどリアルで滑らかな動きになります。
    これは、カメラの「速度 vs 品質」のダイヤルのようなものです。その瞬間に必要なものに合わせて、スライドさせて調整できるのです。

3. 「高精細」な翻訳機(RVQ)

ダンサーをリアルに見せるために、DiMoはResidual Vector Quantization (RVQ) と呼ばれる特別なツールを使用しています。

  • 例え: 複雑な絵画を、たった10色だけで説明しようとしていると考えてみてください。それはブロック状で醜いものになるでしょう。では、1,000色のパレットがあり、それをレイヤー(層)として使う場面を想像してください。まず大きな形(体)を配置し、次に筋肉を加え、さらに髪の毛の細かなディテールを追加していきます。
  • 結果: DiMoは動きをこれらのレイヤーに分解します。これにより、「粗い」動き(歩行など)と「細かい」ディテール(指のピクつきなど)を別々に捉えることができ、結果として非常に滑らかでリアルなアニメーションを生み出すことができます。

4. 「スマートなコーチ」(GRPO)

たとえ動きが良く見えたとしても、それが指示されたストーリーと一致しない場合があります(例:テキストには「ジャンプ」とあるのに、キャラクターが「歩いて」いる場合)。

  • 例え: DiMoには「コーチ(GRPOと呼ばれる)」が組み込まれています。DiMoが動きを作った後、コーチがチェックします。「これはテキストと一致しているか?」もしそうでなければ、コーチはシステムに対して、もう一度試すよう優しく促します。時間をかけて、DiMoはこのコーチの指示を聞くのが上手くなり、ダンスがストーリーと完璧に一致するように学習していきます。

これで実際に何ができるのか?

論文によると、DiMoはモーションとテキストのためのスイスアーミーナイフ(万能ツール)です:

  • Text to Motion(テキストからモーションへ): 「人がバックフリップをしている」と入力すれば、そのビデオが生成されます。
  • Motion to Text(モーションからテキストへ): ダンスの動画をアップロードすれば、「ダンサーが回転してジャンプしている」といったキャプションを作成します。
  • ミスの修正: 動画の途中に欠損部分(空白の部分)がある場合、DiMoは新しい指示を必要とせずに、その隙間を埋めることができます。
  • キャプションの修正: 動画とキャプションがうまく一致していない場合、DiMoはそのキャプションを、実際に起きていることを説明するように修正できます。

まとめ

この論文は、DiMoが従来のメソッドよりも優れている理由を、最初に一つのミスをしてもそこに固執しないためだと主張しています。全体像を見ることができ、どこでもエラーを修正でき、さらに結果の速度と品質を自分で選択できます。DiMoは標準的なデータセット(HumanML3DおよびKIT-ML)でテストされており、単一の統合されたフレームワーク内で、高品質なダンスの生成と正確な記述の両方が可能であることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →