← 最新の論文
💻 computer science

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE は、微細な言語誘導制御、推論を考慮した事前学習戦略、および大規模な微細データセットを導入することで、人間の動作処理における粒度のギャップを埋め、精密な動作編集・生成および人間らしい推論を可能にする統合フレームワークである。

原著者: Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが踊るロボットを持っていると想像してください。しかし、現時点では、それは非常に広範で曖昧な指示しか理解できません。「幸せそうに踊って」と言っても、それは一般的なジグを踊るかもしれません。しかし、「3 秒目に左腕をゆっくり上げ、その後右足で回転して」と言おうものなら、ロボットは混乱して失敗します。それは、特定の時間に特定の身体部位を理解する「微細な」能力を欠いているのです。

論文「MotionMERGE」は、この問題を解決するために設計された新しいシステムを導入します。それは、全体像しか見えない「総支配人」から、すべてのダンサーの動きを正確に指揮できる「振付師」へと、ロボットの脳をアップグレードするようなものです。

以下に、その方法を 3 つの簡単な部分に分解して示します。

1. 問題:「ぼやけたレンズ」

現在の人間の動きに関する AI モデルは、霧のかかった窓を通して映画を見ているようなものです。「人が歩いている」という全体の場面は伝えられても、「左足を引きずって歩いている」といった詳細に焦点を当てることはできません。このため、誰か一人の腕の動きだけを動画編集で変更したり、なぜその動きが起きたかを段階的に説明したりといった複雑なタスクは実行できません。

2. 解決策:3 部構成のアップグレード

研究者たちは、動きのためのスイスアーミーナイフのような MotionMERGE を構築しました。これは 3 つの強力なツールを組み合わせたものです。

  • 万能翻訳機(フレームワーク):
    「人間の言語(英語)」と「ロボットの言語(数学的な動きのデータ)」の両方を話す翻訳機を想像してください。以前の翻訳機は不器用で、ダンスの振り付け全体を 1 つの大きなテキストの塊として扱っていました。MotionMERGE は、ダンスを小さな離散的な「トークン」(個々のレゴブロックのようなもの)に分解します。これにより、AI は「右腕を動かす」ことが「左足を動かす」とは異なる、特定のブロックであることを理解できるようになります。動きを言語のように扱い、テキストと同じ柔軟性で読み、書き、編集することを可能にします。

  • 「思考する」教師(RAGS 事前学習):
    完成したパフォーマンスを見せるだけでは、ロボットに踊りを教えることはできません。動きの背後にある「論理」を学ぶ必要があるのです。研究者たちは、RAGS(Reasoning-Aware Granularity-Synergy:推論意識型粒度相乗)と呼ばれるトレーニング手法を発明しました。

    • 比喩: 学生に料理を教えることを想像してください。単にレシピと完成した皿を与えるのではなく、ニンジンよりも先に玉ねぎを切る理由を説明させ、正確に 2 分後に鍋を確認するよう強制します。
    • 仕組み: AI は動きを単にコピーするだけでなく、以下のように訓練されます。
      1. 時間の固定化: 「5 秒目に」という言葉が「ダンスの途中のいつか」ではなく、まさにその瞬間を意味することを理解する。
      2. 局所的な焦点: 「右手」が体全体ではなく、特定の部位を指すことを学ぶ。
      3. 思考の連鎖(CoT): これが最も重要です。AI は複雑な要求を段階的な物語に分解することを学びます。「止まって、その後ジャンプして」と頼むと、単に推測するのではなく、「ステップ 1:体を凍結させる。ステップ 2:脚を準備する。ステップ 3:ジャンプする」と考えます。これにより、編集プロセスが論理的で説明可能になります。
  • 膨大な練習帳(MotionFineEdit データセット):
    この新しいスキルを教えるために、研究者たちは曖昧すぎる古い教科書を使うことはできませんでした。代わりに、MotionFineEdit という全く新しい大規模なデータセットを作成しました。

    • 比喩: これは 837,000 個の小さな「前後比較」の例を含む図書館のようなものです。各例は、特定の動き、それを修正する特定の指示(例:「最初の 1 秒を削除し、右ひざを下げよ」)、そしてその結果としての動きを示しています。
    • 重要なのは、このデータセットに思考の連鎖(Chain-of-Thought)の注釈が含まれていることです。単に開始と終了を示すだけでなく、ロボットが点 A から点 B へ移動した正確な過程を示す漫画のストリップのように、中間ステップを示します。これにより、AI は編集の背後にある「推論」を学びます。

3. 結果:「まあまあ」から「精密」へ

MotionMERGE をテストしたところ、結果はぼやけたスケッチと高解像度の写真を比較したようなものでした。

  • 精度: 「開始時に 2 秒間ポーズを取り、その後左足を動かす」といった指示を高い精度で追従できました。一方、古いモデルは失敗したり、タイミングを間違えたりしました。
  • ゼロショット推論: AI はパターンを単に暗記したのではなく、動きの「論理」を学んだため、これまで見たことのない複雑な新しい指示にも対応できました。複雑な要求をステップに分解し、追加のトレーニングなしで正確に実行することができました。
  • 汎用性: 編集能力が向上しただけでなく、新しいダンスの生成や既存のダンスの説明も得意になりました。これは、「微細な詳細」を学ぶことが、AI が「全体像」を理解する助けにもなることを証明しています。

まとめ

要するに、MotionMERGE は、人間の編集者と同じ精度で人間の動きの言語を学ぶ新しい AI システムです。段階的に考えること(思考の連鎖)を教え、具体的で詳細な例の膨大な図書館を与えることで、それはついに、単に全体的な雰囲気を推測するのではなく、私たちが動く方法の小さく複雑な詳細を理解し、制御できるようになりました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →