← 最新の論文
💻 computer science

Next-Scale Autoregressive Models for Text-to-Motion Generation

本論文は、クロススケールおよびインスケール精化メカニズムを備え、粗い解像度から細かい解像度へと階層的にテキストからモーションを生成する次世代の自己回帰フレームワークであるMoScaleを導入し、最先端の性能、高い学習効率、そして強力なゼロショット汎化能力を達成する。

原著者: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

公開日 2026-05-28
📖 1 分で読めます☕ さくっと読める

原著者: Zhiwei Zheng, Shibo Jin, Lingjie Liu, Mingmin Zhao

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに書かれた説明に基づいてダンスを教える場面を想像してみてください。「ジャンピングジャックを 2 回して、振り返って、何かを拾い、再び振り返る」と指示すれば、標準的な AI は個々の動作は正しくても、順序や回数を間違える可能性があります。ジャンピングジャックを 3 回やってしまったり、最後に振り返るのを忘れたりするかもしれません。

この論文は、この問題を解決する新しい AI モデル「MoScale」を紹介しています。その仕組みを、簡単な比喩を用いて説明します。

問題:「一歩ずつ」の罠

現在のほとんどの動作生成 AI モデルは、本を 1 語ずつ読む人のように動作します。直前の 1 つの動作だけを基に、次の動作を予測します。

  • 比喩: 今描いた小さな筆致だけを眺めながら、巨大な風景画を描こうと想像してください。その部分の色は正しくても、全体像を見失ってしまいます。山が左側にあるべきことや、川が特定の方向に流れるべきことを忘れてしまうかもしれません。
  • 結果: ロボットの動きは局所的には滑らかに見えます(膝が正しく曲がるなど)が、物語全体は間違ったものになります(求められたジャンピングジャックを 2 回行わないなど)。

解決策:「建築家からインテリアデザイナーへ」というアプローチ

MoScale は戦略を変えます。1 つの小さな動作を予測する代わりに、粗い(全体像の)段階から細かい(詳細の)段階へと、層を成して動作を構築します。

  1. 粗いスケール(建築家): まず、モデルは建築家が設計図を描くように振る舞います。低解像度でダンスの「全体」の構造を決定します。「よし、この一連の動作は『ジャンプ、ジャンプ、回転、拾う、回転』だ」と言います。指の動きを気にする前に、グローバルな物語を確定させます。
  2. 細かいスケール(インテリアデザイナー): 設計図が決まると、モデルはズームインします。そのラフなスケッチを基に、ジャンプの高さや回転の速さなどの詳細を追加します。動作を段階的に洗練させますが、建築家がすでに決定した主要な物語は決して変えません。

秘密の武器:2 つの「洗練」の工夫

著者らは、このプロセスをさらに向上させるために 2 つの特別な機能を追加しました。特に、トレーニングに利用できるダンスデータが大量に存在しないため、有効です。

1. 「ミス付きの練習」の工夫(クロススケール階層的洗練)

  • 問題: 完璧な指示だけでしか練習しなければ、ミスをしたときにパニックになります。
  • 比喩: 運転を学ぶ学生を想像してください。教官が完璧で空いている道だけでしか運転させない場合、彼らは凹凸(ポットホール)に遭遇した瞬間に事故を起こします。
  • MoScale の対策: 訓練中、モデルには意図的に「破損した」または不完全な設計図を与えられます。「建築家」が犯したミスを修正し、それでも良いダンスを生み出すことを学ぶ必要があります。これにより、モデルは頑健になり、初期段階が少しずれていても、最終的な動作がテキストに忠実であることを保証します。

2. 「二度見」の工夫(インスケール時間的洗練)

  • 問題: 全体像を決定した後でも、モデルは特定の細部を間違える可能性があります。例えば、手が逆方向にピクつくなどです。
  • 比喩: 論文を書くことを想像してください。草案を書き、その後読み返します。タイプミスや不自然な文を見つけ、修正します。
  • MoScale の対策: モデルが特定の層の予測を行った後、自分が書いた内容を「振り返る」ことができます。不確実な部分を特定し、再予測します。これは、全体の物語を崩すことなく、動作をより滑らかでリアルにする「第 2 稿」のようなものです。

なぜこれが重要なのか

この論文は、MoScale が「次のトークン」モデルの速度と、長く複雑な物語を理解する能力を初めて成功裏に組み合わせたと主張しています。

  • より優れた物語性: 「ジャンピングジャックを 2 回」や「振り返って、拾って、振り返る」といった指示を、以前のモデルよりもはるかに正確に守ります。
  • 効率性: 徐々にノイズを消去してノイズの塊を画像に変えるような「拡散モデル」よりも、訓練が高速です。
  • 汎用性: 構造を非常に良く理解しているため、ダンスの一部を変更(歩くのを走るに変えるなど)する際、変更したくない部分を壊すことなく、既存のダンスを編集することも可能です。

要するに、MoScale は AI が細部に迷い込むのを防ぎ、まずダンス全体を計画させることで、ロボットが実際に求められたことを実行することを保証します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →