← 最新の論文
🤖 AI

Rebalancing Reference Frame Dominance to Improve Motion in Image-to-Video Models

本論文は、アテンション機構における参照フレームの支配性を再調整することで画像から動画への生成における運動ダイナミクスを強化し、追加の学習を必要とせずに視覚的忠実度を損なうことなく運動の抑制を克服する、学習不要かつモデルに依存しない手法である DyMoS を紹介する。

原著者: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Wooseok Jeon, Seungho Park, Seunghyun Shin, Sangeyl Lee, Hyeonho Jeong, Hae-Gon Jeon

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

画像から動画への変換モデルにおけるモーション改善のために参照フレームの支配性を再調整する」という論文(DyMoS)について、簡単な言葉と創造的な比喩を用いて説明します。

問題:「凍りついた」動画

馬の写真を持って、コンピュータにそれを走る馬の動画に変えてほしいと頼んだと想像してください。馬が駆けることを期待するでしょう。しかし、現在の AI モデルは元の写真に対してあまりにも「礼儀正しい」ことがよくあります。与えられた写真を変えてしまうことを恐れるあまり、馬をその場に凍りつかせたままにし、耳を少し動かす程度に留めてしまうのです。

この論文では、これを「静的なモーションバイアス」と呼んでいます。AI は最初のフレーム(参照画像)を完璧に保つことに集中しすぎて、動画の残りの部分を動かすことを忘れてしまうのです。

発見:「過度に注意を向ける」学生

研究者たちは、これらの AI モデルがどのように機能するかを内部から調査しました。そして、「参照フレーム支配性」と呼ばれる特定の行動を発見しました。

AI モデルをテストを受ける学生だと考えてみてください。

  • テキストプロンプトは質問です:「馬を走らせてください」。
  • 参照画像は机の上に置かれた馬の写真です。

通常のテキストから動画への変換モデルでは、学生は質問を見て、走る馬を想像します。
一方、画像から動画への変換モデルでは、学生は机の上の写真にあまりにも激しく凝視しています。動画の次のフレームを描こうとするたびに、学生は写真を見て、「よし、この次のフレームは写真と全く同じになるようにしなければならない」と言います。

学生が写真をコピーすることに夢中になっているため、実際に馬が動く様子は描かれません。「写真」が「想像力」を支配しているのです。

解決策:DyMoS(「モーションスライダー」)

研究者たちは、DyMoS(Dynamic Motion Slider:動的モーションスライダー)と呼ばれるツールを開発しました。これは AI の再学習を必要とせず、元の写真を変更する必要もありません。代わりに、それは学生の執着度を調整する「音量ノブ」のように機能します。

仕組み:

  1. 介入: 動画生成の最初の数瞬間(「ノイズ除去」ステップ)の間、DyMoS は学生に優しく肩を叩きます。「ねえ、参照画像を凝視しすぎないで。今はモーションを想像する必要があるよ」と伝えます。
  2. メカニズム: 技術的には、AI の注意システム内の特定の数値(バイアス)を調整します。次のフレームがどのように見えるべきか決定しようとする際、参照画像のトークンに対して AI が与えるスコアをわずかに下げるのです。
  3. 結果: AI はまだ写真を見ることができます(だから馬は馬らしく見えます)が、それを完璧にコピーすることを強制されなくなります。これにより、AI は馬を走らせたり、車を走らせたり、水を跳ねさせたりする自由を得ます。

「スライダー」機能

DyMoS の最も素晴らしい点は、単なるオン/オフスイッチではなく、スライダーであることです。ユーザーが調整できるパラメータは一つだけです。

  • 下げる(負の数): AI は写真に対してより執着します。動画はさらに静的になります(ほとんど動かない静止画が必要な場合に有用です)。
  • 上げる(正の数): AI に写真の「凍りついた」性質をより無視するよう指示します。動画は非常にダイナミックでエネルギーに満ちたものになります。
  • 中間: 動画が自然に動きながら、キャラクターが元の写真と全く同じに見える、完璧なバランスを見つけることができます。

以前の手法よりも優れている点

この「凍りついた動画」という問題を解決しようとした以前の試みは、エンジンを壊したり、車輪を塗りつぶしたりして車を修理しようとするようなものでした。

  • 一部の手法は AI 全体を再学習させる必要がありました(高価で遅い)。
  • 他の手法はモーションを強制するために入力画像をぼかしたり乱したりしようとしましたが、これにより動画が醜く歪んでしまうことがよくありました。

DyMoS が異なる理由は以下の通りです。

  1. 学習不要: AI に新しいことを教える必要はありません。AI が作業している間にこのツールを使うだけです。
  2. モデル非依存: ほぼすべての最新の動画 AI(Wan 2.2、HunyuanVideo、CogVideoX など)で機能します。
  3. 品質維持: 画像をぼやけさせたり奇妙にしたりすることなく、動画に動きを与えます。

まとめ

この論文は、画像から動画への変換モデルが入力画像に対して「あまりにも礼儀正しい」ため、動画が退屈で静止したものになってしまうことを特定しました。彼らはこれをDyMoSで修正しました。これは単純なツールであり、音量ノブのように機能し、モーションが発生する程度に、開始写真への AI の執着を適切に下げることで、モデルや元の画像を変更することなく実現します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →