← 最新の論文
💻 computer science

HOMIE: Human-object Centric Video Personalization via Multimodal Intelligent Enchancement

本論文は、グローバルなマルチモーダルガイダンスとモダリティ参照埋め込みを用いた新しいMLLM統合戦略を活用することで、高い被写体忠実度と正確な人間と物体の相互作用パターンを同時に実現する、人間と物体の中心的なビデオパーソナライゼーションのための統一フレームワークであるHOMIEを導入する。

原著者: Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

公開日 2026-07-21
📖 1 分で読めます☕ さくっと読める

原著者: Yiyang Cai, Nan Chen, Rongchang Xie, Junwen Pan, Chunyang Jiang, Cheng Chen, Wen Zhou, Zhenbang Sun, Wei Xue, Wenhan Luo, Yike Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルアーティストたちが集まる部屋を想像してみてください。そこでは、筆の代わりにコードで作られた魔法の杖を振るっています。これが、AIビデオ生成の世界です。コンピュータが単純なテキストの説明から動く映像を夢見るように学習する分野です。長い間、これらのデジタルな夢想家たちは、風景や抽象的なアートを作ることは得意でしたが、特定のキャラクターをシーンの中に登場させ、特定の動作をさせることには苦戦してきました。それは、シェフに料理を作るよう頼みながら、材料については曖昧なアイデアしか与えないようなものです。結果は美味しそうに見えるかもしれませんが、実際に食べたかった味になることは滅多にありません。

この魔法を可能にするには、二つの大きなアイデアがあります。第一に、「ビデオ・パーソナライゼーション(動画の個人化)」です。これは、AIに特定の友人やお気に入りの玩具を認識させる方法を教えるようなもので、それによって、あなたが語るどんな物語にもその対象を登場させることができます。第二に、「ヒューマン・オブジェクト・インタラクション(人間と物体の相互作用)」です。これは、その友人が実際に玩具を「持つ」のか、ドアを「開ける」のか、あるいはカップから「飲む」のかを確実にさせるための、非常にトリッキーな部分です。単に物体のそばに浮いているのではなく、物体とどう関わるかをコンピュータに理解させる必要があります。特に、特定のブランドロゴやシャツのテキストラベルのような、特殊な物体の場合です。AIがこれを間違えると、人が壁を通り抜けたり、透明な物を掴んでいたりするような、バグだらけの夢のような映像になってしまいます。

そこで、香港科技大学の研究者たちによる新しいフレームワーク「HOMIE(Human-object Centric Video Personalization via Multimodal Intelligent Enhancement)」が登場しました。HOMIEは、単に脚本を読むだけでなく、撮影前に俳優や小道具の写真アルバムもしっかりと研究する、非常に賢いディレクターのようなものです。

この論文は、これまでのディレクター(AIモデル)が苦戦してきた二つの主要な問題に取り組んでいます。一つ目は「インター・サブジェクト(対象間)」の問題です。人間と物体(例えば、人とコーヒーカップ)がいる場合、AIはそれらを正しく相互作用させることに苦労することがあります。特に、その物体がロゴのような抽象的なものである場合です。これは、AIが「カップ」が何であるかは知っていても、「COSTA」というロゴが「その特定の」カップにあるべきだということを理解していない状態に似ています。二つ目は「イントラ・サブジェクト(対象内)」の問題です。同じ物体を異なる角度から見せたい場合や、テキストが付いている場合(看板のOCRマップなど)があります。従来のモデルは、これらの異なる視点を全く別の物体として扱って混乱したり、テキストを正しく読み取れなかったりすることがありました。

これを解決するために、HOMIEは「マルチモーダル大規模言語モデル(MLLM)」を用いた巧妙な新しい手法を導入しています。MLLMは、何百万もの画像を見て、物事がどのように関連しているかを知っている、非常に博識なアシスタントのようなものだと考えてください。従来の手法は、このアシスタントに脚本全体を書き換えさせようとしましたが(テキストエンコーダー)、これは煩雑でコストがかかる作業でした。しかし、HOMIEは元の脚本家をそのまま残したまま、アシスタントがカメラクルーに対して直接、具体的な指示をささやく方法をとりました。

論文では、これを実現するための二つの主要なツールを提案しています。

  1. グローバル・マルチモーダル・ガイダンス(GMG): AIがフレームごとにビデオを見ている様子を想像してください。GMGは、アシスタントが持つ「全体像」の理解にスポットライトを当てるようなものです。これは、人間が物体とどのように相互作用すべきかというアシスタントの知識を取り込み、ビデオの自己注意(self-attention)メカニズムに直接注入します。これにより、プロンプトで明示的に指示されなくても、ロゴがソファではなくカップの上にあるべきであることをAIが理解できるようになります。
  2. モダリティ・リファレンス・エンベディング(MRE): これは、AIに色分けされたタグを与えるようなものです。もしAIに、同じ人物の異なる角度からの写真3枚、あるいは看板の写真と、その看板のビデオを見せたとしたら、MREはそれらすべてに同じ「アイデンティティの色」をタグ付けします。これにより、AIに「これらはすべて同じものです!」と伝え、異なるキャラクターとして混乱してしまうのを防ぎます。

研究者たちは、HOMIEを他のトップレベルのAIビデオ生成器と比較検証しました。その結果、HOMIEはキャラクターの一貫性を保ち、テキストの指示に従い、ロゴ付きのカップや看板のテキストを読むといった難しい相互作用を扱う能力において優れていることが分かりました。テストにおいて、HOMIEは主要な競合の一つと比較して、テキスト読み取り(OCR)の精度を約21.8%向上させました。人間のボランティアに最高のビデオを選んでもらう調査では、HOMIEは大多数の場面で勝利し、対象の一貫性で約66.1%、テキストへの追従性で約64.7%のスコアを獲得しました。

この論文は、「誰か(アイデンティティ)」と「何か(物体)」を切り離し、スマートなアシスタントを使って相互作用をガイドすることで、AIビデオをより現実的で、幻覚(ハルシネーション)ではないものにできることを示唆しています。著者たちは、ビデオ生成のあらゆる問題を解決したと主張しているわけではありませんが、マルチモーダルな知識と注意深いトークン管理を組み合わせるこの特定のアプローチが、AIビデオのパーソナライゼーションをよりスマートで信頼性の高いものにするための重要な一歩であることを、実験を通じて示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →