← 最新の論文
💻 computer science

Identity-Preserving Text-to-Video Generation via Agentic Enhancement and Semantic Repair

本論文は、エージェントによるプロンプト強化モジュールとVLM駆動の視覚的意味修復モジュールを組み合わせた軽量フレームワークであるAgentic Enhancement and Semantic Repair(AESR)を提案しており、これにより、クローズドソースのテキスト動画生成モデルにおけるアイデンティティのドリフトや指示追従の失敗を克服し、ACM MM 2026 Identity-Preserving Video Generation Challengeにおいて第1位を獲得した。

原著者: Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

公開日 2026-08-24
📖 1 分で読めます☕ さくっと読める

原著者: Jiayi Gao, Changcheng Hua, Jiaqi Tang, Yuxin Peng, Yang Liu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能が急速に進化する世界において、ある特定の課題が浮上しています。それは、書かれた物語に従うだけでなく、動画全体を通して特定の人物が全く同じ人物に見え続けるような動く映像を、機械に作らせるという課題です。例えば、友人が賑やかな市場を歩き、立ち止まって花を買う様子をコンピュータに生成させる場面を想像してみてください。その際、動画の中の顔が紛れもなくその友人のままであることを保証しなければなりません。現代のツールは、すでに驚くほどリアルな動きや照明を生み出すことができますが、この一貫性の維持にはしばしば苦戦します。キャラクターは最初はあなたの友人であっても、次第に別の人間に変貌してしまったり、あるいは指示が複雑になると、コンピュータが頼んだはずの花を単純に忘れてしまったりすることがあります。これは重大な障害です。なぜなら、今日利用可能な最も強力なビデオ生成器の多くは「ブラックボックス」であり、内部の仕組みが隠されている閉鎖的なシステムであるため、研究者がコードを微調整してこれらのエラーを修正することが不可能だからです。

北京大学の研究チームは、このブラックボックスを開けることなくこの問題を解決する新しいアプローチを開発しました。ビデオ生成器自体を変えようとする代わりに、彼らはその周囲で機能するスマートなアシスタントを構築しました。AESRと呼ばれるこのシステムは、撮影前に指示を準備し、最初のテイクの後に間違いを修正する、非常に熟練した監督兼エディターのように機能します。研究者たちは、与えられるテキストプロンプトを注意深く洗練させ、次に視覚的なリファレンスを使用して生成されたビデオの特定のエラーを修正することで、結果を大幅に改善できることを見出しました。この技術に関する主要な国際コンペティションにおいて、彼らのシステムは第1位を獲得し、出力に対して指示を与え、修復するというこの手法が、被写体のアイデンティティを忠実に維持したビデオを作成するための実用的かつ強力な方法であることを証明しました。

彼らの解決策の核心は、ビデオが作成される前と後に行われる2つの明確な段階にあります。まず、チームは人間のプロンプトの書き方が極めて重要であることに気づきましたが、ビデオ生成器によって好む書き方のスタイルが異なることも理解していました。これに対処するため、彼らは経験から学ぶデジタルな「プレイブック(手順書)」を作成しました。このプレイブックは、ビデオ生成器の制作者が提供する公式の指示(システムがどのようにコマンドを受け取るのが好きかを伝えるもの)から始まります。しかし、研究者たちはさらに、現実世界の例から学習するレイヤーを追加しました。彼らは、システムがビデオを生成し、間違いをチェックし、学んだ内容に基づいてプレイブックを更新するという自動化されたループを構築しました。もしシステムが、ビデオ生成器が特定の種類の動きを含めるのを忘れがちであったり、オブジェクトの説明に失敗したりすることを検知した場合、プレイブックはその失敗と次回のための修正策を記録します。時間が経つにつれ、この知識のコレクションは成長し、複数のオブジェクトと相互作用したり、一連の動作を行ったりするような複雑なシーンに対して、より優れた指示を作成できるようになります。

優れた指示があったとしても、最初のバージョンのビデオには、テキストだけでは修正できない小さなエラーが依然として含まれることがよくあります。コンピュータは「カメラを見ている女性」という言葉を理解していても、結果として表示されるビデオでは彼女が目を逸らしていたり、あるいは彼女が被っているはずの特定の帽子のよう、重要な細部を見落としていたりすることがあります。これに対処するため、研究者たちは「視覚的セマンティック修復(visual semantic repair)」と呼ばれる第2の段階を導入しました。このフェーズでは、別の人工知能システムが批評家として機能し、ドラフトビデオを観察して元の要求と比較します。システムが、オブジェクトの欠落や顔のわずかなズレなどの問題を発見した場合、単に新しい説明文を書くのではありません。代わりに、ビデオの特定のフレームを選択し、そこに本来あるべき姿を示すように編集します。この編集された画像は、具体的な視覚的ターゲットとして機能します。その後、システムはこの修正された画像と元のビデオ、そして新しい一連の指示をビデオ編集ツールに投入します。このツールは、編集された画像をガイドとして使用してビデオの特定のセグメントを修正し、最終的な結果がプロンプトの視覚的な意図と一致するようにします。

最善の結果を確実にするために、研究者たちは各ビデオに対して、改善された指示と修復技術のさまざまな組み合わせを用いて、一度きりの試行に頼ることはしませんでした。彼らは、候補となるビデオを比較するために選択戦略を用い、テキストとの一致度、顔の一貫性、および動きの滑らかさといった要素を重み付けして評価しました。このグループの中から単一の最良のバージョンを選ぶことで、最終製品の品質を最大化しました。顔のアイデンティティ保持を含む200の困難な事例を用いたテストにおいて、彼らのシステムは既存の手法を凌駕しました。結果は、彼らのアプローチが、被写体の顔が変わってしまうエラーや、主要な視覚要素が消失してしまうエラーを効果的に減少させたことを示しました。チームの成功は、ACM MM 2026 Identity-Preserving Video Generation Challengeにおいて、彼らのシステム「MIPL_Video」がフェイス・アイデンティティ・トラックでトップに立ったことで確認されました。

この研究は、最も強力なツールが直接的な修正に対して閉ざされていても、それらをより良い結果へと導く効果的な方法が存在することを示しています。指示を改善する学習システムと、特定の間違いを修正する視覚的エディターを組み合わせることで、研究者たちは軽量かつ非常に効果的なワークフローを作り上げました。彼らの知見は、高品質でアイデンティティを保持するビデオ生成の未来は、より大きく複雑なモデルを構築することではなく、既存のモデルとのよりスマートな対話方法を開発することにかかっている可能性を示唆しています。人物の容姿を維持しながら複雑でダイナミックな物語に従う能力は、ストーリーテリングやコンテンツ制作に新たな可能性を切り開き、入念な準備と的を絞った修正が、生の生成プロセスだけでは到達できない結果をもたらすことを証明しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →