← 最新の論文
💻 computer science

GenEraser: Generalizable Video Object Removal via Balanced Text-Mask Guidance and Decoupled Locator-Preserver

GenEraser は、二部グラフによるテキストガイダンスを備えたマルチ条件混合エキスパートモデル、適応的条件バランス調整のための学習可能な深層 CFG 融合メカニズム、および意味的汎化とピクセルレベルの保存性の間のトレードオフを解決するためのデカップリングされたロケーター・パーセバーアーキテクチャを活用することで、オープンワールド環境における汎用的かつ高忠実度の動画オブジェクトおよびエフェクト除去を実現する新たなフレームワークである。

原著者: Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

公開日 2026-05-29
📖 1 分で読めます☕ さくっと読める

原著者: Yuqing Chen, Lin Liu, Haisu Wu, Xiaopeng Zhang, Yaowei Wang, Yujiu Yang, Qi Tian

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

自宅のビデオを編集していると想像してください。フレーム内を歩いた人物を削除したいのですが、単に「切り取る」だけでは奇妙なアーティファクトが残ります。地面に残る影、鏡に残る反射、あるいは彼らが持っていたタバコから立ち上る煙が空中に浮かんでいるのです。それは不自然で散漫に見えます。

GenEraser は、この問題を解決するために設計された新しい AI ツールです。単に物体を切り取るだけでなく、その物体が引き起こしたすべての厄介な副作用をきれいに消し去り、まるでその物体が最初から存在しなかったかのように場面の整合性を保つ「デジタルマジック消しゴム」と考えてください。

以下に、論文が用いたシンプルな比喩を通じて、その 3 つの主要な「スーパーパワー」を説明します。

1. 「バイリンガル翻訳者」(二部構成のテキストガイダンス)

従来のビデオ編集ツールの多くは、削除対象の物体を囲む黄色い輪郭線であるマスクのみを見ています。物体を削除すれば、他のものもすべて消えると想定しているのです。しかし、AI はしばしば混乱します。車を消せば、タイヤの煙や車が投げかけた影まで消すのを忘れる可能性があります。

GenEraser は翻訳者のアプローチを採用します。単に何を切り取るかの画像を AI に示すのではなく、二部構成の説明を与えます。

  • パート A(赤いテキスト): 「車を削除せよ。」
  • パート B(黄色いテキスト): 「さらに、煙、影、および反射も削除せよ。」

この説明を読むことで、AI はシーンの「物語」を理解します。煙や影は、車がそこにある「ゆえに」起こる「因果効果」であることを知っています。これにより、単なる輪郭線では見逃してしまう光線、水面の波紋、鏡の反射といった厄介なものを発見し、消去することが可能になります。

2. 「スマートミキサー」(学習可能な深層 CFG 融合)

スープを調理していると想像してください。味を適切にするために塩(テキストガイダンス)を多く加える必要がある場合もあれば、鍋を満たすために水(マスクガイダンス)を多く加える必要がある場合もあります。毎回固定された量の塩を加えるだけでは、レシピによっては味がひどくなるかもしれません。

従来の AI ツールは、テキスト説明と視覚的な輪郭のどちらをどの程度重視するかを決定するために、固定されたレシピ(手動調整)を使用していました。GenEraser はスマートミキサーを使用します。特定のビデオシーンを見て、リアルタイムでバランスを自動的に調整します。

  • シーンが複雑な煙で満たされている場合、「テキストの音量」を上げて、煙がどのようなものかを理解します。
  • シーンが素壁にある単純な物体である場合、「マスクの音量」を上げて、輪郭を正確にします。

この「スマートミキサー」は、すべてのビデオに対してこれらの 2 つの指示をどのようにバランスさせるかを自ら学習するため、設定を推測する必要はありません。

3. 「2 人の作業員チーム」(分離されたロケーターとプレザーバー)

論文は、1 人の人間に 2 つの非常に異なる仕事をさせることは失敗につながりがちだという一般的な問題に指摘しています。

  • 仕事 A: 物体を見つけ、消去する(大胆で一般的であることが求められる)。
  • 仕事 B: 背景を完璧に保つ(慎重で精密であることが求められる)。

1 つの AI モデルに両方を学習させると、混乱することがよくあります。物体はよく消去できるのに背景を台無しにしてしまったり、背景は完璧に保てるのに物体の亡霊を残してしまったりします。

GenEraser は、2 人の専門的な作業員を雇うことでこれを解決します。

  • ロケーター: この作業員は、合成データと実データを含む多様な種類のビデオで訓練されています。その唯一の仕事は「ハンター」になることです。あらゆる環境で物体とその奇妙な効果(影など)を見つけ、消去することを学びます。これは汎化(新しい奇妙な状況への対応)に優れています。
  • プレザーバー: この作業員は、背景がピクセル単位で完璧な「完璧な」データで訓練されています。その唯一の仕事は「修復者」になることです。消去されていないビデオの部分が元と完全に一致するように保証します。これは精度に優れています。

これらの仕事を分離することで、チームはより効果的に協力します。ロケーターが混乱を見つけ、プレザーバーが背景を修復することで、清潔でリアルなビデオが完成します。

結果

論文は、GenEraser を他のトップ手法と比較してテストした結果、それが最良であることを発見しました。以下のような困難なものを正常に削除することに成功しました。

  • タイヤからの
  • イルカからの気泡
  • ランプから放出される
  • 鏡の反射
  • 人や物体が投げかける

要約すると、GenEraser はシーンの説明を読み取ることで、光、影、煙といったシーンの物理法則を理解し、自らの設定を自動的にバランスさせ、専門的な 2 人組のチームを使用して、最終的なビデオが自然で清潔に見えるようにするビデオ編集ツールです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →