← 最新の論文
💻 computer science

YOSE: You Only Select Essential Tokens for Efficient DiT-based Video Object Removal

YOSE は、バッチ可変長インデキシングを通じて必須トークンを適応的に選択し、拡散プロセスシミュレータでマスクされていない領域をシミュレートすることで推論を高速化する、DiT ベースの動画オブジェクト除去向けの効率的なファインチューニングフレームワークであり、視覚品質を維持しながら最大 2.5 倍の高速化を達成します。

原著者: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

公開日 2026-05-01
📖 1 分で読めます☕ さくっと読める

原著者: Chenyang Wu, Lina Lei, Fan Li, Chun-Le Guo, Dehong Kong, Xinran Qin, Zhixin Wang, Ming-Ming Cheng, Chongyi Li

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

忙しい通りの映像があると仮定し、フレームを横切る特定の人物を除去したいとします。過去、これを行おうとしたAIモデルは、単に人物の上を塗りつぶすのではなく、変更を行うたびに全体の通り、空、そして背景のすべての車を再描画しようとする画家のチームのようでした。映像の90%は触れる必要がないにもかかわらず、これは信じられないほど遅く、無駄なものでした。

この論文は、YOSE(You Only Select Essential Tokens:必要なトークンのみを選択する)という新しい手法を紹介します。これは賢く外科的な編集者のように機能します。キャンバス全体を再描画するのではなく、YOSEは修正が必要な特定の箇所のみを塗り、それでも新しい塗料が手つかずの部分と完璧に馴染むようにします。

以下に、YOSEの仕組みを簡単な概念に分解して示します。

1. 問題点:「キャンバス全体」アプローチ

現在のAI動画ツール(「DiT」と呼ばれるものに基づいています)は、物体の除去には非常に優れていますが、遅いです。たとえ動画から小さな鳥を1羽だけ除去したい場合でも、コンピュータは動画のすべてのピクセルを処理します。それは、ナットを割るために金槌を使うようなものです。論文によれば、既存の最良のツールでさえ、約1秒間に10フレーム(FPS)しか処理できず、リアルタイム使用には遅すぎます。

2. 解決策:2つの賢いツール

YOSEは、既存のAIに2つの特別な「ギア」を追加して、品質を損なうことなく速度を向上させます。

ギアA:「賢いクリッパー」(バッチ可変長インデックス)

  • アナロジー: 100枚の宿題の束があり、そのうち5枚だけが間違いを含んでいると想像してください。通常の教師は100枚すべてを1枚ずつ採点します。YOSEは、間違いのある5枚だけを即座に切り取り、それらだけを採点してから束に戻す教師のようなものです。
  • 仕組み: AIは変更したい領域である「マスク」を確認します。BVIと呼ばれる技術を用いて、そのマスク内のデータポイント(トークン)のみを物理的に選択します。重労働の間、残りの映像は無視されます。これにより、コンピュータは物体の大きさによって変化する可変数のアイテムを処理できるようになり、固定された巨大な数の処理を回避できます。

ギアB:「ゴーストの囁き手」(拡散プロセスシミュレーター)

  • アナロジー: 人物がいた小さな部分だけを塗りつぶした場合、新しい塗料は周囲の通りの照明や質感に合わないシールのようになる可能性があります。新しい塗料を馴染ませるには、通りの残りの部分がどのように見えるかを知る必要があります。
  • 問題点: 時間を節約するために「悪い」部分を切り取ると、AIは「良い」部分がどのように見えるかを忘れてしまいます。文脈を失うのです。
  • 解決策: YOSEはDiffSimと呼ばれるモジュールを使用します。これは実際には(遅くなる)動画の「良い」部分を処理するのではなく、それらの良い部分が何をしているかのシミュレーション、つまり「ゴースト」を作成します。AIに「ねえ、ここにある空は青く、あそこにある車は左に動いているよ」と囁くことで、AIが新しいパッチをシームレスに融合させる方法を知ることができます。これは、街全体を歩くのではなく、1つの地区だけを歩きながら、街全体の地図を持っているようなものです。

3. 「シームレスな継ぎ目」(融合戦略)

ゴーストの囁き手があっても、新しい映像と古い映像が出会う場所にわずかに見える線が残る可能性があります。YOSEは最後のトリックを使用します:端をわずかに重ね合わせ、明るさと色の統計情報(平均と分散)を調整して、遷移を不可視にします。これは、写真の切り抜きを背景に消えるように端をフェード処理するようなものです。

結果:高速かつクリーン

この論文は、これらのトリックを使用することで以下のような成果を挙げています:

  • 速度: YOSEは、以前の最良の方法よりも2.5倍高速です。旧方式が10秒かかっていた場合、YOSEは約4秒で済みます。
  • スケーラビリティ: 速度は除去する物体のサイズに依存します。小さな点であれば超高速です。大きな建物を除去すれば速度は低下しますが、旧方式よりも遅くなることはありません。
  • 品質: 動画の品質は、遅い完全処理方式と同じように保たれます。実際、背景を誤って壊さない(無視するため)ため、背景はむしろより安定して見えることが多いです。

まとめ

YOSEは、単一の物体を除去するために宇宙全体を再シミュレーションする必要はないと理解する「賢い編集者」です。不要な作業を切り取り、無視した部分の文脈を覚えるための巧妙なシミュレーションを使用し、すべてを完璧に縫い合わせて、違いがわからないようにします。これにより、遅く重たいプロセスが、高速で外科的なものへと変わります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →