InsertFuse: A Unified Framework for Multi-Category Reference-Guided Image Insertion
InsertFuseは、Insertion On-Policy Distillationによるカテゴリ特化型エキスパートの学習と統合の分離を通じて、カテゴリごとのエキスパート学習を統合へとデカップリングすることで最先端の性能を達成し、さらにToken-Aligned Geometry Conditioning、Region-Balanced Flow Matching、およびReference CFGを通じて空間制御とリファレンス忠実度を向上させる、マルチカテゴリのリファレンス誘導型画像挿入のための統一フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたは、繊細なスフレから心温まるシチューまで、あらゆるものを調理できるマスターシェフであると想像してください。次に、誰かがあなたに、同じ鍋と全く同じ指示書を使って、スフレとシチューの両方の完璧な性質を同時に持つ単一の料理を作るよう頼んだとしましょう。やってみることはできるでしょうが、その結果はきっと、ふやけたひどい代物になるでしょう。シチューに必要な熱は、スフレの繊細な立ち上がりを台無しにしてしまいますし、風味も衝突してしまいます。これは、コンピュータサイエンティストが、AIに写真の編集を教える際に直面する種類の問題です。
AIの世界では、「拡散モデル(diffusion models)」は、まるでこれらのマスターシェフのような存在です。これらは、ランダムな静止画(テレビの砂嵐のようなもの)を、ステップごとに明確な画像へと少しずつ変えていくことで、画像を生成したり変更したりする、非常に賢いシステムです。最近では、これらのモデルは非常に進化しており、「この椅子に猫を置いて」とか「空を夕焼けに変えて」といった指示ができるほどになりました。しかし、そこには落とし穴があります。異なる種類の編集には、それぞれ全く異なるスキルが必要です。指に小さな指輪を置くには、極めて細かく繊細な精度が必要です。人物全体をシーンの中に配置するには、その人の体の曲がり方や服の見え方を理解する必要があります。一つの単一のAIモデルに、これらすべての異なるタスクの専門家になろうとさせることは、先ほどのシェフにスフレとシチューを同時に作るよう求めるようなものです。AIは混乱し、その結果は奇妙だったり、ぼやけたりしてしまいます。
ここで、InsertFuseという新しい論文が登場します。上海交通大学などのチームによる研究者たちは、従来のAIシェフの訓練方法こそが問題であったことに気づきました。一つのモデルにすべてを一度に学ばせるのではなく、彼らは巧妙な二段階のシステムを構築しました。まず、異なる「食材」に特化した5人の異なる「エキスパート・シェフ」を訓練しました。アクセサリー(ジュエリーなど)の専門家、動物の専門家、衣服の専門家、一般的なオブジェクトの専門家、そして人間の専門家です。各エキスパートは、自分の特定の領域におけるマスターとなり、他の領域に気を取られることなく、そのカテゴリー特有の癖を正確に扱う術を学びました。
しかし、もしあなたが何でもできる一つのアプリを求めているなら、5人の異なるシェフがいることは面倒なことです。そこで、チームは**挿入オンポリシー蒸留(Insertion On-Policy Distillation: IOPD)**と呼ばれる特別な訓練技術を考案しました。これは、5人のエキスパートが働く様子を見守る「生徒」シェフのようなものです。生徒は単にレシピを暗記するのではなく、自ら料理を作る練習をします。そして、行き詰まったときには、次に取るべき正確な動きについて、正しいエキスパートに助けを求めます。もし生徒が頭の上に帽子を乗せようとしているなら、「アクセサリーのエキスパート」に尋ねます。もし人が部屋の中にいる様子を作ろうとしているなら、「人間のエキスパート」に尋ねます。適切な瞬間に適切なエキスパートから学ぶことで、生徒は、一度にすべてを学ぼうとして混乱することなく、あらゆる挿入タスクを完璧にこなせる統一されたマスターシェフへと成長するのです。
生徒シェフが、どこに何を置くべきかを推測だけで決めないようにするために、チームはさらに2つの特別なツールを追加しました。第一のツールは、**トークン整列幾何学的条件付け(Token-Aligned Geometry Conditioning)**であり、これはAIに、新しいオブジェクトがどこに配置されるべきかという正確なGPSマップを与えるようなもので、背景に滲むことなく、穴の形に完璧にフィットすることを保証します。第二のツールは、**領域バランス型フローマッチング(Region-Balanced Flow Matching)**であり、これは公平な審判として機能します。通常の訓練では、AIは(壁のような)巨大な背景が画面の大部分を占めているために、小さなオブジェクト(ブレスレットなど)を無視してしまうことがあります。この新しいツールは、AIに対して「たとえブレスレットが小さくても、それは非常に重要なので、より注意を払いなさい」と告げ、小さな細部が失われないようにします。
最後に、挿入されたオブジェクトが参照写真と全く同じに見えるように(その独特の質感やアイデンティティを維持するために)、彼らは**リファレンスCFG(Reference CFG)**という手法を用いました。これは、生徒シェフに対して「たとえそのシャツの柄をどのように引き伸ばしたとしても、元のパターンを必ず維持しなさい」という厳格なルールを与えるようなものです。
結果は目覚ましいものでした。研究者がこの新しい「生徒」モデルを他のトップクラスのAIエディタと比較したところ、ほぼすべてのカテゴリーにおいて勝利しました。このモデルは、元のオブジェクトの外観をより良く保持し、より正確に配置し、背景をより自然に保ちました。人々が好みの画像に投票するユーザー調査において、InsertFuseは参加者の50%以上の支持を集め、競合を大きく引き離しました。この論文は、特定のスキルを習得するプロセスと、それらを組み合わせるプロセスを分離することで、AIを「専門家」でありながら「汎用家」でもある存在にすることができ、画像の編集における「水っぽいシチュー」の問題を一度に解決できることを示唆しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。