Images in Sentences: Scaling Interleaved Instructions for Unified Visual Generation
本論文は、画像をテキスト指示内のネイティブ語彙トークンとして埋め込み、1500 万の交互サンプルからなるスケーラブルなデータエンジンを活用して、複数の画像の一貫性と複雑な指示の追従において既存の手法を大幅に上回る統合的な視覚生成モデル「INSET」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
あなたがアーティストに、非常に具体的で複雑な指示を出そうとしている状況を想像してください。
従来の方法(「索引カード」の問題)
現在、ほとんどの AI 画像生成ツールは、数字しか理解できない司書のように機能します。ある写真から特定の犬、別の写真から特定の帽子、さらに別の写真から特定の背景を含む画像を生成したい場合、あなたは次のように指示を出さなければなりません。「画像#1 の犬、画像#2 の帽子、画像#3 の背景を使って絵を描いてください。」
AI は描画を行っている間、どの数字がどの画像に対応するかを記憶しなければなりません。画像を追加すればするほど、AI は混乱します。どの帽子がどの犬に合うかを忘れたり、追加された画像を完全に無視したりします。これは、目隠しをして 5 つのボールをジャグリングしようとするようなものです。いずれはボールを落としてしまいます。
新しい方法:「文の中の画像」(Inset)
この論文は、Inset(Images in Sentences)と呼ばれる新しいモデルを導入します。画像を番号付きの別ファイルとして扱うのではなく、Inset は画像を文の中の単語のように扱います。
物語を書いていると想像してください。ただし、「犬」という単語を書く代わりに、その特定の犬の完璧な小さな画像を、そのまま文の中に貼り付けます。
- 従来の方法:「画像 1 の犬を椅子の上に置いてください。」
- Inset の方法:「[犬の画像] を椅子の上に置いてください。」
画像が文の中で「椅子」という単語のすぐ隣にあるため、AI は数字を推測したり記憶したりする必要がありません。意味はそこ、まさに目の前にあります。これにより、AI は混乱することなく、多数の異なる画像を含む複雑な指示を処理できるようになります。
AI の訓練方法(「データ工場」)
このように AI に教えるため、研究者たちはインターネット上に十分な例を見つけることができませんでした。なぜなら、それらは稀だからです。そこで、彼らはスケーラブルなデータエンジン(データのロボット工場)を構築しました。
- 写真の場合:彼らは数百万枚の写真を取得し、他の高度な AI を使ってそれらを分解しました。すべての物体(「赤い花瓶」や「青い猫」など)を特定し、それについて文を作成し、その説明があった場所に、その物体の実際の画像を直接文の中に挿入しました。
- 動画の場合:彼らは動画を見て、物事がどのように変化するかを AI に教えました。動画が猫がジャンプする様子を示している場合、「開始時の猫(座っている猫の画像)を持ってきて、ジャンプさせてください(ジャンプしている猫の画像)」という指示を作成しました。これにより、AI は単なる静的なコピーではなく、動きや変換を理解することを学びます。
彼らはこのモデルを訓練するために、これら「画像付き文」を1500 万作成しました。
結果
彼らは、多数の異なる画像を 1 つの複雑なリクエストに混ぜるという困難な課題であるInterleaveBenchで、この新しいモデルをテストしました。
- スコア:2 枚の画像を使用するよう求められた場合、Inset はうまく機能しました。しかし、5 枚の画像を使用するよう求められた場合、従来のモデルは崩壊しましたが、Inset はさらに性能を向上させました。オブジェクトが元の画像のように見えることを保ち、テキストの指示に従う点において、Inset ははるかに正確でした。
- ボーナス:AI が画像を指示の一部として扱うことを学んだため、編集も行うことができます。特定のシャツの画像を見せて、「このシャツを写真の中の人物に着せてください」と言えば、AI は「シャツ」がどのようなものか推測するのではなく、そのシャツの正確なデザインをコピーします。
まとめ
この論文は、AI が画像を参照するために「数字」を使用するのをやめ、代わりに画像を単語であるかのように「読む」ことを可能にすることで、複雑な画像の生成と編集のためのはるかに強力なツールを作成できると主張しています。彼らは、膨大な練習例のライブラリを構築し、新しいモデルが特にタスクが複雑になる場合に、すべての既存のオープンソースの競合他社を上回ることを示すことで、これを証明しました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。