← 最新の論文
💻 computer science

MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale

本論文は、1000 万サンプルで学習された 200 億パラメータのマスク領域拡散モデルである MRT を紹介するものであり、テキストからレイヤー、画像からレイヤー、そしてレイヤーからレイヤーへのタスクを統合し、既存の商用および同時進行中のシステムと比較して優れた品質と効率を備えた最先端のリアルタイム多層透明画像生成および編集を実現する。

原著者: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

公開日 2026-05-27
📖 1 分で読めます☕ さくっと読める

原著者: Zhicong Tang, Zhao Zhang, Jingye Chen, Mohan Zhou, Yifan Pu, Yuchi Liu, Yalong Bai, Ethan Smith, Yuhui Yuan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

デジタルフォトエディタ(Photoshop のようなもの)を想像してみてください。そこでは「レイヤー」を個別に操作できます。テキストボックスを移動させたり、背景を変更したり、アイコンを入れ替えたりしても、画像の他の部分は損なわれません。次に、完成した平らな画像を生成するだけでなく、人間デザイナーがそうするように、画像をレイヤーごとに構築する AI を想像してみてください。

これがまさに論文「MRT: Masked Region Transformer」の主題です。彼らが何を作り、どのように機能するかを、日常的な比喩を用いてシンプルに解説します。

大きな課題:「平らなケーキ」対「層状のケーキ」

現在のほとんどの AI 画像生成ツールは、平らなケーキしか作らない Baker のようなものです。完成した画像を提供しますが、上のチェリーを変えたい場合、ケーキ全体を塗り直す必要があります。スポンジを壊さずにチェリーを動かしたり、フロスティングを変えたりすることは容易ではありません。

研究者たちは、層状のケーキを焼く AI を望みました。スポンジ、詰め物、フロスティング、チェリーを、後から編集可能な別々の可動部品として生成するシステムです。これは「層状画像生成(Layered Image Generation)」と呼ばれます。

解決策:MRT(マスターシェフ)

Canva Research のチームは、**MRT(Masked Region Transformer)**と呼ばれる巨大な AI モデルを構築しました。これは、これらの層状のケーキをゼロから構築する方法を学ぶために、1000 万以上のグラフィックデザイン(ポスター、フライヤー、広告)を研究した「マスターシェフ」と考えてください。

このシェフが持つ 3 つの主な「スーパーパワー」は以下の通りです。

1. 「魔法のレシピ」(テキストからレイヤーへ)

AI に「光るボールと『20% OFF』の看板があるディスコパーティーのポスター」といったテキスト記述を与えられます。

  • 従来の AI: ディスコの平らな画像を描きます。
  • MRT: 背景、ディスコボール、テキストを別々の透明なレイヤーとして描画します。テキストレイヤーを取り出して左に移動させたり、ディスコボールを星に変えたりしても、ポスターの残りの部分は完璧なままです。

2. 「リバースエンジニアリング」(画像からレイヤーへ)

これは、完成した平らなケーキを魔法のように元の材料に戻すようなものです。

  • タスク: 平らな画像(ウェブサイトのスクリーンショットやポスターなど)をアップロードします。
  • MRT の役割: 何が背景に属し、何がテキストで、何が画像かを特定します。その後、それらを「剥がして」別々の編集可能なレイヤーに分離します。
  • 工夫: 論文によれば、これは多くの重なり合う要素を持つ複雑なデザインであっても非常にうまく機能し、現在利用可能な他のツールよりもはるかに高速で正確です。

3. 「ミックス&マッチ」(レイヤーからレイヤーへ)

これが編集部分です。デザインを AI に与えて、「ここに新しいレイヤーを追加する」あるいは「この特定のレイヤーのスタイルを全体に合わせるように変更する」と指示できます。

  • 例: 青空のポスターがあるとします。新しい太陽を追加したい場合、MRT は既存の空の照明とスタイルに完璧に合うように太陽を追加します。あるいは、猫の写真をアップロードして「この猫をこのポスターに合うようなカートゥン風のステッカーのように変えて」と指示すると、MRT は即座に変換を行います。

秘密のソース:彼らがどのように行ったか

1. 「オーバーフロー」の工夫(巨大なキャンバス)
通常、AI が画像を描く際、フレームの外に出るもの(写真の端から突き出た木の枝など)は切り捨てられます。

  • MRT の革新: 最終的な画像よりも大きな巨大で目に見えないキャンバス上で描画するように AI を訓練しました。これにより、要素が端を「オーバーフロー」することを可能にします。
  • 重要性: 後でそのオーバーフローした木の枝をポスターの反対側に移動させたい場合、AI は見える部分だけでなく、枝全体を保存しています。これにより、部品は完全なまま、編集可能な状態に保たれます。

2. 「マスキング」ゲーム
ブランケットの下に何があるかを当てるゲームを想像してください。

  • テキストからレイヤーへ: AI は空白でノイズの多いキャンバス(古いテレビのノイズのようなもの)から始まり、レイヤーを埋めていきます。
  • 画像からレイヤーへ: AI には完成した画像(ブランケットが持ち上げられた状態)が与えられますが、背景とテキストを「マスキング(覆い隠す)」し、その後、それらの特定の部分だけを「再描画」して分離するよう指示されます。
  • この「マスキング」技術を使用することで、同じ AI ブレインが、ゼロからの作成、分解、編集をすべて同時に処理できます。

3. 高速化(「蒸留」)
通常、複雑な層状の画像を生成するには長い時間がかかります(低速なコンピュータがレンダリングするのを待つようなもの)。

  • 研究者たちは**蒸留(distillation)**と呼ばれる技術を使用しました。これは、マスターシェフ(遅く完璧な教師)が、弟子(速い学生)に、50 歩ではなく 8 歩で同じ料理を作る方法を教えるようなものです。
  • 結果: AI は、品質をあまり損なうことなく、これらの複雑な層状デザインをリアルタイム(約 3〜6 秒)で生成できるようになりました。

結果

論文は、MRT を他のトップ AI モデルや商用ツールと比較しています。

  • 品質: ユーザーテストにおいて、レイヤーがよりクリーンで、テキストが優れ、部品がより自然に組み合わさっているため、人々は他のシステムよりも MRT の結果を好みました。
  • 速度: 複雑な画像を分解する際、競合モデルである「Qwen-Image-Layered」よりも10 倍から 100 倍高速です。
  • メモリ: 使用するコンピュータメモリが大幅に少なく、クラッシュすることなく標準的な高性能グラフィックカードで実行できます。

まとめ

この論文は、デジタル画像を静的な絵画ではなく、編集可能なレゴセットとして扱うツールを提示しています。テキスト記述からこれらのセットを構築したり、完成した画像を分解してレゴのブロックを明らかにしたり、デザインを変更するためにブロックを交換したりできます。すべての際、ブロックが箱の端から突き出ている場合でも、部品は完全なまま保たれます。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →