MRT: Masked Region Transformer for Layered Image Generation and Editing at Scale
本文介绍了 MRT,一种在 1000 万样本上训练的 200 亿参数掩码区域扩散模型,它统一了文本到图层、图像到图层和图层到图层任务,以实现最先进的实时多层透明图像生成与编辑,其质量和效率均优于现有商业系统及同期系统。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象你拥有一款数字图片编辑器,比如 Photoshop,你可以在其中操作独立的“图层”。你可以移动文本框、更改背景或替换图标,而不会破坏图片的其他部分。现在,想象一种人工智能,它不仅仅生成一张扁平的成品图片,而是像人类设计师一样,逐层构建这张图片。
这正是论文"MRT:掩码区域 Transformer"所探讨的内容。以下是对他们构建的内容及其工作原理的简单拆解,并借助一些日常类比来说明。
核心难题:“扁平蛋糕”与“分层蛋糕”
当今大多数 AI 图像生成器就像只制作扁平蛋糕的烘焙师。它们给你一张成品图片,但如果你想更换顶部的樱桃,就必须重画整块蛋糕。你无法轻易移动樱桃或更改糖霜,否则海绵蛋糕也会遭殃。
研究人员希望打造一种能烘焙分层蛋糕的 AI。他们希望系统能分别生成海绵蛋糕、夹心、糖霜和樱桃,这些是独立且可移动的部件,便于后续编辑。这被称为“分层图像生成”。
解决方案:MRT(主厨)
Canva Research 的团队构建了一个名为MRT(Masked Region Transformer,掩码区域 Transformer)的大型 AI 模型。把它想象成一位主厨,他研究了超过1000 万种不同的图形设计(海报、传单、广告),从而学会了如何从零开始构建这些分层蛋糕。
以下是这位主厨拥有的三大“超能力”:
1. “魔法食谱”(文本转图层)
你可以给 AI 一段文字描述,例如:“一张迪斯科派对的宣传海报,带有一个发光的球体和'8 折优惠’的标语。”
- 旧式 AI:会画出一张扁平的迪斯科场景图。
- MRT:将背景、迪斯科球和文字作为独立的透明图层绘制出来。你可以将文字图层移到左侧,或者将迪斯科球换成星星,而海报的其他部分保持完美无损。
2. “逆向工程”(图像转图层)
这就像将一块做好的扁平蛋糕神奇地拆解回其原料。
- 任务:你上传一张扁平图片(例如网站截图或海报)。
- MRT 的工作:它识别出哪些属于背景,哪些是文字,哪些是图片。然后,它将它们“剥离”成独立的、可编辑的图层。
- 技巧:论文声称,即使在处理包含许多重叠元素的复杂设计时,这项功能也表现极佳,而且比目前可用的其他工具更快、更准确。
3. “自由组合”(图层转图层)
这是编辑部分。你可以给 AI 一个设计,并说:“在这里添加一个新图层”或“将这一特定图层的风格更改为与其余部分匹配”。
- 示例:你有一张带有蓝天的海报,想添加一个新的太阳。MRT 会以完美契合现有天空的光线和风格的方式添加太阳。或者,你上传一张猫的照片,并说:“让这只猫看起来像一张适合这张海报的卡通贴纸。”MRT 会瞬间完成转换。
秘密配方:他们是如何做到的
1. “溢出”技巧(超大画布)
通常,当 AI 绘制图片时,它会裁剪掉超出画框的部分(就像照片边缘伸出的树枝被切掉一样)。
- MRT 的创新:他们教导 AI 在一个比最终图片更大的巨大隐形画布上作画。这允许元素“溢出”边缘。
- 重要性:如果你后来想将那根溢出的树枝移到海报的另一侧,AI 保存的是整根树枝,而不仅仅是可见的那部分。它保持了部件的完整性和可编辑性。
2. “掩码”游戏
想象你在玩一个游戏,必须猜出毯子下面是什么。
- 文本转图层:AI 从一个空白、充满噪点的画布(像旧电视的雪花屏)开始,然后填充各个图层。
- 图像转图层:AI 被给予成品图片(毯子被掀开),但被要求“掩码”(遮盖)背景和文字,然后仅“重绘”这些特定部分以实现分离。
- 通过这种“掩码”技术,同一个 AI 核心可以同时处理从头创作、拆解事物和编辑事物。
3. 加速(“蒸馏”)
通常,生成复杂的分层图像需要很长时间(就像等待慢速计算机渲染一样)。
- 研究人员使用了一种称为蒸馏的技术。这就像一位大师级厨师(缓慢但完美的老师)教导一名学徒(快速的学生),如何用 8 步而不是 50 步来烹饪同一道菜。
- 结果:现在,AI 可以在实时(约 3 到 6 秒)内生成这些复杂的分层设计,而不会损失太多质量。
结果
论文将 MRT 与其他顶级 AI 模型和商业工具进行了比较。
- 质量:在用户测试中,人们更喜欢 MRT 的结果,因为它的图层更清晰,文字效果更好,且各个部分结合得更自然。
- 速度:在拆解复杂图像时,它比竞争对手"Qwen-Image-Layered"快10 到 100 倍。
- 内存:它使用的计算机内存显著更少,意味着它可以在标准的强力显卡上运行而不会崩溃。
总结
这篇论文提出了一种工具,它将数字图像视为可编辑的乐高套装,而非静态画作。它可以仅凭文本描述构建这些套装,拆解成品图片以揭示乐高积木,或者交换积木以改变设计——同时保持部件的完整性,即使它们超出了盒子的边缘。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。