Mage-Flow: An Efficient Native-Resolution Foundation Model for Image Generation and Editing
Mage-Flow 是一个紧凑型 4B 规模的基础模型家族,通过轻量化高保真 VAE、原生分辨率扩散 Transformer 以及系统级优化的协同设计,实现了高效、高分辨率的文本生成图像以及基于指令的编辑,在单 GPU 上提供了具有竞争力的性能和极低的延迟。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图打造一个机器人艺术家。多年来,让这位艺术家真正变得卓越的唯一方法,就是建造一个庞大的大脑,以至于需要用一整个仓库的超级计算机来运行它。这些“巨型大脑”可以绘制出令人惊叹的画作或编辑细节极其丰富的照片,但它们如此沉重且昂贵,以至于只有少数大公司才负担得起。它们就像是一辆法拉利,仅仅为了启动引擎就需要一支机械师团队。
“生成式人工智能”(Generative AI)领域的核心在于教计算机从无到有地创造新事物,比如图像。要做到这一点,计算机需要两个主要工具。首先,它需要一个分词器(Tokenizer),它就像是一个翻译官,将杂乱的高清照片转化为计算机能理解的精简指令列表。其次,它需要一个骨干网络(Backbone),即根据这些指令实际进行绘画的主引擎。一直以来的问题是,这个翻译官(分词器)通常反应迟钝且笨拙,尤其是在处理大型、精细的图像时,这使得整个过程非常缓慢。研究人员一直在追问的问题是:我们能否打造出一个既拥有巨型模型那般才华,又能小到足以在单台笔记本电脑上运行的机器人艺术家,且不丢失任何魔力?
于是,诞生了 Mage-Flow——来自微软 Mage 团队的一个新项目,它给出了肯定的回答:“是的,我们可以。”他们并没有尝试构建一个更大的大脑,而是决定从底层开始重新构建整个系统,使其变得极其高效。他们创造了一个仅有 40 亿参数(衡量规模的指标)的紧凑型“艺术家”,这与目前主导领域的 800 亿参数巨型模型相比,规模微乎其微。
以下是他们实现这一目标的方法,其中运用了一些聪明的技巧:
1. 超快速翻译官 (Mage-VAE)
把分词器想象成一个将照片转化为秘密代码的翻译官。旧的翻译官就像笨重且缓慢的行李箱;它们在打包和拆解过程中非常耗时,尤其是在处理高分辨率图像时。Mage-Flow 引入了一个新的翻译官,叫做 Mage-VAE。想象一下,他们不是制造了一个沉重的行李箱,而是制造了一台神奇的折纸机。它能将一张复杂的照片折叠成一个极小、整齐的包裹,并能在一瞬间将其重新展开成完美的图像。这个新的翻译官非常高效,它完成拆解图像的工作,所消耗的能量仅为旧款沉重模型的约 22 分之一。这意味着机器人艺术家几乎不需要等待翻译官完成工作。
2. 灵活的画布 (Native-Resolution)
通常情况下,当计算机绘制图像时,它们会将每张图片强行塞进一个僵化的网格中,就像试图把一个长方形和一个正方形都塞进同一个正方形盒子里一样。这会浪费空间并限制创造力。Mage-Flow 使用了一种名为**原生分辨率打包(Native-Resolution Packing)**的技术。想象一张可以根据想要绘制的图像形状进行伸缩的灵活画布,无论你想画的是宽阔的电影海报还是竖长的手机壁纸。计算机不再浪费时间把图像挤压进方框里,而是按照它们的原始形状进行绘制。这使得训练过程更快,并允许艺术家处理各种极端形状而不会产生混乱。
3. 涡轮引擎
即使有了快速的翻译官和灵活的画布,一步步绘制图像仍然需要一些时间。该团队使用了一种特殊的“蒸馏”(Distillation)技术,来创建其模型的 Turbo(涡轮) 版本。你可以把这理解为教艺术家如何通过“跨大步”而不是“小碎步”来完成绘画。如果说一位标准的艺术家可能需要走 30 步才能完成一幅画,那么 Turbo 版本只需 4 步即可完成。尽管步数减少了,但其质量依然保持得极高。
结果
团队将他们这个 40 亿参数的新艺术家与那些 800 亿参数的巨型模型进行了对比测试。结果令人惊喜。在单块强大的计算芯片(NVIDIA A100)上,Mage-Flow 生成一张 1024x1024 分辨率的高质量图像仅需 0.59 秒。对于编辑现有照片,它仅需 1.02 秒。
或许最令人印象深刻的是,Turbo 版本在编辑照片时大约只需一秒钟,且使用的内存非常少(约 18 GB),而那些巨型模型通常需要两到三倍的内存,且运行时间更长。论文表明,这种方法证明了你并不需要一个庞大、昂贵的大脑来创造高质量的艺术;你只需要一个聪明、高效的设计。
该论文还展示了该系统在编辑方面的出色表现。你可以告诉机器人“把背景换成海滩”、“移除那个人”或“添加文字”,它都能忠实地执行。他们甚至在针对性任务上测试了它:绘制带有箭头和文本的科学图表。这个小型 40 亿模型在经过少量额外训练后,绘制此类复杂图表的能力几乎可以媲美功能更强大的专门化模型。
简而言之,Mage-Flow 表明,AI 艺术的未来不在于把东西做得更大、更重,而在于让它们变得更聪明、更轻量、更快速,从而让强大的图像生成和编辑功能可以直接在你的桌面甚至口袋里的设备上运行,而无需依赖超级计算机。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。