Spatially-Grounded Flow Matching: Structured Source Distributions for Image Generation
该论文介绍了 StructFlow,这是一个将空间局部性引入源噪声分布以产生几何对齐传输路径的流匹配框架,从而使其与依赖非结构化独立同分布(i.i.d.)高斯噪声的标准方法相比,能够实现更优越的局部编辑、结构保持和语义插值。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
人工智能领域最近已经学会了绘制那些往往与现实难以分辨的图像。这些被称为生成式模型的系统并不只是简单地复制现有的照片;它们学习的是图像构建的底层规则。它们从一个混沌的静态云团——一个随机噪声场——开始,然后一步步地逐渐细化,直到一个连贯的场景显现出来。多年来,创建这种初始噪声的标准方法是将每一个像素都视为一个独立的陌生人。在传统的方法中,画布上一个位置的噪声与其相邻位置的噪声之间没有任何关系。这种方法虽然产生了惊人的结果,但它忽略了一个关于物理世界运作方式的基本真理:靠在一起的事物通常属于同一个整体。一片蓝天不会在像素之间随机闪烁;它形成一个平滑且连续的区域。
马里德大学和 Netflix 的研究人员提出了一种新的启动这一创作过程的方法,这种方法从最初一刻起就尊重图像的自然结构。他们将这种方法称为 StructFlow。他们并没有向人工智能输入一团完全随机、互不相连的噪声,而是引入了一种已经具备组织性的噪声源。在他们的系统中,作为邻居的像素在初始噪声中共享一个共同的“声音”或一个共享的组件。这意味着当人工智能开始工作时,它并不是试图在混乱的废墟上强加秩序;它是在一个已经暗示了现实生活中局部连接性的基础上开始工作的。通过将这种空间感知能力直接构建到起点中,研究人员发现,他们可以引导人工智能生成不仅质量高,而且在特定局部方式上更容易编辑和控制的图像。
这项工作的核心思想是,标准的方法在生成图像时是在对抗图像的自然行为。在传统的设置中,人工智能必须花费大量的学习能力来弄清楚为什么相邻的像素应该是相似的,这是它在每次生成图像时都必须从零开始解决的任务。研究人员假设,通过给模型一个领先优势——即让初始噪声反映出邻居之间存在相关性的事实——他们可以让模型腾出精力去关注其他细节。为了测试这一点,他们开发了一个系统,首先将图像分解成小的、不规则的区域,类似于马赛克。在这些微小区域内部,噪声并不是随机的;它是共享的。这创造了一个结构化的起点,其中图像不同部分之间的边界已经被噪声本身所尊重。
当他们使用这种新的、结构化的噪声训练模型时,结果立竿见影且令人惊喜。人工智能生成图像的效果与使用旧的随机噪声训练的模型一样好,但有一个明显的优势:图像保持了更好的结构。因为噪声本身已经有了组织,模型不需要费力去保持边缘锐利或区域一致。这导致了一种以前难以实现的全新能力:细粒度编辑。在过去,如果用户想要改变生成图像中一只鸟翅膀的颜色,而不影响背景中的天空或树木,人工智能往往会表现得力不从心,要么使变化变得模糊,要么意外地改变了背景。有了 StructFlow,由于翅膀的噪声已经成组并与天空的噪声分离,研究人员只需对仅该翅膀的噪声进行重采样即可。结果是得到了一个看起来不同但位置保持完美的翅膀版本,而图像的其余部分则纹丝不动。
研究人员还发现,这种方法帮助人工智能更快地理解图像。在标准模型中,告诉人工智能某个物体是什么的内部特征,往往直到生成过程的最后阶段才会变得清晰且有组织。通过 StructFlow,这些特征很早就出现了。模型在生成过程的前几步内就开始识别物体的形状及其边界,远在最终图像清晰之前。这表明,通过将初始噪声与图像的自然结构相对齐,人工智能可以从底层开始构建一个更具逻辑性和连贯性的画面。团队在包括从文本描述生成图像和创建人脸在内的多种任务上进行了测试,发现该方法在不同类型的数据上都能稳定发挥作用。
为了使这项工作保持稳定,研究人员必须解决一些棘手的问题。仅仅让噪声相关化会导致训练过程不稳定,使模型难以学习。他们通过引入一种渐进式的训练计划解决了这个问题。他们从几乎是随机的噪声开始训练,这种噪声对模型来说很容易处理,然后随着模型的学习,逐渐加强相邻像素之间的连接。这使得系统能够平稳地适应这种新的、结构化的思维方式。他们还发现,可以将这种技术应用于已经使用旧方法训练过的模型。通过获取一个强大的、预先存在的图像生成器,并用他们的结构化噪声对其进行微调训练,他们可以升级其能力,而无需从头开始构建一个新模型。这意味着他们的方法带来的益处可以被添加到目前正在使用的最先进的图像生成器中。
这项工作的意义超越了仅仅制作更漂亮的图片。它为我们如何教机器观察和创造提供了一种新的思考方式。通过承认世界是由相互连接的部分而非孤立的点组成的,研究人员展示了我们可以构建更直观、更可控的工具。能够精确地编辑图像的特定部分,或者在保持布局完全相同的情况下生成场景的多样化变体,这为设计师和艺术家开辟了新的可能性。这项研究表明,初始化这些系统的方式与系统本身的架构同样重要。通过将创造力的源头植根于空间关系的物理现实中,StructFlow 证明了,我们在起始方式上的微小改变,可以带来最终成果的显著提升。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。