← 最新论文
🤖 machine learning

Continuous Adversarial MeanFlow Transfer

本文介绍了 MeanFlow-Transfer 和连续对抗性均值流(Continuous Adversarial MeanFlow, CAMF),这是一个统一的框架,旨在将异构的预训练流模型适配到有限数据的全新领域,同时将生成过程加速至少步采样,从而在减少高达 125 倍神经函数评估次数的情况下,实现了最先进的生成质量。

原作者: Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

发布于 2026-08-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Yara Bahram, Zahra Dehghani, Mélodie Desbos, Eric Granger, Pablo Piantanida, Mohammadhadi Shateri

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能领域,计算机已经学会了创造出令人惊叹的逼真图像,从山峦上的日落到从未存在过的人像。这些系统通常被称为生成模型,它们通过学习数百万张照片的统计模式来工作。它们从随机噪声开始,并逐步进行精细化处理,一步步直到清晰的图像显现出来。多年来,这个过程就像是一场缓慢而细致的雕塑过程,需要数百次微小的调整才能把握好细节。虽然结果很美,但制造这些图像所需的时间和计算能力一直是一个主要的瓶颈。研究人员一直试图加速这一过程,希望能仅用几步就创造出高质量的图像,但他们面临着一个棘手的问题:那些让这些图像生成变快的工具往往被锁定在特定的格式中。一个被训练用于预测一种类型模式的模型,很难被轻易教导去预测另一种模式;而且一个为特定主题(如猫)设计的模型,在尝试适应新主题(如汽车)时,往往难以在不损失速度或质量的情况下进行转换。

蒙特利尔高等理工学院(ÉTS Montreal)的一个研究小组开发了一种能够同时解决这两个问题的新方法。他们创建了一种方法,可以将任何现有的、缓慢的图像生成器——无论其最初是如何构建的——快速适配以创建不同主题的新图像,同时使过程快上数百倍。他们的系统被称为 MeanFlow-Transfer,充当了一个“通用翻译官”。它获取预训练的慢速模型的输出,并将其转换为任何快速生成器都能理解的共享语言。这使得该系统可以从一个基于大规模通用图像数据集训练的模型开始,并仅使用少量的全新数据,就能立即教会它如何创建特定事物(如鸟类或汽车)的高质量图像。其结果是,该生成器只需寥寥数步即可产生清晰、细腻的图像,而此前完成这一任务需要数百步。

为了确保这些快速生成的图像在冲刺过程中不会丢失精细细节,研究人员在流程中加入了第二个阶段。他们引入了一个使用称为“对抗训练”学习技术的精炼步骤。在这个阶段,第二个神经网络充当“评论家”,将快速生成器产生的图像与真实照片进行对比。这个评论家不仅仅是检查整体形状是否正确,还会观察起始噪声与最终图像之间的微妙变化,检查图像生成的整个路径是否合理。这有助于系统找回那些在试图加速时经常被模糊掉的微小细节。通过将这种转换方法与这种批判性的眼光相结合,团队发现他们的系统可以达到甚至超越原始慢速模型的质量,但计算步骤减少了高达 125 倍。

研究人员通过选取四种不同类型的预训练模型(每种模型都具有不同的内部逻辑),并将它们适配到五个不同的新领域,包括鸟类、汽车和艺术品图像。在每种情况下,系统都成功地将原始模型的知识转移到了新主题中。当研究人员使用标准指标测量图像质量时,新系统产生的结果与针对新任务进行微调的原始模型一样好,甚至更好。或许更令人印象深刻的是,它在实现这一质量的同时,仅使用了极小部分的计算能力。例如,一个原本需要 250 步才能生成一张高质量鸟类图像的模型,现在只需四步即可完成,且不会失去清晰度。

该团队还发现,试图强迫旧模型遵循新的步数计划(这是其他一些研究人员尝试过的方法)实际上会导致训练不稳定并使结果变差。相反,他们的成功源于简单地将不同模型对图像的“思考方式”映射到一种单一的、通用的描述运动的方式中。他们证明了这种方法之所以奏效,是因为它尊重了图像形成的底层物理机制,而不是试图将它们强行塞入一种僵化的新模式。此外,他们表明,这种检查图像生成全过程的精炼技术,实际上是早期仅检查最终时刻的方法的一种自然延伸。随着检查之间时间步长的减小,他们的方法会平滑地转化为较旧、较简单版本,这证明了他们的新方法是前人方法的更强大、更灵活的版本。

这项工作之所以重要,是因为它打破了让快速图像生成受限于特定类型模型或主题的障碍。在此之前,如果你想要一个针对新类型图像的快速生成器,你通常必须从头开始,或者接受质量下降的代价。现在,一个单一的框架可以获取各种现有的、强大的模型,并将它们转变为适用于任何新任务的快速、专业的工具。研究人员证明,通过使用他们的方法,利用极少量的数据即可创建一个针对新领域的、高质量的生成器,这使得高级图像合成变得更加触手可及且高效。这些发现表明,生成式人工智能的未来可能不在于构建更大、更慢的模型,而在于寻找更聪明的方法来适配和加速我们现有的模型。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →