← 最新论文
🤖 machine learning

Abra: Scaling Diffusion Image Training

本文介绍了 Abra,这是一个受控的流匹配 Transformer 系列,用于建立文本生成图像扩散模型的计算最优缩放法则,揭示了它们像语言模型一样具有可预测的缩放特性,但每个参数需要显著更多的训练数据,并且对过度训练具有鲁棒性。

原作者: Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

发布于 2026-08-19
📖 1 分钟阅读☕ 轻松阅读

原作者: Kyle Chickering, Wei-An Lin, Swayam Bhanded, Dan Saunders, Akshat Tripathi, Jiaming Song, Shyamal Buch, Xinchen Yan

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人工智能的现代时代,一场关于科学家如何构建最强大的计算机程序的技术革命正在悄然发生。多年来,研究人员一直依赖一套被称为“缩放法则”(scaling laws)的规则来决定如何分配计算资源。这些规则就像是一份预算指南,告诉工程师他们应该为软件构建一个稍大的“大脑”,还是为其喂养一个更庞大的信息库。在基于文本的 AI 世界中,这些规则非常明确:为了获得最佳效果,应当将计算预算大致平均地分配给模型规模和它阅读的数据量。这种平衡让机器能够以惊人的效率学习语言,从而诞生了我们今天看到的这些复杂的工具。然而,当涉及到教计算机生成图像时,这些规则却一直是一个谜。视觉数据比文本更加复杂且充满噪声,以往对图像生成器进行缩放法则映射的尝试,也受限于缺乏大规模实验。由于缺乏清晰的指南,开发者们一直在猜测如何平衡模型规模与数据量,这往往导致了巨大的能量和时间的浪费。

Luma AI 的一个研究团队现在介入并试图通过一项大规模的系统性实验来解开这个谜题。他们构建了一个受控的图像生成模型家族,其规模从极小到相当大不等,并使用了惊人的计算能力对其进行了训练——这比以往任何关于该主题的研究都要多得多。通过将这些模型推向三个不同的数量级计算成本,他们得以观察到性能是如何随着模型的增长而变化的。他们的研究表明,创造图像的规则与处理语言的规则有着本质的区别。文本模型在每单位规模阅读约二十个单词后达到效率巅峰,而图像模型则需要更沉重的“饮食”。研究人员发现,为了达到最优效率点,一个文本到图像的模型需要为其结构中的每一个参数看到大约两百个图像标记(tokens)。这意味着对于图像生成而言,数据的重要性是语言模型的十倍。那种平衡模型规模与数据的旧建议并不适用于此;相反,最有效的策略是优先为模型喂养更多的图片,即使这意味着要使用一个较小的“大脑”。

这项研究还为开发者发现了一个令人惊喜的“安全网”。在语言模型领域,如果你在过多的数据上训练时间过长,系统的性能可能会下降,从而导致额外的努力被白费。但在图像生成器方面,研究人员发现这些模型具有极强的包容性。如果从业者决定在比严格必要的时间内更长地训练模型,图像的质量并不会显著下降。事实上,性能的损失微乎其微,几乎可以忽略不计。这一发现为行业提供了一条实用的规则:训练一个较小的模型并喂养海量数据,要比冒险训练一个巨大的模型但数据不足更为稳妥。额外的训练时间起到了缓冲作用,确保了高质量的结果,而不会出现困扰其他类型 AI 的资源浪费惩罚。

除了最终的图像质量外,团队还观察了这些模型如何在它们的数字大脑中理解世界。他们测试了模型是否擅长识别物体和模式,这种技能被称为“表示学习”(representation learning)。他们发现,理解图像的最优效率点出现在比生成图像时更低的数据量水平。一个模型可以在变得完美绘画之前,就非常擅长识别一只猫或一片风景。这表明模型的内部知识及其创作艺术的能力是以不同的速率增长的。此外,研究人员观察到,随着图像分辨率的提高,对数据的需求也会随之增大。训练一个用于创建高分辨率图片的模型,比训练一个创建低分辨率素描的模型,需要更多的图像信息量。

或许最深刻的发现是,这些图像生成模型遵循一种通用的学习模式。当研究人员调整数据以考虑模型规模和所使用的计算量时,所有模型的训练进度都坍缩到了同一条平滑的曲线上。这种被称为“缩放坍缩”(scaling collapse)的现象意味着,微型模型的行为可以准确预测巨型模型的行为。这表明,学习的底层机制在所有规模之间都是一致的,这为工程师提供了一个强大的工具,使他们无需先构建并训练一个庞大的模型,就能预测未来大规模模型的表现。

研究人员还检查了不同的成功衡量标准(例如图像与文本描述的匹配程度以及图像的真实感)如何随计算能力而变化。他们发现,这些不同的目标并不都在同一时间达到顶峰。某些指标(如图像对提示词的遵循程度)偏好与另一些指标(如图像与现实世界照片分布的接近程度)不同的数据与规模平衡。这表明图像生成器并不存在单一的“完美”设置;最佳配置完全取决于用户希望模型执行的任务。此外,他们发现用于引导生成过程的设置(控制模型遵循指令的严格程度)需要随着模型规模的增大而进行调整。更强的生成能力实际上需要更少的引导即可产生好的结果。

最后,这项工作为图像生成的未来提供了一张清晰的、由数据驱动的地图。它推动该领域从猜测转向对资源分配的精确理解。核心结论是:对于图像创作而言,数据才是王道。最有效的路径不是构建尽可能大的模型,而是确保无论构建什么样的模型,都要为其喂养海量的视觉信息。通过遵循这些新规则,开发者可以构建出更好、更高效的系统,在创造出惊艳图像的同时,不会浪费训练它们所需的巨大能量。这项研究证实,虽然通往完美图像生成的路径与通往完美语言的路径不同,但它同样是可预测的,并且同样充满了探索的可能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →