Pixel-Space Diffusion via Observation Operators
本文引入了观测算子扩散(Observation Operator Diffusion)框架,该框架通过使用基于高斯-兰乔斯(Gaussian-Lanczos)算子的、随时间索引的由粗到精的观测轨迹,取代固定的全图监督,从而解决了像素空间模型中的尺度-时间失配问题,进而加速收敛并实现了最先进的生成质量。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能领域,计算机正在学习如何仅凭一组文字就凭空绘制图像。多年来,这个数字领域中最成功的艺术家一直是在一个压缩的、抽象的空间内工作,就像一位雕塑家在精雕细琢之前,先凿出一个粗略的石块形状。他们构建一个图像的简化版本,然后使用另一个工具将这个草图转化为高分辨率的照片。虽然这种方法效果不错,但在转换过程中不可避免地会丢失一些原始的纹理和锐度。一种更新、更直接的方法试图从一开始就逐像素地创建最终图像,承诺达到旧方法无法企及的清晰度。然而,这条直接的路径极难掌握,往往会导致产生模糊或不稳定的作品,且需要耗费巨大的时间来完善。
核心问题在于这些模型是如何学习“看”的。想象一下,当你站在浓雾中向别人描述远处的山脉。起初,你只能辨认出山峰宽阔、连绵的轮廓。随着雾气消散,树木和岩石的细节变得清晰可见。如果你在雾气还很厚时就试图描述每一片叶子和每一块石头,你就是在盲目猜测,你的描述也会充满错误。这正是当前这一代基于像素的图像生成器内部发生的情况。它们被迫在“噪声”之雾依然沉重时,就去预测图像的最精细细节,试图一次性预测整个画面。这种模型在特定时刻实际能看到的内容与它被要求预测的内容之间的错位,产生了一个混乱的信号,从而减慢了学习速度并降低了最终质量。
华东师范大学和京东的研究人员已经确定,这种特定的混乱是这些模型训练方式中的一个根本缺陷。他们发现,图像结构自然地呈现出从模糊到清晰的过程,而这个过程是需要时间的。然而,现有的模型忽略了这个自然的顺序。它们要求计算机在过程的每一个步骤中都预测完整的、清晰的图像,即使输入的内容在很大程度上仍是随机噪声。这迫使模型去纠结于那些在当时还无法恢复的细节,导致了混乱的学习体验。为了解决这个问题,该团队开发了一种新的训练方法,这种方法尊重图像恢复的自然时间线。他们不再要求模型一次性看清一切,而是教它通过一系列随时间变化的“镜头”来观察图像。
研究人员引入了一个系统,让计算机试图预测的目标随着噪声的变化而演变。在开始阶段,当图像噪声非常大时,模型仅被要求预测场景的宽阔、粗略的轮型。随着噪声逐渐减少,目标发生转移,要求模型加入稍多一点的细节,然后是更多,直到最后,在过程结束时,它才被要求预测完整的、高分辨率的图像。这是通过一族数学滤波器实现的,这些滤波器充当可调节的镜头,先平滑图像以仅显示大型结构,然后逐步揭示精细的纹理。通过将预测的难度与当前实际可见的内容相匹配,计算机接收到了更清晰的信号,使其能够学习得更快、更有效。
为了确保这一原则不仅在时间维度上奏效,也能在计算机的内部结构中发挥作用,该团队构建了一个新的解码器,这是一个负责将模型的内部想法转化为最终图像的组件。这个新解码器被设计为以分层的方式处理信息,从宏观布局开始,随着数据在网络中移动,逐渐精炼成微观细节。它在每个阶段注入特定的结构信息,确保模型在正确的深度关注正确的细节水平。这创造了一种凝聚的流动:首先建立全局布局,随后逐渐添加纹理和边缘,镜像了图像本身在去噪过程中显现的过程。
这种方法的成果是令人瞩目的。在针对包含数千种不同物体的标准图像集进行测试时,这种新方法产生的图像比以往任何尝试直接进行像素生成的尝试都要更加清晰和逼真。在一项关键测试中,该模型仅用了八十个训练周期就达到了最先进的质量水平,其速度明显快于其前身。经过进一步训练,它达到了1.52的质量得分,这一保真度水平超越了目前所有其他的直接基于像素的方法。生成的图像展现出了捕捉整体构图以及复杂细节(如动物皮毛的纹理或花朵的精致结构)的卓越能力,而没有出现经常困扰这类人工智能的模糊感。
这项工作表明,实现更好图像生成的途径不仅仅在于构建更大或更复杂的计算机,而在于理解信息变得清晰的自然顺序。通过尊重细节从噪声中显现的时间线,研究人员创造了一个学习效率更高、产出质量更高的系统。该方法成功地架起了数学噪声的抽象世界与高清晰度照片的现实世界之间的桥梁,证明了有时看清全貌最好的方式,就是先从观察大体轮廓开始。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。