The Loss Floor of Denoising Score Matching: Fisher Geometry from Schrödinger Bridges
本文确立了去噪分数匹配中不可约训练损失的下界恰好是条件端点族 Fisher–Rao 度量的积分迹,该结论是通过施罗德桥(Schrödinger bridge)变分原理推导而出的,从而揭示了信息几何是扩散模型训练的一个内在组成部分,并解释了为什么原始损失值可能无法在不同噪声调度下一致地对模型进行排序。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在过去的几年里,一种新型的人工智能出现了,它能够通过简单的文本描述创建出令人惊叹的逼真图像、视频和声音。这些被称为扩散模型(diffusion models)的系统,其工作原理是学习逆转一个逐渐破坏的过程。想象一下,将一张清晰的照片慢慢加入静态噪声,直到图像变成一片模糊、无法辨认的杂乱状态。扩散模型学习的是逆过程:从纯粹的噪声开始,学习如何逐步移除这些静态噪声,直到清晰的图像重新出现。为了实现这一点,模型被训练去预测如何将带有噪声的图像推向清晰。这种训练过程依赖于一个被称为“得分”(score)的数学目标,它本质上是指向清晰数据所在方向的矢量。多年来,研究人员一直使用一种标准方法来教授模型这项技能,假设如果模型学会了平均而言正确预测方向,它最终就能掌握生成新图像的任务。
然而,一项新的研究揭示了这种标准的训练方法包含了一个被忽视的、隐藏的且不可避免的代价。研究人员发现,模型试图学习的目标并不是一个单一、固定的方向,而是一个随机变量,每次模型观察带噪声的图像时都会发生变化。由于模型被迫去猜测这个不断变化的靶点,训练过程总是会包含一个基础性的误差,无论多么改进学习方法或使用多么强大的硬件都无法消除这一误差。这种误差并非模型设计的缺陷,而是用于教导它的数学逻辑中固有的属性。该研究将这种不可避免的误差识别为数据中 Fisher–Rao 度量的迹(trace),它衡量了随着噪声的加入,关于原始图像的信息丢失了多少。通过分离出这一隐藏成本,研究人员表明,比较不同模型的原始训练得分可能会产生误导,因为得分在很大程度上取决于噪声是如何添加的,而非仅仅取决于模型本身的好坏。
这一发现的核心在于理解模型“需要知道什么”与它“实际上被要求学习什么”之间的区别。模型的理想目标是学习指向所有可能产生特定噪声状态的清晰图像的平均方向。这个平均方向就是数据的真实“得分”。但在实践中,计算这种平均值是不可能的。相反,训练过程要求模型基于用于创建噪声的单个随机清晰图像来猜测方向。虽然这种猜测在多次尝试中平均而言是正确的,但任何单次猜测都是带有噪声且具有不确定性的。研究证明,使用这些随机猜测引入的额外误差,恰好等于条件端点族(conditional endpoint family)的 Fisher–Rao 度量的迹。用通俗的话说,这是衡量带噪声的图像在多大程度上能告诉我们关于其来源的特定清晰图像的信息。随着噪声的增加,这种信息逐渐消退,研究表明,总训练误差的累积速率恰好等于这种信息的丢失速率。
这一发现改变了我们看待这些强大人工智能系统训练方式的角度。研究人员证明,报告的训练总误差实际上由两个截然不同的部分组成:一部分是模型可以通过更好地学习来解决的误差,另一部分是由于训练目标的随机性而产生的不可还原误差。他们将这部分不可还原的误差称为“损失底限”(loss floor),它完全取决于数据和训练过程中使用的噪声方案,而不是取决于模型本身。因此,如果两个模型的训练使用了不同的噪声方案或不同的噪声范围,它们的原始训练得分是不能直接比较的。一个使用更宽噪声范围训练的模型,可能仅仅因为必须承担更大的“底限”成本,而在表现上显得误差更高,即便它实际上是一个更好的模型。研究提供了一种减去这一隐藏成本的方法,从而揭示模型的真实性能。在测试中,通过移除这个底限,研究人员纠正了模型的排名,显示出原本更好的模型确实更好,而这一事实此前一直被训练过程中的数学噪声所掩盖。
研究还把这种训练误差与数据的基本几何结构联系起来。研究表明,不可还原的误差与数据所处的空间的形状有关。例如,如果数据是由高维空间中的低维曲面上的图像组成的,那么误差随噪声增加而增长的速率就会揭示该曲面的维度。这意味着训练过程本身包含了一个关于数据复杂性的内置测量。此外,研究澄清了我们安排噪声的方式——即我们添加噪声的速度以及我们在不同阶段赋予的权重——并不会改变这种不可还原误差的总量。它只是改变了误差在路径上的分布位置。这表明,虽然我们可以重新调整训练过程以提高效率,但我们无法消除从噪声数据中学习的根本成本。
这项工作的其中一个最实际的意义在于提供了一种评估和比较不同 AI 模型的新方法。作者展示了通过计算并减去这个隐藏的底限,研究人员可以获得衡量模型学习能力的真实指标。他们在已知模型质量的合成数据上进行了测试。当观察原始训练数值时,模型的排名有时会发生倒置,使得一个较差的模型仅仅因为使用了特定的噪声方案,看起来比一个好的模型还要好。一旦减去了底限,正确的排名便得以恢复。这表明目前报告训练进展的标准是不完整的,未来的比较应当考虑到这种几何成本。该研究并非提出一种新的训练算法或新的图像生成方法,而是对现有方法提供了更清晰的理解。它揭示了训练过程中一直存在、等待被测量的隐藏层。
研究人员还探讨了这一概念如何应用于其他类型的数据,例如文本,其中的过程涉及遮蔽单词而非添加高斯噪声。他们发现那里也存在类似的隐藏成本,这种成本与数据的熵(即不确定性)相关。这表明该原理在不同的生成模型中是通用的。研究结论指出,数据的几何结构、信息的流动以及训练目标,都是对同一底层现实的不同描述。“损失底限”不是一个待修复的漏洞,而是信息宇宙中的一个特征,必须予以承认。通过将模型的学习能力与训练方法中不可避免的成本相分离,我们能够对这些人工智能系统究竟能达到什么样的成就,获得一个更诚实、更准确的认识。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。