← 最新论文
⚛️ high-energy theory

Information Spreading in Diffusion Models from Effective Field Theory

本文证明了卷积分数匹配扩散模型中局部性的归纳偏置使其去噪动力学能够有效地使用有效场论进行描述,其中点与点之间的互信息增长在玩具示例和 MNIST 数据集上均与布朗运动模型的预测相一致。

原作者: Navonil Neogi, Nabil Iqbal

发布于 2026-08-17
📖 1 分钟阅读🧠 深度阅读

原作者: Navonil Neogi, Nabil Iqbal

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正试图理解一台复杂的机器是如何运作的,比如汽车引擎。通常,为了理解汽车是如何移动的,你可能会尝试追踪金属中的每一个原子、火花塞中的每一次火花,以及每一分子燃料。这工作量巨大,而且通常你并不需要了解那么多细节就能理解大局。在物理学中,有一个聪明的技巧叫做“有效场论”(Effective Field Theory)。这就像是在说:“我不需要知道每个齿轮的确切形状,就能知道汽车会跑多快;我只需要知道引擎在远距离观察时表现出的几个关键规则。”这个想法让科学家们可以忽略微小的、混乱的细节,转而关注涌现出的平滑、宏大的模式。

现在,想象另一种类型的机器:一个能够创作艺术的人工智能。这些“扩散模型”(diffusion models)因能将纯粹的静态噪声——就像旧电视上的灰色雪花点——转化为美丽的、清晰的猫、风景或数字图像而闻名。它们通过逐步“去噪”的过程来完成这项工作,从混沌中提取结构。但人工智能是如何知道如何将像素组合在一起的呢?它是记住了它训练过的每一张图片,还是学习了一种构建图像的通用规则?这篇论文提出了一个大问题:我们能否利用这种“忽略微小细节”的物理学技巧,来理解这些AI艺术生成器究竟是如何工作的?作者们想要知道,信息在AI图像中的传播方式是否遵循简单、可预测的规律,就像热量在金属盘中扩散或墨水在水中扩散一样。

这篇论文的作者 Navonil Neogi 和 Nabil Iqbal 决定在一个特定的AI模型上测试这个想法,这种模型使用了“卷积”(convolutional)层——这种设计每次只观察图像的小块区域,就像我们的眼睛扫描场景一样。他们认为,由于这些模型专注于局部邻域,它们的行为就像受“局部性”(locality,即事物只影响其直接邻居)和“对称性”(symmetry,即规则不会因为你将图像向左或向右移动而改变)支配的物理系统。通过将有效场论的数学应用于这些AI模型,他们发现了一个关于这些模型如何创造图像的、令人惊讶的简单故事。

以下是他们的发现。当AI从纯噪声开始时,像素之间都是独立的;左边的像素并不知道右边像素的情况。随着AI开始去除噪声,信息开始传播。作者展示了这种信息的传播行为与一滴墨水在水中扩散或热量在固体中移动完全一致。他们称之为“扩散机制”(diffusive regime)。在这个早期阶段,“互信息”(mutual information,一种表达两个像素之间有多大关联性的高级说法)以一种非常特定且可预测的方式增长。如果你测量不同时间下两点之间的连接程度,其模式看起来就像一个完美的钟形曲线(高斯分布),并且随着时间的推移不断变宽。

论文通过两个不同的实验证明了这一点。首先,他们使用了一个极其简单的玩具模型,其中只有两种可能的图像:全为1的网格和全为-1的网格。在这种受控环境下,他们可以写出精确的数学公式,并观察到信息传播完全符合他们的“扩散”理论预测。接着,他们在名为 MNIST 的真实世界数据集上进行了测试,该数据集包含手写数字。尽管真实的数字要复杂得多,但在图像创建的早期阶段,AI仍然遵循相同的规则。像素之间的连接增长方式与他们简单的“热传导方程”模型完美契合。

然而,论文也指出,这个简单的扩散故事并不会持续到永远。当AI接近完成图像时,行为发生了变化。作者描述了第二个阶段,称之为“捕捉机制”(snapping regime)。在最后这个阶段,AI不再进行平滑的信息传播,而是做出尖锐、果断的选择。图像的小块会突然“捕捉”并呈现出与训练数据中最接近的样本完全一致的样子。这就像是AI停止了颜色的混合,突然决定:“这一块肯定是‘3’,而不是‘2’。”论文表明,简单的扩散规则仅适用于过程早期混乱的部分,而最后的精细细节则是受这种“捕捉”行为支配的。

其中一个最有趣的发现是,早期阶段信息传播的速度完全取决于AI的架构——具体来说,取决于AI观察图像时使用的“卷积核”(kernel)或窗口的大小。无论AI是如何训练的,也不管使用了什么样的噪声去除方案,其“眼睛”的大小决定了图像组合的速度。作者甚至计算出,如果你改变这个窗口的大小,像素相互影响的距离会以一种可预测的方式发生变化,即与窗口大小呈线性比例关系。

简而言之,这篇论文表明,我们可以通过将AI图像生成的复杂创作过程视为一个简单的物理问题来理解它。在过程的第一部分,AI只是一个扩散器,像热量一样扩散像素之间的连接。只有在稍后阶段,它才会切换到另一种模式来完善细节。这并不意味着AI已经被“解决”了,或者我们理解了每一个神经元,但它为我们提供了一张关于信息如何在这些系统中流动的强大且简单的地图。作者展示了即使在深度学习这个混沌的世界中,只要我们知道去哪里寻找,简单的、普遍的规律就在那里等待着我们。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →