Analog Diffusion Models
本文介绍了模拟扩散模型(Analog Diffusion Models, ADMs),该模型利用模拟硬件动力学与隐式扩散推理之间的不动点对应关系,在无需重新设计模型或牺牲与标准训练生态系统兼容性的情况下,实现了全模拟、高效率的生成式人工智能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,人工智能的世界就像一个巨大的、高速运转的火车站。多年来,这些列车(我们的 AI 模型)变得越来越快、越来越强大,但它们也变得异常沉重且耗能。目前最流行的列车类型被称为“扩散模型”(diffusion model)。你可以把它想象成一位雕塑家,从一块混乱、充满噪声的大理石开始,通过一步步地凿去噪声,最终雕刻出一尊美丽的塑像。为了得到那尊完美的塑像,雕塑家必须进行数千次细微而谨慎的凿刻动作。每一次动作都需要时间和能量,随着塑像变得越来越大,这个过程对于我们目前的计算机芯片来说变得极其疲惫——这些芯片就像数字计算器,一次只能非常快速地做一件事情。
于是,“模拟计算”(analog computing)的概念出现了。如果说数字计算机像是一个以精确、独立的秒进行跳动的数字时钟,那么模拟计算机就像是一条流动的河流或一个摆动的钟摆。它们不计数步骤,而是让物理定律发挥作用。它们不是在计算一个数字,而是让信号流过电路,直到自然稳定在一个状态,就像钟摆最终会停在摆动底部一样。科学家们长期以来一直希望利用这些“流动”的机器让 AI 变得极其快速且高效。然而,一直存在一个顽固的问题:AI 算法是为“数字时钟”式的思维方式设计的。试图将它们强行运行在“流动河流”式的硬件上,通常意味着要么破坏 AI 的大脑,要么只能将硬件用于极小的一部分工作,而将繁重的任务留给旧有的、耗能巨大的数字计算机。
这篇论文介绍了一种巧妙的新方法来弥补这一差距,称为模拟扩散模型(Analog Diffusion Models, ADMs)。来自微软研究院(Microsoft Research)的研究人员发现,扩散模型“凿去”噪声的方式,与物理模拟系统自然“趋于稳定”的方式惊人地相似。他们没有强迫 AI 去改变自己的个性以适应硬件,而是重新构思了 AI 的步骤,让硬件能够自然地完成工作。他们在一种特殊的、利用光和电进行计算的光学计算机上进行了测试。在实验中,该系统成功地完全在模拟硬件上生成了图像和数据模式,每一步的过程仅需 10–15 微秒。
团队并没有止步于这个小型原型。他们使用了一个“数字孪生”(digital twin)——一个高度精确的硬件计算机模拟器——来测试这个想法在更大规模、更接近现实世界的 AI 模型(包括一些拥有数十亿参数的模型)上的表现。这些模拟表明,这种方法可能会成为一个游戏规则的改变者。通过使用这种“趋于稳定”的方法,AI 创建高质量图像所需的步骤可能比标准方法减少多达 16 倍。尽管这些新的步骤中的每一步都需要一些内部的“稳定”循环,但总的工作量显著下降了。研究人员指出,如果将这项技术扩展到未来的微型化硬件上,它可能会提供巨大的能源节省,在不需要重新发明我们所热爱的现有算法的情况下,让下一代 AI 变得更加可持续。
核心思想:让物理定律进行“凿刻”
要理解为什么这很重要,让我们看看传统的“雕塑”是如何工作的。在标准的数字 AI 中,计算机计算一步,停止,保存结果,再计算下一步,以此类推。这就像一个机器人,每移除一小块大理石,都必须停下来思考,然后再移动手臂。这既慢又耗电。
研究人员意识到,某些先进 AI 模型中使用的“隐式”(implicit)数学运算实际上是一个“不动点”(fixed-point)问题。通俗地说,这意味着寻找一个位置,如果你应用一个规则,你会回到完全相同的位置。这就像球从山上滚下;它会一直滚动,直到到达底部并停止。一旦到达底部,应用“向下滚动”这个规则就不会产生任何变化,因为它已经在那儿了。
这项研究的魔力在于,模拟硬件天生就会做这件事。 当你发送一个信号通过由光和电子组成的回路时,它并不计数步骤。它只是流动,直到达到稳定。作者意识到,如果他们正确设置 AI 模型,那么光和电子的“趋于稳定”过程本身就是 AI 在执行一步。硬件不需要被告知在一次计算后停止;它通过达到平衡状态来自然地找到答案。
实验:光、镜子与微型 LED
为了证明其可行性,团队构建了一台名为**模拟光学计算机(Analog Optical Computer, AOC)**的物理机器。想象一个由光组成的高科技微型迷宫:
- 光源: 他们使用微型 LED 阵列来代表数据。
- 权重: 他们使用了被称为空间光调制器(SLM)的特殊镜子,这些镜子可以改变反射光的强度。这些镜子充当了 AI 的“大脑”,承载着模型的权重(即知识)。
- 回路: 光从 LED 出发,撞击镜子,由传感器汇总结果,然后将结果反馈回系统中。
这创造了一个反馈回路。系统会不断调整自己,直到光模式趋于稳定。这种稳定过程发生在眨眼之间——具体来说,每一步仅需 10 到 15 微秒。
他们针对几种不同的任务进行了测试:
- 二维形状: 他们要求机器生成简单的二维图案,如心形、星形和字母。硬件成功完成了这项任务,生成的形状与他们的数字模拟几乎完美契合。
- 潜空间生成(Latent Space Generation): 他们使用了一种叫做“潜扩散”(latent diffusion)的技术(这也是现代图像生成器如 DALL-E 或 Stable Diffusion 的工作原理)。他们在模拟硬件上运行了整个迭代过程,仅在最后一步使用数字计算机将结果转化为图像。他们成功生成了手写数字(MNIST)、时尚单品(FashionMNIST)和字母(EMNIST)的图像。
大局观:模拟与扩展
他们构建的物理机器规模很小,拥有 2,304 个可编程权重。这与拥有数十亿权重的现代 AI 模型相比微不足道。那么,我们如何知道这在大型模型上行得通呢?
研究人员创建了一个“数字孪生”(Digital Twin, DT)。这是一个计算机模拟器,能够精准模拟其物理硬件的精确行为、噪声和特性。他们在常规数字计算机上训练标准 AI 模型,但告诉它们要预见到模拟机器的“噪声”和行为。然后,他们通过“数字孪生”运行这些模型,以观察如果这些模型实际运行在基于光的硬件上会表现如何。
他们测试了以下内容:
- 卷积神经网络(U-Nets)
- 扩散 Transformer(DiT)
- 拥有高达 130 亿个参数的巨型模型(如 FLUX.1 模型)。
结果非常令人振奋。在这些模拟中,模拟扩散模型(ADMs)可以达到与标准数字方法同样高质量的图像结果,但所需的扩散步骤减少了多达 16 倍。
例如,在处理蝴蝶图像数据集时,标准方法需要 128 步才能得到一张好照片,而模拟方法仅需 8 步即可获得相似质量。尽管这 8 步中的每一步都需要一些内部的“稳定”循环,但总的工作量仍然大大降低了。
这意味着什么(以及它不代表什么)
论文提出了一个新的前进方向。与其试图强迫 AI 算法去适应新硬件的限制(这往往会破坏 AI),不如将硬件的自然物理特性与算法的需求对齐。
该论文并未声称:
- 它并未表示这是一个今天就能买到的成品。该硬件目前仍处于原型阶段。
- 它并未声称已经解决了所有 AI 的能源问题。能源节省是基于模拟和已知的光学计算效率进行的“预测”。
- 它并未表示每一个 AI 模型都会通过这种方式变得更好。在某些特定测试中(例如使用 DiT 模型的 AFHQ 数据集),基础方法表现挣扎,但一种更高级的“Implicit-CN”(Crank-Nicolson)方法解决了这个问题。
置信水平:
作者在措辞上非常谨慎。他们通过小型硬件演示了这一概念。他们展示了二维和潜空间的结果与数字孪生相匹配。他们建议,由于数学逻辑成立,大规模扩展的结果(针对数十亿参数的模型)极有可能成立,但这些特定的规模化结果目前仍是模拟结果,而非在拥有数十亿权重的机器上的物理实验。
未来路线图
论文概述了未来的发展路线。目前的硬件大小约为一颗微型芯片。作者提出,通过三维堆叠这些光学系统(利用第三维度来路由光线,而不只是在平面上),他们可以在厘米级的体积内扩展到 1 亿个权重。
如果这种扩展得以实现,并且硬件能够以吉赫兹(GHz)级别的速度运行(这比目前的兆赫兹速度快得多),那么在实际计算部分,其能效有望比目前的数字芯片高出 100 倍。即使计入将结果转化为图像的最后一步数字处理成本,整个系统的效率仍可能比现有方法高出 26 倍。
简而言之,这篇论文表明,通过倾听光和电力的物理特性,让 AI 自然地“趋于稳定”而不是强迫它计数,我们或许终于可以释放几十年来模拟计算所承诺的巨大能源节省潜力。这是一种从“让算法适应机器”到“让机器发挥其所长”的转变。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。