Generative Models on Analog Hardware with Dynamics
本文引入了模拟交互系统(Analog Interaction Systems, AIS),这是一个通过采用时变参数和隐藏状态,在固定的物理决定型模拟硬件与灵活的生成模型之间架起桥梁的统一框架,与先前的基于硬件的方法相比,实现了2个数量级的能量降低,并在 MNIST 数据集上显著提高了 FID 分数。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图教一个机器人画画。
旧方法(数字计算机):
目前,我们使用强大的数字计算机(比如你游戏电脑中的 GPU 或数据中心)来完成这项工作。这些计算机就像是非常快速、非常精准的会计师。为了画出一幅画,它们将任务分解为数百万个微小的、离散的数学步骤。它们计算一下,停止;再计算一下,再停止。这个过程极其精确,但也会消耗大量的电力,就像为了画一张素描而运行一台高端空调一样。
新想法(模拟硬件):
本文作者提议使用“模拟硬件”来代替。不要把这看作是一个会计师,而要把它看作是一个巨大的、相互连接的秋千与弹簧游乐场。
- 在这个游乐场里,“计算”是自然发生的。如果你推一下其中一个秋千,绳索和链条的物理特性会自动带动相邻的秋千运动。
- 系统并不计算步骤;它只是在“流动”。它通过让物理定律(如重力或磁力)发挥作用来解决问题。这具有极高的能效,就像利用风力驱动帆船,而不是燃烧燃料。
大问题:
这里存在一种不匹配。现代 AI 模型像是灵活的软件,可以学习任何形状或模式。但我们的模拟游乐场是僵化的。秋千是以特定的方式通过物理连接在一起的,它们只能按照特定的模式运动。这就像是试图教一个秋千架画出一个完美的圆,但它的设计初衷只是为了前后摆动。这个“游乐场”本身并不具备足够的灵活性,无法在没有干预的情况下自主学习复杂的图像。
解决方案:“模拟交互系统”(AIS)
作者创建了一个名为“模拟交互系统”(AIS)的新框架来弥补这一差距。他们并没有试图强迫秋千去模仿数字计算机,而是找到了巧妙的方法,在不破坏物理定律的前提下,让游乐场变得更具表现力。
他们引入了三个主要的“窍门”,使这些僵化的秋千能够绘制复杂的图像:
分时控制(“指挥家”):
与其让秋千之间的连接关系永远固定不变,不如想象有一位指挥家每隔几秒钟就改变一次规则。在第一秒,秋联连接得很紧;在下一秒,连接变得很松。通过随时间改变“游戏规则”,系统可以创造出比规则固定时复杂得多的运动。隐藏的秋千(“幽灵舞者”):
作者添加了一些“隐藏”的秋千,你在最终的图像中看不到它们,但它们与可见的秋千相连。这些隐藏的秋联就像是一个秘密支持团队。它们在暗中起舞,帮助可见的秋千找到形成图像的正确路径,尽管你永远看不到这些隐藏的秋千。这在不需要更多可见部件的情况下,极大地提升了系统的“脑力”。放弃路径约束(“仅关注终点”的目标):
通常在训练 AI 时,我们会告诉它每一步该如何移动(就像 GPS 提供逐一转弯的导航指令)。但由于模拟硬件具有刚性,强迫它遵循特定路径是不可能的。
相反,作者使用了 GAN(生成对抗网络) 的方法。他们告诉系统:“我不关心你是怎么到达那里的,只要确保你最后到达了正确的目的地即可。”- 生成器: 模拟游乐场尝试将随机噪声转化为图像。
- 判别器: 数字计算机观察最终图像并评价:“这看起来像一只猫,”或者“这看起来像垃圾。”
- 游乐场通过试错来学习,寻找自己独特的、蜿蜒曲折的路径,从噪声走向图像,而不是被强迫走直线。
结果:
团队在简单的图像数据集(如手写数字和时尚单品)上测试了该系统。
- 性能: 他们的模拟系统生成的图像比以往的模拟图像生成尝试要好 3 到 4 倍。
- 效率: 这是最大的亮点。他们估计,该系统生成一张图像仅需约 23 微焦耳 的能量。
- 为了让你有个直观的概念:标准的数字计算机完成同样任务可能需要 7 到 79 毫焦耳。
- 这意味着,该模拟系统比数字基准节能 100 倍(两个数量级)。
总结:
本文表明,我们可以构建一种全新的 AI,它运行在物理硬件(如振荡器和弹簧)之上,而不仅仅是数字芯片。通过接受硬件的局限性,并结合巧妙的训练方法(随时间改变规则、增加隐藏助手以及仅关注最终结果),他们创造了一个能以极低能量成本绘制图像的系统。这证明了我们可以利用自然界的物理规律来高效地完成复杂的 AI 任务。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。