← 最新论文
🔬 physics

Thermodynamic cost of inference and learning in physical neural networks

本文表明,虽然物理神经网络中的准静态推理不产生热力学代价,但参数学习带有不可消除的能量开支,从而确立了神经计算的基本热力学价格是由存储器存储而非算术运算决定的。

原作者: Alexei Tkachenko

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Alexei Tkachenko

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

每当计算机解决一个问题或学习一种新模式时,它都会消耗能量。我们在为数据中心供电的庞大发电厂以及笔记本电脑散发的热量中都能看到这一点。几十年来,科学家们一直在思考,这种能量成本究竟是由于我们当前技术的缺陷,还是由于一种任何机器都无法逃脱的基本自然法则。数字计算机的标准答案来自于一条被称为“兰道尔原理”(Landauer's principle)的规则。该规则指出,如果一台机器擦除了一段信息,它必须释放出微小且不可避免的热量。这条规则适用于我们处理器内部的二进制开关,其中信息被存储为像“开”或“关”这样截然不同且稳定的状态。然而,许多研究人员现在正在构建一种不同类型的计算机。这些是物理神经网络,是由光、机械部件或电子电路组成的设备,它们通过向平衡态演化来计算,就像一个小球滚下山坡寻找最低点一样。因为这些机器并不依赖于翻转僵硬的开关,所以关于擦除比特的旧规则可能并不以同样的方式适用于它们。问题在于,这些新机器是否可以几乎不消耗能量就能进行计算和学习,或者它们是否也受限于某种硬性的物理极限。

布鲁克海文国家实验室的一位研究人员现在已经精确地描绘出了这些物理网络需要多少能量。他们并没有在实验室里制造一个物理设备;相反,他们创建了一个详细的数学模型,将神经网络视为一个由弹簧和权重组成的系统。在他们的模型中,网络层之间的连接不是僵硬的指令,而是弹性约束,就像将系统拉向特定形状的弹簧一样。当网络接收到一个输入时,它只是简单地向满足所有弹簧要求的形状演化。这种方法使科学家能够计算出两个不同过程的能量成本:推理(即解决问题的行为)和学习(即训练机器变得更好地解决问题的行为)。他们的发现揭示了这些机器物理特性中一个令人惊讶的分裂。他们发现,思考的行为,即推理,在理论上如果机器移动得足够慢,就可以实现零能耗。只有当机器被迫快速移动时,成本才会出现。相比之下,学习的行为则带有永久性的能量价格标签,无论机器运行得多么缓慢,这个价格都无法避免。

研究人员发现,对于推理而言,其能量成本并不像数字计算机那样取决于网络内部的连接数或“权重”,而是取决于网络的宽度,即同时有多少个神经元处于活跃状态。如果允许机器缓慢地放松,以悠闲的节奏从一个输入过渡到下一个输入,它就完全不需要做功。这是因为机器始终处于平衡状态,沿着能量的平滑谷底滑动,而从未需要爬坡或擦除记忆。只有当机器被推向比其自然弛豫速度更快的速度时,才会消耗能量。在这种快速机制下,所需的能量与机器在状态空间中移动的距离成正比,并除以所花费的时间。模拟显示,即使在最快的有效速度下,能量成本也极低,大约相当于网络中最宽层每一维度的环境热能。这意味着成本随网络的宽度规模缩放,而非其总复杂度。对于一个拥有百万个活跃神经元的网络,其能量成本大约是单个粒子微小热能的一百万倍,这一数值比当前数字硬件消耗的能量要小上数十亿倍。

然而,学习却讲述了一个不同的故事。当机器接受训练时,输入和期望的输出被同时强加给系统。这会在网络的弹簧内部产生冲突或应力,因为当前的设置无法同时满足输入和目标。为了学习,机器必须调整其内部权重以缓解这种应力。研究人员发现,这种调整权重的过程带有不可还原的能量成本。与推理不同,即使训练进行得无限缓慢,这个成本也不会消失。每当权重发生变化时,都会有少量的能量以热量的形式耗散掉,大约是环境热能的几倍(针对每个参数)。这个成本是在定义机器知识的整个参数集上征收一次。它并不取决于机器在训练期间看到了多少个样本,而是取决于它必须存储的权重数量。这与数字训练形成了鲜明对比,在数字训练中,机器必须为它看到的每一个样本进行信息的擦除和重写,从而导致一个随数据集规模增长的巨大能量账单。

研究人员通过模拟一个被训练用于识别手写数字(机器学习中的标准任务)的小型网络来测试这些想法。他们观察了当他们在不同数字之间切换以及机器如何调整权重以提高准确率时的行为。结果与他们的理论预测完美契合。当机器被要求快速进行推理时,它消耗的能量急剧上升,且随着其所做的功变得与系统中的热随机跳动相当,其准确率也随之下降。但当允许机器缓慢移动时,它几乎不消耗能量就能解决问题,且准确率保持在高水平。在训练期间,他们观察到用于调整权重的能量遵循一种精确的模式,证实了每发生一次学习行为,就会释放出固定且微小的热量。模拟显示,一旦机器学会了该任务,维持该知识所需的能量微乎不及,但最初写入该知识所需的能量是一个基本的、不可避免的成本。

这些发现表明,神经网络的热力学代价是由其记忆而非其算术决定的。计算结果的行为几乎是免费的,仅受限于机器被迫移动的速度。然而,学习的行为需要支付一笔小额但永久的费用,以将参数写入机器的物理结构中。这种区别为计算的未来提供了一个新的视角。虽然数字机器受限于为每一次操作擦除比特的成本,但物理机器有可能以比现有硬件高出几个数量级的能量效率执行复杂计算。目前硬件与这些理论极限之间的差距并非源于物理定律的缺陷,而是源于我们现有材料和设计的低效。这项研究提供了一个清晰的路线图,展示了什么是可能的:如果我们能制造出能够真正“放松”进入解状态的机器,智能的能量成本就可以降低到宇宙所允许的最低限度。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →