← 最新论文
💻 computer science

Control-aware training of physical neural networks for closed-loop regulation

本文表明,通过使用控制感知目标(即优先考虑保持候选动作排序而非静态回归精度)来优化物理神经网络,可以显著增强在稳态调节和倒立摆稳定等任务中的闭环调节性能以及对扰动的鲁棒性。

原作者: Yuzhan Zhang

发布于 2026-08-25
📖 1 分钟阅读☕ 轻松阅读

原作者: Yuzhan Zhang

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代计算领域,出现了一场日益增长的运动,旨在构建不仅依靠硅芯片,而且依靠宇宙本身原始物理定律进行思考的机器。这些被称为物理神经网络。它们不再是在标准计算机上模拟大脑,而是使用真实的、可控的物理过程——例如穿过玻璃的光线或微小机械振荡器的振动——来进行计算。它们速度快且高效,但也非常“凌乱”。物理世界充满了细微且不可避免的缺陷:温度变化、轻微的制造差异以及随机噪声。当计算机程序在标准处理器上运行时,这些微小的误差通常并不会产生太大影响。但当一台机器被用于实时控制某些事物时,比如平衡一根杆子或调节化学反应,即使是计算中极其微小的错误也可能导致错误的决策。如果控制器对最佳动作的判断偏差了哪怕一丁点,它可能会选择一个稍差的行动。在反馈回路中,这种微小的误差会不断累积,使系统走向最终失败的路径。科学家们面临的核心问题是,这些物理机器是否可以通过训练来忽略自身的缺陷,并在即便计算数值略有偏差时仍做出正确的选择。

一位名叫张宇占(Yuzhan Zhang)的研究人员通过对这些机器应该如何被教导提出一个不同的问题,解决了这一难题。传统上,工程师通过尝试让这些物理系统的输出数值尽可能地匹配一个完美的靶值来训练它们,就像一名学生试图在数学考试中把每个答案都写得完全正确一样。张的研究表明,对于控制物理系统的机器来说,获得精确的数值并不是最重要的目标。相反,最重要的目标是确保机器选择正确的“动作顺序”。如果一个控制器必须在向左移动或向右移动之间做出选择,它并不需要精确知道“左”和“右”的具体数值到最后一位小数。它只需要知道“左”比“右”好,且这种优势足以让它确定方向。研究表明,通过训练物理网络去保护这种选择的排序,而不是仅仅最小化数值误差,该系统在面对现实世界的异常情况时会变得更加稳健。

为了测试这个想法,研究人员在模拟中构建了两种不同类型的物理计算系统。一种系统使用了光波相互干涉的模型,类似于池塘中的波浪重叠;另一种则使用了由二十四个微小且相互连接的振荡器组成的网络,这些振荡器像单摆一样前后摆动。这些系统被赋予了一项名为“稳态调节”(homeostatic regulation)的任务,这本质上是保持一组内部变量(如能量和温度)处于安全、健康的范围内。系统必须不断决定是进行充电、降温还是自我修复,以避免进入危险状态。研究人员为每个系统训练了两个版本的控制器。第一个版本采用传统方式训练,试图尽可能地匹配完美数值。第二个版本则采用了一种新方法进行训练,重点在于保持动作排序的正确性,即使数值本身有些模糊。

结果令人震惊。当这些系统在正常、完美的环境下接受测试时,两个控制器的表现几乎完全相同。它们做出了相同的决策,并以几乎相同的效率将内部变量保持在安全区域内。然而,真正的考验出现在研究人员引入现实干扰(如传感器中的随机噪声或机器物理特性的轻微变化)时。在这些压力条件下,传统控制器开始失灵。它开始做出会导致更高成本和更大失败风险的选择。然而,接受了这种基于排序训练的新型控制器却稳住了阵脚。在基于光的系统中,这种新方法在面对中度到强度的干扰时,将维持系统生存的成本降低了近百分之十八。在振荡器系统中,改进更为显著,将成本降低了近百分之二十九。至关重要的一点是,尽管这种改进发生时,新控制器的预测能力并非更强——事实上,在某些测试中,其原始数值预测甚至略逊于传统模型——但这种优势完全来自于它在环境嘈杂时维持正确选择顺序的能力。

为了确保这些发现并非针对特定任务的偶然现象,研究人员还在一个经典的控制问题——倒立摆(Cart-Pole)上测试了该方法,即一台机器必须在移动的小车上平衡一根杆子。这是一个标准的控制系统测试,与稳态调节任务无关。同样,研究人员使这两个控制器的数值预测能力几乎完全一致。当系统受到强干扰时,接受排序保护训练的控制器将失败率降低了一半以上。它能让杆子平衡的时间显著延长,在其他模型迅速失败的情况下,它能成功维持数百步。研究还观察了新控制器是否仅仅是因为更加“谨慎”,例如通过减少工作量来规避风险。通过仔细比较两个系统在被迫执行完全相同的工作量时的表现,研究人员确认了这种性能提升并非源于懒惰或减少投入。新控制器确实在当下能做出更好的决策,从而防止系统陷入危险状态。

研究还对照了来自其他实验的现实世界数据,以检查模拟中所使用的难度等级是否符合实际。研究发现,测试中所使用的干扰程度与在其他科学论文中报道的实际物理计算硬件所产生的误差相当。这表明,在模拟中发现的改进对于未来可能制造出的真实机器具有相关性。这项工作并不声称已经解决了物理计算的所有问题,并且承认在针对振荡器系统的某一次特定测试中,改进幅度较小,未达到严格的成功阈值。然而,整体趋势是清晰的:当物理机器嵌入在反馈回路中时,训练它关注其选择的后果,比训练它成为一个完美的计算器更为有效。研究结论指出,对于闭环控制而言,决策的结构比数值的精度更重要。通过教导这些物理网络去重视动作的正确排序,工程师可以构建出对充满变数的物理世界具有更强韧性的系统。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →