← 最新论文
🔬 physics

Reinforcement learning for vertical position control on the EXL-50U spherical tokamak

本文提出了一种经过实验验证的强化学习框架,用于 EXL-50U 球形托卡马克装置的垂直位置控制,该框架实现了与传统 PID 控制器相当的毫米级跟踪精度,同时一致地降低了执行器做功,从而证明了基于学习的控制在未来聚变系统中的可行性。

原作者: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the E
发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Lei Xing, Huicong Ma, Changquan Yu, Xuanhe Wang, Jiayi Zhi, Pei Guo, Mengyao Li, Zhengyuan Chen, Yapeng Zhang, Guoyang Shi, Dongkai Qi, Xiang Gu, Siqi Ding, Yong Liu, Jianguo Chen, Tianyuan Liu, the EXL-50U Teama

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在追求清洁、无限能源的过程中,科学家们正试图在地球上重建太阳的力量。他们通过将被称为“等离子体”的超高温气体捕捉在一个形如甜甜圈的磁笼中来实现这一目标。这一过程被称为磁约束聚变,它要求等离子体必须被保持得极其稳定。如果气体哪怕只是稍微偏离中心,撞击到机器壁,就会瞬间冷却,导致反应停止。这在一种被称为“球形托卡马克”的特定类型机器中尤其困难,这种机器的形状更像是一个去掉了核心的苹果,而非扁平的甜甜圈。这些机器的设计初衷是紧凑且高效,但其独特的形状使得等离子体天生不稳定,容易像一个无法保持位置的气球一样向上或向下漂移。能否让这个漂浮的火球保持稳定,是实验成功与否以及是否会发生突然剧烈崩溃之间的关键区别。

多年来,研究人员一直依赖标准的、基于规则的计算机程序来保持等离子体的中心位置。这些程序的作用类似于恒温器,不断检查位置并对磁场进行微调。虽然这些程序在某些设置下表现尚可,但在等离子体被拉长或机器被推向极限时,它们往往显得力不从心。在最近针对中国一台名为 EXL-50U 的机器进行的实验中,这些标准控制程序经常导致等离子体大幅度晃动,有时甚至会漂移数厘米。如此大幅度的移动是危险的;它们可能会损坏机器,并阻碍先进加热系统的使用。为了解决这个问题,一个科学家团队转向了一种不同的智能:机器学习。他们不再是用死板的规则来编写程序,而是通过在高度详细的虚拟模拟中进行练习,教会计算机如何控制等离子体,就像飞行员在真正接触飞机之前先在飞行模拟器中进行训练一样。

研究人员为 EXL-50U 机器构建了一个“数字孪生”体,这是一个能够以极高精度模拟等离子体真实物理特性和电路环境的虚拟环境。在这个模拟器内部,他们测试了一种基于强化学习的新型控制器。这是一种人工智能代理通过试错来学习的方法,即通过保持等离子体稳定获得奖励,而因让其漂移而受到惩罚。团队在一个特定的实验运行数据上训练了这个数字代理,然后挑战它去控制一个完全不同的、实验条件略有差异的运行过程。他们将这种基于学习的方法与标准的基于规则的控制器,以及另一种被称为线性二次型调节器(依赖于复杂数学模型的先进方法)进行了对比。

模拟结果揭示了许多信息。标准的基于规则的控制器虽然能让等离子体保持在目标位置,但它需要机器的磁铁进行非常艰苦的工作,消耗大量的电能来进行不断的修正。基于模型的方法在条件变化时难以保持稳定,经常导致等离子体处于略微错误的位置。然而,强化学习代理却学会了以极其平滑的方式引导等离子体。它追踪目标路径的精确度与标准控制器不相上下,但所消耗的磁铁能量显著减少。这种效率至关重要,因为这意味着机器可以运行得更久、更稳定,而不会使动力系统过载。为了确保学习代理能够应对虚拟世界与现实之间不可避免的差异,团队加入了一个简单的修正机制,帮助它调整微小误差,这一技术被证明对于维持精度至关重要。

受到这些虚拟成功案例的鼓舞,团队将训练好的人工智能从计算机中带了出来,投入到了真实的机器中。他们在实际的 EXL-50U 托卡马克设备上部署了该学习控制器,让它在实时实验中接管控制。在十多次独立的放电实验中,该系统成功地将等离子体在指定的时间窗口内保持了垂直稳定。在对其中七次放电进行的直接对比中,学习控制器的追踪精度达到了与标准控制器相当的水平,将等离子体保持在距离目标位置仅几毫米的范围内。与此同时,它在实现这种稳定性时持续使用了更少的电能。这证明了机器学习系统不仅能在聚变反应堆的严酷环境中生存,而且在效率方面还能超越传统方法。

然而,实验也揭示了当前技术的局限性。当实验结束、等离子体电流开始下降时,原本针对稳定状态进行训练的学习控制器开始失去控制,等离子体也随之开始漂移。这表明,尽管该代理在处理稳定阶段方面表现出色,但它仍需要更强大的工具来适应快速变化的情况。研究人员指出,未来的改进可能需要系统能够实时识别机器行为的变化,并即时调整其策略。尽管如此,这次成功的部署仍标志着一个重要的进步。它证明了基于学习的控制是管理聚变中复杂且不稳定物理现象的一条可行路径,为实现更稳定、更高效的反应器以将清洁能源输送到电网提供了切实可行的方案。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →