← 最新论文
⚡ electrical engineering

Comparative Evaluation of RL-TD3 PID Control against Hybrid and Conventional Optimizers in Renewable -Based Islanded Microgrids

本文表明,基于强化学习的延迟深度确定性策略梯度(RL-TD3)优化 PID 控制器在增强基于可再生能源的孤岛微电网内的负荷频率控制稳定性与扰动抑制方面,优于传统的及混合优化方法,例如考提优化算法(Coati Optimization)和灰狼-布谷鸟搜索算法(Grey Wolf-Cuckoo Search)。

原作者: Dana Rajaa Shaaban, Ali Nasser Hussain, Ahmed K. Ali, Mohammed Alruwaili, Moustafa Ahmed Ibrahim

发布于 2026-07-10
📖 1 分钟阅读☕ 轻松阅读

原作者: Dana Rajaa Shaaban, Ali Nasser Hussain, Ahmed K. Ali, Mohammed Alruwaili, Moustafa Ahmed Ibrahim

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个微小的、孤立的电力小岛,被称为微电网(Microgrid)。它就像一个自给自足的电力城市,并不与大型国家电网相连。相反,它依靠多种来源运行:有些是可靠的(比如柴油发电机),而有些则像天气一样变幻莫测(比如太阳能电池板和风力涡轮机)。

最大的问题在于?如何保持电力在精确的速度上运行。在电力世界中,这个速度被称为频率。如果风突然停止了,或者有人打开了一台巨大的空调,频率就会发生波动。如果波动得太厉害,整个岛屿的电力系统可能会崩溃。

为了解决这个问题,这个小岛需要一个负载频率控制(LFC)系统。把这个系统想象成这个岛屿的自动驾驶仪。它的工作是不断地微调动力源,以保持频率稳定。长期以来,这些自动驾驶仪使用的是一种标准的配方,叫做 PID 控制器。这就像是一个了解规则但反应不够快的司机,当道路突然变成泥泞、不可预测的沼泽时,他无法及时应对。

新成员登场:“超级学习型”司机

研究人员想看看他们是否能构建一个更聪明的自动驾驶仪。他们不只想要一个遵循规则的司机,他们想要一个能从经验中学习的司机。

他们创建了一个新系统,叫做 RL-TD3 PID

  • PID 是标准的自动驾驶仪。
  • RL 代表强化学习(Reinforcement Learning)。想象一个电子游戏角色,通过尝试数百万种不同的动作、失败、然后每次尝试都变得更好来学习如何获胜。
  • TD3 是他们使用的特定“大脑”算法。它像是一个超级聪明的教练,观察玩家,纠正他们的错误,并帮助他们避免高估自己的水平(这是一个常见的学习陷阱)。

团队在计算机模拟中训练了这个“超级学习者”。他们向它投掷了各种各样的混乱:突发的电力需求激增、随机的天气变化,甚至还有由于系统数值略有偏差导致的“损坏”部件。

大决战:谁赢得了比赛?

为了看看这个新的“超级学习者”是否真的更好,研究人员让它与另外两种方法展开了对决:

  1. COA(负鼠优化算法): 一种受负鼠(一种类似浣熊的动物)寻找食物方式启发的算法。
  2. GWO-CS(灰狼+布谷鸟搜索): 一种结合了狼的狩猎策略和布谷鸟隐秘产卵习惯的混合方法。

这两个其他方法就像是资深导航员,在使用复杂的地图和数学模型在旅程开始前就找到最佳路线。它们很出色,但它们是静态的;它们不会在驾驶过程中进行学习。

结果:
在计算机模拟中,RL-TD3 PID 这个“超级学习者”在速度和整体误差方面始终胜过其他两种方法,尽管它并非在每一个指标上都完美无缺。

  • 恢复更快: 当电力需求跳升时,超级学习者比其他方法更快(或以非常相似的速度)将频率恢复到正常水平。
  • 更好的整体误差: 它随时间推移保持了更低的累积误差。论文使用特定的“计分卡”来衡量这一点,例如 ITAE(一个计算随时间变化的误差值的指标)。超级学习者的得分更低,而在微小的数字世界里,低分是好事。例如,在一次测试中,超级学习者的 ITAE 为 2.65E-02,而负着方法为 8.40E-02。在微小数字的世界里,这是一个巨大的差距!
  • 更擅长应对混乱: 当研究人员扰乱系统设置(模拟损坏或不确定的部件)时,超级学习者表现得异常稳定。数据显示,即使系统参数改变了 ±25%,调节时间仍保持在几乎相同的水平(约为 0.043 秒),这证明了该控制器对不确定性具有很强的鲁棒性。

关于“波动”的说明: 有趣的是,“超级学习者”并不总是在每项测试中都拥有最小的初始“冲击”(超调或欠调)。在某些特定场景下,它在稳定下来之前的波动实际上比其他方法略大。然而,由于它能迅速自我修正并保持较低的总误差,它仍然表现得更好。它用微小的初始波动换取了更好的长期稳定性。

这篇论文没有说的话

了解这篇论文没有声称的内容很重要。

  • 它是模拟,而非现实世界的胜利: 作者明确指出,这一切都是在 MATLAB 中进行的计算机模拟。他们还没有建造一个真实的岛屿,并用真实的柴油发动机和太阳能电池板进行测试。这个“超级学习者”是一个充满希望的想法,但它尚未在真实硬件上得到证实。
  • 它并非在所有地方都完美: 在某些特定的、复杂的干扰场景下,超级学习者的初始波动(超调或欠调)比其他方法略大。它不是一个能完美解决每一个指标的万能药;它优先考虑快速修正和低总误差,而不是追求绝对最小的初始跌幅。
  • 它不是所有东西的替代品: 论文表明,对于这些特定的孤立式微电网,这是一种更好的方法,但它并不声称解决了宇宙中所有的电力问题。

底线

论文表明,教导一个控制器进行实时学习和适应(使用 TD3 大脑)是保持岛屿电力稳定的强大方法,尤其是在天气难以预测的情况下。

虽然“超级学习者”在计算机世界中展示了它比“资深导航员”(COA 和 GWO-CS)更能处理混乱——具体表现为最小化总误差并在系统部件“损坏”时保持稳定性——但作者谨慎地表示这仅仅是第一步。他们承认,在我们可以信任这个系统处理真实电力之前,它需要在实际硬件上进行测试。但就目前而言,模拟结果是一个强烈的暗示:这种“学习型驱动器”可能是保持我们电网稳定的未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →