← 最新论文
⚡ electrical engineering

Load frequency control framework of renewable integrated power systems in multi scenario disturbance conditions with the proximal policy optimization  

本文提出了一种基于近端策略优化(PPO)的控制框架,用于可再生能源集成电力系统的负荷频率管理,该框架通过在多种多场景扰动下实现显著更低的误差率和更优越的稳定性,且无需启发式调优,从而超越了传统及其他深度强化学习控制器。

原作者: Dalia Debbarma, Dulal Chandra Das, Jeetu Debbarma

发布于 2026-07-06
📖 1 分钟阅读☕ 轻松阅读

原作者: Dalia Debbarma, Dulal Chandra Das, Jeetu Debbarma

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

大局观:保持电网平衡

想象一下,电网就像一场巨大的、高速进行的自行车赛。这场比赛的“速度”就是电力频率(通常为 60Hz 或 50Hz)。为了让比赛平稳进行,骑手(发电机)必须踩踏的速度与赛道上的人们(电力需求)保持完全一致。

  • 旧方式: 在过去,这些“骑手”是巨大的、沉重的蒸汽机和水轮机。因为它们很重,所以拥有很大的惯性(动量)。如果有人突然跳上自行车(电力需求突然激增),沉重的车轮会继续旋转片刻,为骑手调整踩踏速度提供时间,而不至于让自行车剧烈晃动。
  • 新问题: 如今,我们正在用风力涡轮机和太阳能电池板取代这些沉重的引擎。它们对环境很好,但很轻,没有那种沉重的“动量”。如果风停了或者云层遮住了阳光,自行车就会剧烈晃动。频率会下降或飙升,这可能导致停电。

解决方案:“智能教练”(PPO 控制器)

本文作者提出了一种保持自行车稳定的新方法。他们没有使用僵化的、预先写好的规则手册(比如标准的计算机程序,规定“如果速度下降,则增加 5% 的踩踏力度”),而是创建了一个基于 AI 技术——近端策略优化(PPO)智能教练

把 PPO 控制器想象成一位通过试错法来学习的教练,就像人类学习骑自行车一样:

  1. 没有规则手册: 教练并不从说明书开始。它从一张白纸开始。
  2. 在实践中学习: 教练观察自行车。如果自行车晃动,教练会尝试不同的踩踏方式。
  3. 奖励机制:
    • 如果自行车行驶平稳且顺畅,教练会得到一个“击掌”(正向奖励)。
    • 如果自行车晃动,或者教练踩踏过猛浪费了能量,教练会得到一个“大拇指朝下”(负向奖励)。
  4. 变得更好: 通过数千次的练习,教练学会了保持自行车稳定的完美踩踏平衡,即使在风向改变或路面颠簸时也是如此。

四个“训练场”(测试场景)

为了证明他们的智能教练是最棒的,作者将其置于四种困难的训练演习中,并将其与“老派教练”(如 GA-PI 和 Fuzzy-PI)以及其他 AI 教练(如 DDPG 和 TD3)进行了对比。

  1. 突发陡坡(案例 1): 突然增加了沉重的负载(就像凭空出现了一座山丘)。
    • 结果: PPO 教练几乎瞬间让自行车保持稳定。其他教练在恢复之前出现了明显的晃动。
  2. 颠簸路面(案例 2): 一段长距离、有节奏的颠簸路面(周期性扰动),风力和需求不断呈波浪式变化。
    • 结果: PPO 教练几乎感觉不到颠簸。其他教练则不停地左右摇摆,难以找到节奏。
  3. 风暴(案例 3): 一场伴随着突发阵风和云层的混乱风暴(振荡压力)。
    • 结果: PPO 教练保持冷静和中心。其他教练感到困惑并开始过度修正,反而让骑行变得更糟。
  4. 现实中的比赛(案例 4): 各种情况的混合:突发陡坡、风暴、一名骑手掉队(太阳能中断)以及终点线前的骑手涌入(峰值负载)。
    • 结果: 这是最难的一次测试。PPO 教练完美处理了混乱,使频率保持稳定,几乎没有晃动。其他教练在面对混乱时难以恢复。

为什么这很重要(研究结果)

论文声称,这种 PPO “智能教练”比现有方法有了巨大的进步:

  • 更少晃动: 它大幅减少了“晃动”(频率误差)。在一项测试中,误差从巨大的 1,060 个单位降低到了不到 1 个单位。
  • 更平稳的骑行: 它不仅解决了问题,而且动作平滑,没有剧烈的抖动。
  • 更便宜: 因为它没有进行不必要的剧烈踩踏,所以节省了大量“燃料”(运行成本),比旧方法节省了约 60–75% 的开支。
  • 无需手动调优: 与旧教练不同,你不需要花费数周时间去微调设置。PPO 教练在学习过程中会自动找出最佳设置。

核心结论

作者总结道,对于高度依赖风能和太阳能(这类能源较轻且不稳定)的电网,我们需要一种能够实时学习和适应的控制器。他们的 PPO 系统就像一位高水平的、自学成才的教练,能够保持电网稳定,节省资金,并且比他们测试的旧式僵化系统或其他 AI 方法能更好地应对混乱。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →