← 最新论文
⚡ electrical engineering

Deep Reinforcement Learning-Based Energy Management for Hydrogen-Enabled Community Microgrids Under Uncertainty

本文提出了一种基于近端策略优化(PPO)的能源管理系统,用于澳大利亚洛克汉普顿的一个氢能社区微网,证明了所学习的策略能够有效协调电池与氢能调度,以在正常运行和电网停电场景下,实现高比例可再生能源利用率和负荷满足度,同时保持稳健的经济性能。

原作者: Mohamed Atef, Sanath Alahakoon, Umme Mumtahina, Peter Wolfs, Tamer Khatib, Moslem Uddin

发布于 2026-07-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Mohamed Atef, Sanath Alahakoon, Umme Mumtahina, Peter Wolfs, Tamer Khatib, Moslem Uddin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一个试图运行自己电网的社区,就像一座微型、自给自足的城市。在现实世界中,阳光并不总是灿烂,风也并不总是吹拂,人们用电的时间也不总是一致。这创造了一个混乱的杂耍过程:如何在不过度燃烧化石燃料或耗尽电力的情况下保持灯火通明?这就是**能量管理系统(EMS)**的核心。可以将 EMS 想象成电网的大脑。它的职责是决定每一秒钟应该是储存能量、使用能量、将能量卖回主电网,还是利用备用电源进行发电。

为了让这个大脑变得更聪明,科学家们正在使用一种叫做深度强化学习(DRL)的人工智能技术。你可以将 DRL 想象成训练一个电子游戏角色。这个角色(AI)尝试不同的动作,通过做出好的决策(如节省资金或保持供电)来获得分数(奖励),并通过做出坏的决策(如断电)来失去分数(惩罚)。经过数百万次的尝试,这个角色可以在没有被明确告知规则的情况下,学会一套完美的策略。现在,把氢能加入其中。氢能就像是一个长期电池;你可以将多余的电能转化为氢气,将其储存数周或数月,稍后再将其转回电能。这篇论文提出了一个宏大的问题:AI 能否学会同时调度反应迅速的电池、反应缓慢的氢能、柴油发电机以及主电网,即使在天气难以预测且输电线路可能突然中断的情况下?


AI 电力管理者:氢能驱动社区的剧本

这篇论文介绍了一个社区微网(即一个利用太阳能板和风力涡轮机产生自身电力的社区)的新型“教练”。这位教练是使用一种称为**近端策略优化(PPO)**的方法训练出来的。想象一位非常聪明、非常有耐心的教练,观察着澳大利亚洛克汉普顿(Rockhampton)一个拥有 1,000 户家庭的社区长达一整年(8,760 小时)。这位教练必须管理一个复杂的能源资产团队:

  • 太阳能与风能: 不稳定的球员,只有在天气允许时才会现身。
  • 电池: 短跑选手。它们擅长通过快速的能量爆发来平滑突发变化,但无法长时间储存大量能量。
  • 氢能系统: 马拉松选手。该系统包括一个电解槽(通过电能制造氢气)、一个储罐(储存氢气)和一个燃料电池(将氢气转回电能)。它的启动速度较慢,但可以持续运行很长时间。
  • 柴油发电机: 应急备份,仅在情况极其困难时使用。
  • 主电网: 一个你可以向其借电或向其卖电的大邻居,但前提是他们的输电线路必须正常工作。

挑战:一场混乱的杂耍游戏

AI 需要解决的问题非常棘手。太阳可能会躲到云层后面,一个家庭可能会同时打开空调,电价可能会飙升,或者主电网可能会突然断电(停电)。AI 必须决定每一小时的具体操作:如何为电池充电、如何制造或消耗氢气,以及何时启动柴油发电机。

研究人员建立了一个数字模拟环境,让 AI 玩了 300 次这个游戏,每一次都试图学习更好的策略。目标很简单:尽可能赚取更多利润(通过在电价便宜时卖出太阳能,并在必要时才购买昂贵的电网电能),同时保持社区供电并保持低碳排放。

训练:过山车式的旅程

学习过程并非直线上升的胜利之路。它更像是一场过山车。起初,AI 进步很快,找到了一种能获得高分的策略。但大约在第 97 次尝试时,AI 突然陷入混乱,表现大幅下滑,做出了会导致社区损失巨额财富的糟糕决策。它大约又经历了 100 次尝试才重新找回状态。到最后,AI 学会了一套稳定的策略,但研究人员指出,表现“最好”的版本实际上是训练过程中的间中版本,而非最后一个版本。这告诉我们,训练 AI 是需要技巧的;有时你必须在最合适的时刻停止,并使用你拥有的最佳版本。

结果:AI 的表现如何

当研究人员将最终的 AI 教练应用于全年的真实数据进行测试时,结果令人印象深刻,尽管并不完美。

在正常条件下:
AI 对社区的管理非常出色,全年实现了 195,690.67 澳元 的净运营收入。它实现了 91.2% 的可再生能源(太阳能和风能)供电率,并将碳足迹控制在极低的 0.085 kg CO2/kWh。它满足了社区 99.77% 的用电需求。其秘诀在于?AI 找到了如何通过向电网出售大量的多余太阳能(11.415 GWh),同时仅在必要时购买极少量的电能(1.387 GWh)。

当电网发生故障时:
研究人员通过模拟频繁的停电,增加了每小时电网失效的概率(从 1% 增加到 5%),从而提高了游戏的难度。

  • 影响: 收入降至 169,892.21 澳元,满意度略微下降至 98.79%
  • 反应: 在这里,AI 的策略变得很有趣。当电网断电时,AI 并没有过度依赖氢能这一“马拉松选手”。相反,它全力投入到了“短跑选手”和应急备份中。电池的使用量激增,增加了 412.9%,柴油发电机的启动频率也增加了 429.4%。而氢燃料电池的输出仅增加了 7.7%

这表明,对于短暂且随机的停电,快速响应的电池和柴油发电机才是英雄,而氢能系统更适合于本模拟未完全测试的长时期、持续性的断电。

氢能成本测试:
研究人员还检查了如果制造和储存氢气的成本上升会发生什么。他们没有重新训练 AI,只是改变了计算方式。结果是?AI 并没有做出调整,因为它无法在数据中“看到”新的价格。氢能运营成本从 7,817.55 澳元 跳升至 38,335.56 澳元,这表明目前的 AI 需要在实时应对价格变化方面变得更加聪明。

总结

本论文表明,深度强化学习是管理复杂能源系统的强大工具。它证明了 AI 可以成功协调电池、氢能和柴油,以维持社区的电力供应并实现盈利。然而,它也凸显了一些局限性:AI 需要稳定的训练以避免崩溃,它对短期停电的反应更倾向于使用电池而非氢能,并且它需要能够“看到”不断变化的价格,以便做出明智的经济决策。

这项研究并不声称已经解决了世界的能源问题。相反,它提供了一个极具前景的原型:一个数字教练,它可以学习如何在可再生能源、储能和需求之间进行混乱的舞蹈,只要我们为其提供正确的工具和正确的数据进行学习。未来的工作包括使这些 AI 教练更加稳健,测试它们应对长期断电的能力,并确保它们能够处理由于设备老化和市场波动带来的现实世界的复杂性。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →