想象你拥有一块非常智能、高科技的电池,它就像一个巨大的、可充电的能量钱包。这个钱包坐落在电网之上,其职责是同时完成两件事:
- 持有“安全保证金”(FCR): 它向电网运营商承诺:“如果电力频率出现波动,我将立即释放或吸收能量以修复它。”作为交换,他们只需为你保持这一承诺的待命状态支付一笔稳定的费用。
- 交易能量(不平衡套利): 它监视市场,寻找能源价格飙升或暴跌的时刻。如果价格高,它就卖出能量;如果价格低,它就买入。正是在这里,可以赚取巨额且快速的利润。
问题:“一刀切”的陷阱
过去,电池所有者必须承诺一个“安全保证金”,且这个保证金的规模在一天中的每一个小时都必须完全相同。
- 类比: 想象你是一名出租车司机。你必须向城市承诺:“无论何时,我都会保持汽车油箱 50% 的燃油量,以防有紧急呼叫出现。”
- 缺陷: 这是浪费的。有时,紧急呼叫发生的可能性很低,而你囤积的燃油本可以用来驶向高价的乘客。有时,紧急情况很可能发生,你需要的是更多燃油,而不是更少。通过保持燃油水平不变,你错失了许多有利可图的行程,因为你的“安全油箱”要么太满(浪费资金),要么太空(面临罚款风险)。
解决方案:两阶段“智能管理者”
研究人员提出了一种新的电池管理方式,采用两步策略,就像一个战略规划师和一个精明的街头司机。
第一阶段:战略规划师(“投标”制定者)
在一天开始之前,这位规划师会查看历史数据(如天气模式和过去的交通状况),以决定在不同时间段承诺多少“安全保证金”(FCR)。
- 类比: 规划师不再承诺全天保持 50% 的燃油,而是说:“在安静的早晨,我们只需要为紧急情况保留 20% 的燃油,因为交通平静。但在高峰时段,我们将将其提升至 80%,因为紧急情况更可能发生。”
- 结果: 这创造了一个非均匀的时间表。当风险较低时,电池可以自由地利用更多能量进行交易;当风险较高时,则节省更多能量用于安全。
第二阶段:精明的街头司机(“深度强化学习”代理)
一旦一天开始,一个经过高度训练的人工智能(AI)代理便接管方向盘。它不只是遵循脚本,而是通过经验进行学习(使用一种称为深度强化学习的方法)。
- 类比: 这位司机能看到实时的交通状况(价格变化)和实际天气(频率波动)。由于规划师给予了他们灵活的燃油时间表,司机确切地知道为了追逐高价乘客可以安全燃烧多少燃油,而不会在紧急呼叫到来前耗尽燃油。
- 魔力: AI 平衡了赚取快钱的即时冲动与保持安全及电池健康的长期需求。
结果:更多利润,同等安全
研究人员在比利时的一个真实场景中,利用一块大型电池测试了该系统。
- 结果: 通过从僵化的“一刀切”计划切换到这种灵活的、随时间变化的计划,该电池在一年内的利润增加了 7.56%。
- 原因? 电池不再将能量浪费在闲置的安全油箱中,而是本可用于交易。它仅在真正必要时才保留能量。
- 代价: 电池的循环(充电和放电)频率略有增加,但 AI 足够聪明,能够保持在每日安全限制内,确保电池不会更快磨损。
简而言之
这篇论文表明,通过将电池的“安全承诺”视为一个灵活、变化的时间表,而非固定规则,并利用智能 AI 来管理剩余部分,你可以从相同的硬件中榨取显著更多的价值。这就像从僵化的预设饮食计划升级为根据每日活动动态调整的饮食,让你在不生病(罚款)的情况下享受更多食物(利润)。
技术摘要:非均匀 FCR 投标下的多市场价值堆叠
问题陈述
可再生能源(RES)在欧洲电力系统中渗透率的不断提高加剧了频率偏差和系统不平衡,亟需频率控制储备(FCR)等稳健的辅助服务。电池储能系统(BESS)因其快速响应能力而成为这些服务的理想选择;然而,它们被归类为有限能源资源(LERs)。这一分类要求对能量状态(SoE)进行严格管理,以确保在向上和向下 FCR 激活时均能持续可用。
现有研究通常采用均匀 FCR 投标,即在控制周期内保持储备容量承诺静态不变。这种静态方法未能充分利用 BESS 的灵活性,因为它未能动态平衡为 FCR 交付预留能量与利用该能量进行不平衡套利之间的权衡。虽然深度强化学习(DRL)已应用于实时不平衡控制,但其大多是在这些静态、均匀投标约束下运行的。相反,非均匀投标(时变承诺)在确定性设定中已显示出前景,但尚未有效地与高分辨率、随机实时控制相结合。本文旨在填补这一空白:将非均匀 FCR 投标与实时不平衡控制相结合,能否解锁额外收益?
方法论
作者提出了一种两阶段控制框架,专为欧洲环境设计,旨在将长期投标决策与快速实时控制解耦:
阶段 1:数据驱动的非均匀 FCR 投标优化
- 目标:推导出一系列时变的 FCR 投标(以 4 小时为块),在无需依赖实时层完美预测的情况下最大化预期利润。
- 方法:利用已实现的频率和价格数据,在事后(ex-post)执行数据驱动的蒙特卡洛(MC)优化。对于每个 4 小时块,系统评估离散的候选投标(0 至Pnom−1 MW)。
- 模拟:每个候选投标均通过 50 次 MC 模拟进行测试,分辨率为 1 秒,结合历史 FCR 激活和财务结算。
- 启发式控制:在这些模拟中,采用简单的基于规则的启发式方法来管理 SoE,以确保满足 FCR 约束的同时获取不平衡收益。
- 调整:为防止块末 SoE 水平带来的偏差,对利润指标应用终端值调整,计入后续块中剩余能量的机会成本。选择预期调整后利润最高的投标作为该块的投标。
阶段 2:基于 DRL 的实时不平衡控制
- 目标:利用剩余灵活性(名义功率与阶段 1 投标之间的差值)进行实时不平衡交易,同时保持 SoE 可行性。
- 智能体:双深度 Q 网络(DDQN)以 1 分钟为间隔运行,与不平衡价格信号更新同步。
- 状态空间:智能体观测市场信号(不平衡价格、时间特征)、物理状态(SoE、累计循环使用量)以及约束背景(距离 SoE 边界的距离、当前/即将到期的 FCR 承诺)。
- 动作空间:离散的充电、空闲或放电决策,映射到可用的剩余灵活性。
- 安全机制:双层安全层确保合规性:(i) 动作掩码过滤掉可能违反约束的设定点;(ii) 反应式覆盖在随机 FCR 激活将 SoE 推至边界之外时纠正动作。
- 奖励函数:多目标函数平衡净不平衡收入、运行安全(惩罚 SoE 接近/违反边界)以及电池健康(惩罚过度的日循环吞吐量)。
主要贡献
- 新颖框架:引入了一种将非均匀 FCR 投标与基于 DRL 的实时控制相结合的两阶段架构,解决了现有文献中静态投标的局限性。
- 概念验证:证明可以通过数据驱动的 MC 优化推导出时变投标策略,从而为实时控制器创建动态的“可行性包络”。
- 算法实现:应用 DDQN 来管理时变约束下 FCR 合规性与不平衡套利之间的复杂权衡,利用特定的奖励结构来管理电池退化。
结果
该框架使用 2022 年全年的高分辨率频率和市场数据,在比利时市场上对 10 MW / 20 MWh 的 BESS 进行了评估。
- 利润增长:所提出的非均匀策略实现了 306 万欧元的总净利润,比表现最佳的均匀基线(284 万欧元)提高了7.56%。
- 收入构成:非均匀策略与最佳均匀策略之间的 FCR 特定收入保持可比,表明优化器有效地在 FCR 价格高峰期分配了容量。主要收益(约 7.5%)源于增加的不平衡套利。
- 运行动态:通过在不平衡波动率高时动态减少 FCR 义务,非均匀策略扩大了运行 SoE 裕度。这使得 DRL 智能体能够执行在静态投标下会受到限制的更激进的套利策略。
- 资产健康:尽管充电循环次数多于均匀基线,但智能体成功将总吞吐量控制在规定的日循环限制(Cmax)内,证明了在不违反寿命约束的情况下有效利用了可用余量。
- 投标行为:当 FCR 价格较高时,优化器选择较大的 FCR 投标;当不平衡价格波动增加时,则减少投标,从而在 FCR 容量和不平衡灵活性之间形成对角线过渡模式。
意义与主张
本文主张,非均匀投标通过更有效地将储备义务与快速变化的不平衡机会对齐,解锁了额外价值。该研究提出,“先投标,后控制剩余灵活性”的架构为其他涉及时变约束的价值堆叠场景(例如 aFRR、混合光伏-BESS)提供了一种可重用的抽象。
作者对当前实施保持谨慎态度:
- 阶段 1 优化依赖于事后数据,仅作为概念验证和上限基准,而非可部署的预测工具。
- DDQN 的使用被呈现为一种稳定的基线,旨在隔离投标策略的影响,而非将强化学习算法与最先进的替代方案进行基准比较。
- 未来的工作被确定为需要整合主动的、基于预测的投标选择,并探索更稳健的强化学习架构。
结果表明,超越静态、均匀承诺,使 BESS 运营商能够在多市场环境中获取显著的额外收入,同时保持对辅助服务要求的严格合规。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。