电力是现代社会的无形命脉,通过电线流向各地,为从路灯到医院的一切事物提供动力。但电力的价格并非固定不变;它波动剧烈,有时会飙升至令人眩晕的高度,有时则会跌入负值区间。这些价格波动是由多种复杂因素驱动的:有多少太阳能和风能可用于发电、燃料成本如何,以及人们在任何给定时刻的使用量是多少。由于这些价格变化如此难以预测,拥有电池或管理电网的公司需要以极高的准确度来猜测未来的价格。如果他们能预见到价格飙升,就可以买入廉价的电力并将其储存在电池中,稍后再卖出以获取利润。如果猜错了,就会亏损。几十年来,专家们一直致力于构建专门的计算机模型,旨在针对这些特定的市场,学习每个国家电网独特的节奏。
最近,一种新型的人工智能出现了,它承诺可以在不需要学习任何单一市场特定知识的情况下完成同样的工作。这些被称为“基础模型”(foundation models)。想象一位读过关于各种主题的数百万本书的学生;当你问他一个特定主题的问题时,他可以立即回答,而不需要一本新教科书。类似地,这些基础模型是在来自许多不同领域的海量数据上进行训练的,希望它们能够立即将所学知识应用于电力价格,而无需额外的训练。能源行业面临的一个重大问题是,这些通用型人工智能工具是否足以取代多年来作为标准的、经过特定市场调优的专业模型。
来自波兰和丹麦的一个研究小组决定通过对这些新型人工智能模型进行严格测试来回答这个问题。他们收集了德国、波兰和西班牙三个非常不同的欧洲市场的五年电力价格数据。选择这些国家是因为它们拥有不同的能源组合:德国和西班牙高度依赖风能和太阳能,而波兰仍在使用大量的煤炭。研究人员将九种不同版本的这些新型基础模型与两种目前专业人士使用的最优秀的现有专业模型进行了对决。他们不仅要求模型预测价格,还测试了模型预测整个可能价格范围的能力,包括那些罕见但危险的价格飙升和暴跌。最后,他们采取了最关键的一步:模拟了一个真实的交易策略。他们利用每个模型的预测结果来运行一个虚拟的电池储能系统,通过在五年内买卖电力,来看哪个模型实际上赚取的利润最多。
结果揭示了统计准确性与现实世界利润之间令人惊讶的分歧。在纯粹的预测能力方面,一类被称为 TabPFN 的基础模型在三个国家中始终优于那些专业模型。即使没有针对这些特定市场的历史数据进行训练,这些模型也能比传统方法更精准地预测价格。然而,当研究人员观察银行账户时,情况发生了变化。虽然 TabPFN 模型在统计学上更优越,但这并不自动转化为最高的利润。结果完全取决于交易员愿意承担多少风险。当交易策略较为激进、愿意接受更高风险时,TabPFN 模型产生的利润最多。但当策略较为谨慎且规避风险时,名为 DDNN-JSU 的旧有专业模型尽管在原始预测中准确度较低,却创造了更多的利润。
这一发现表明,新的基础模型是强大的工具,但它们并不是通用型模型对经过数十年精炼的专业模型的全面替代。最佳选择取决于具体的目标。如果目标是获得对未来最准确的统计图景,那么新的基础模型表现出色。但如果目标是在谨慎的交易环境中实现利润最大化,那么旧有的专业模型仍然保持着优势。研究结论指出,虽然这些新型人工智能工具是向前迈出的重要一步,并且可以改善预测,但它们应被视为大型系统中的强大组件,而非解决所有问题的灵丹妙药。电力交易的未来很可能涉及这些新型通用工具与多年积累的、针对特定市场的专业经验的结合。
技术摘要:用于电力价格预测与电池套利的基座模型
问题陈述
电力价格预测(EPF)对于电力市场决策至关重要,但它也面临着独特的挑战:价格表现出强烈的季节性、突发性的尖峰、重尾分布以及负值现象,同时受到天气、可再生能源发电量、燃料成本和市场设计之间复杂相互作用的驱动。虽然**基座模型(Foundation Models, FMs)**有望在无需针对特定任务进行重训的情况下,实现跨多样化时间序列的准确零样本(zero-shot)预测,但目前尚不清楚它们是否能超越专门针对电力市场特性设计的模型。现有文献往往缺乏跨多个市场、长周期测试以及最关键的——将统计准确性转化为交易策略经济价值的全面比较。
方法论
作者进行了一项大规模实证评估,将来自五个基座模型家族的九种变体与两个最先进的 EPF 基准模型进行了对比,涵盖了三个结构迥异的欧洲市场:德国、波兰和西班牙。评估涵盖了五年的样本外测试期(2021–2025年)。
评估的基座模型:
- 时间序列基座模型(Time Series FMs): Chronos-2(及其合成/小型变体)、Moirai-2 和 TimesFM-2.5。这些是基于 Transformer 的模型(仅编码器或仅解码器),旨在进行通用的时间序列预测。
- 表格基座模型(Tabular FMs): TabPFN-2、TabPFN-3、TabPFN-TS-3 和 Mitra(结合共形预测)。这些模型利用在合成数据上的上下文学习来解决回归任务,其中 TabPFN-TS-3 特别针对将时间序列数据转化为表格格式进行了适配。
- 输入处理: 时间序列基座模型利用包括历史价格、负荷预测、可再生能源发电预测以及基本面变量(EUA、天然气、石油、煤炭价格)在内的多元或单变量上下文。表格模型则通过滞后特征和外生变量将预测任务视为一个回归问题。
基准模型:
- LEAR+CP: 一个基于 Lasso 估计的自回归模型并结合共形预测,代表了一个稳健且具有解释性的统计基准。
- DDNN-JSU: 一个输出 Johnson's SU 分布参数的分布深度神经网络,代表了一个复杂的、针对特定市场的深度学习基准。
评估指标:
- 统计指标: 平均绝对误差(MAE)、均方根误差(RMSE)以及用于概率准确性的连续排位概率积分(CRPS)。
- 经济指标: 源自 1 MWh 电池储能系统(BESS)套利策略的利润。测试了两种策略:
- 无限竞价(Unlimited-Bid, UB): 当预测利润为正时执行市价单。
- 基于分位数的策略(Quantile-Based, QB): 基于特定分位数的限价单,由风险参数 α 控制(范围从 90% 到 50%,α 越高表示风险承受能力越高)。
- 统计检验: 使用多元条件预测能力(CPA)检验来确定性能差异是否具有统计学显著性。
核心贡献
- 全面的零样本比较: 不同于以往局限于单一市场或短周期的研究,本研究在三个多样化的市场中对五年的时间跨度进行了评估,并测试了时间序列架构与表格架构。
- 统计与经济的解耦: 本研究明确调查了统计预测准确性(MAE, CRPS)的提升是否能直接转化为交易背景下的经济收益,填补了 FM 文献中经常被忽视的空白。
- 风险依赖型表现: 分析表明,“最佳”模型高度取决于交易策略的风险特征,这挑战了存在单一通用优胜者的观念。
结果
统计准确性:
- TabPFN 占据主导地位: TabPFN 系列(TabPFN-2, TabPFN-3, TabPFN-TS-3)在所有三个市场和所有统计指标(MAE, RMSE, CRPS)上均持续且显著地优于两个基准模型。例如,在德国,TabPFN-3 将 CRPS 从 10.70(DDNN-JSU)降低到了 9.15。
- 时间序列基座模型: 通用型时间序列基座模型(Chronos-2, Moirai-2, TimesFM-2.5)表现不一。虽然 Chronos-2 变体在波兰表现良好,但在德国或西班牙通常无法显著超越专门的 DDNN-JSU 基准。Moirai-2 和 TimesFM-2.5 属于表现较弱的一类。
- 结论: 统计证据不支持“基座模型可以普遍取代市场特定模型”的说法;成功高度依赖于架构,其中表格基座模型(特别是 TabPFN)展现出了更优越的可迁移性。
经济价值(BESS 套利):
- 无直接转化关系: 统计学上的领先并不保证经济上的领先。
- 风险敏感性:
- 高风险(无限竞价及高 α): TabPFN 变体(尤其是 TabPFN-TS-3)在德国和西班牙产生了最高利润,而在波兰则是 TabPFN-3 表现最佳。
- 低风险(低 α): 当风险承受能力较低时(例如 α=50% 或 60%),DDNN-JSU 基准模型变得最具盈利能力。这表明,尽管 TabPFN 模型可能提供更好的分布准确性,但 DDNN 的特定校准或点预测特性更适合保守型交易策略。
- 市场差异性: 交易利润的模型相对排名在不同市场间的波动比统计误差的排名更为剧烈。
意义与主张
论文得出结论:虽然基座模型为电力价格预测提供了一条充满希望的路径,但它们无法普遍取代专为 EPF 领域设计的模型。
- 架构至关重要: 基座模型的成功取决于其架构。表格基座模型(TabPFN)展示了稳健的零样本性能,而通用时间序列基座模型在没有微调或特定适配的情况下,难以持续击败专门化基准。
- 上下文至关重要: 预测的价值并非内在固有的,而是取决于决策问题。如果交易策略需要不同的风险特征(例如,保守的限价单对比激进的市价单),那么一个具有卓越统计准确性(最低 CRPS)的模型可能无法产生最高利润。
- 未来展望: 作者建议,应将基座模型视为有前景的组件,集成到更大的预测流水线中(例如,用于生成协变量或作为集成模型的一部分),而非作为精心设计的市场特定模型的独立、通用替代品。该研究强调,必须通过统计和经济双重维度来评估预测,以充分理解其效用。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。