想象一下,你正在评判全球最优秀的天气预报员。过去,我们主要依据他们宽泛的平均分来查看其整体“成绩单”。这就像只根据学生的最终平均绩点(GPA)来评分,却从未检查他们是否真的能解决特定的数学问题或应对现实生活中的紧急情况。
本文介绍了极端天气基准(Extreme Weather Bench,简称 EWB),这是一个新的开源“成绩单”,专门用于测试人工智能(AI)和传统计算机模型在预测灾难性天气事件(如飓风、热浪和龙卷风)方面的表现。
以下是本文内容的简要说明,并辅以简单的类比:
1. 问题:“平均”陷阱
目前,许多 AI 天气模型是在全球平均值的背景下进行测试的。
- 类比:想象一位厨师以制作完美顺滑的汤而闻名。如果你只品尝汤,他会得到 A+。但如果你要求他为一名对特定食材严重过敏的顾客做一道特定的辣菜,而他失败了,那么“汤的分数”并不能告诉你这一点。
- 现实:目前的测试往往奖励那些表现“平滑”且一致的模型,但它们无法告诉我们模型是否能应对那些真正伤害人们的混乱、高风险事件(如突然的寒潮或巨大的风暴)。
2. 解决方案:天气界的“驾驶考试”
作者创建 EWB 是为了将其作为一场驾驶考试,而非笔试。他们不再仅仅询问“你的模型总体上有多好?”,而是问“你能驾驭这场特定的飓风吗?”或者“你能在热浪夺走人命之前预测到它吗?”
他们选择了5 种特定的危险天气类型进行测试:
- 热浪:持续数天的危险高温。
- 严重寒潮:危险低温(如得克萨斯州的寒潮)。
- 强对流日:伴有龙卷风、冰雹和破坏性大风的日子。
- 热带气旋:飓风和台风。
- 大气河流:天空中导致洪水的大规模水汽带。
3. “现实世界”数据(拒绝虚假地图)
许多模型是与其他计算机生成的地图(称为“再分析”数据)进行对比测试的。
- 类比:这就像通过对比另一个 GPS 来测试 GPS。如果两个都错了,你就无法察觉。
- EWB 方法:EWB 试图使用真实的实地数据。他们使用气象站的实际温度计读数、地面报告的龙卷风实况以及人类记录的飓风路径。
- 例外情况:对于“大气河流”等,由于全球实时雷达数据尚未普及,他们仍使用目前可用的最佳计算机数据。
4. “边际”检查(避免作弊)
存在一种风险,即模型可能会通过每天都预测灾难来“作弊”,以确保它能捕捉到真正的灾难。这被称为“预报员困境”。
- 类比:想象一个每小时都会响起的火灾警报。它能捕捉到每一次真实的火灾(100% 的成功率!),但它毫无用处,因为它一直在尖叫。
- EWB 修正:EWB 包含了“边际日”——那些接近极端但并非极端的日子。这测试了模型是否能区分“糟糕的一天”和“灾难性的一天”,确保它不会不停地大喊“着火了!”。
5. 结果:谁通过了考试?
作者测试了多种顶级 AI 模型(如 GraphCast、Pangu-Weather 和 AIFS)与传统模型(如欧洲 HRES)的表现。
- 热浪:AI 模型总体表现良好,但在 2021 年太平洋西北部那场巨大的热浪中,只有一款 AI 模型(AIFS)优于传统模型。没有任何一款 AI 模型能很好地预测热浪期间夜晚会有多冷。
- 寒潮:AI 模型在预测重大寒潮事件的低温程度时表现挣扎,往往过于乐观(即预测的温度偏高)。
- 风暴与飓风:AI 模型在预测飓风的路径和强度以及可能发生严重风暴的区域方面表现惊人,通常优于传统模型。
- 大气河流:与传统模型相比,AI 模型在预测这些水汽带登陆的位置方面通常表现更好。
6. 大局观
本文结论指出,EWB 是一个免费、开源的工具包,任何人都可以使用。它不仅适用于科学家,也适用于整个社区,旨在建立对 AI 天气模型的信任。
- 比喻:将 EWB 想象成天气模型的公共健身房。在模型被允许参加马拉松(即用于现实世界的预报)之前,它必须通过这个特定的极端天气障碍赛。如果它在跨栏时跌倒,我们就知道在将我们的生命托付给它之前,它需要更多的训练。
本文并未声称:
- 这些模型目前已是完美的。
- AI 将立即取代人类预报员。
- 这些模型将能预测单个龙卷风的确切位置(目前的 AI 尚未敏锐到这种程度);相反,它测试的是它们能否预测龙卷风爆发可能发生的区域。
目标仅仅是建立一种标准、公平的方式来衡量这些新的 AI 工具是否真正准备好帮助我们抵御极端天气。
技术摘要:极端天气基准(EWB)
问题陈述
人工智能(AI)天气模型的快速演进,已超越了能够评估其在高影响天气事件上性能的标准化验证框架的发展。当前对 AI 和数值天气预报(NWP)模型的评估实践主要依赖全球尺度指标,例如针对 500 百帕位势高度等预报变量的均方根误差(RMSE)和距平相关系数(ACC)。这些指标往往奖励平滑的场,而非物理上真实的天气模式,且未能捕捉预报对最终用户的“价值”。此外,现有基准往往缺乏针对极端现象的具体案例研究,或依赖再分析数据集(如 ERA5),而这些数据集可能包含偏差和非平稳性。这一差距使得难以确定模型是否真正具有一致性、高质量,并且对预测热浪、热带气旋和强对流爆发等造成重大社会危害的事件具有价值。
方法论
作者提出了极端天气基准(EWB),这是一个由社区驱动、开源的基准套件,旨在针对一组标准化的高影响天气事件,评估 AI 和传统 NWP 模型。该方法论围绕三个核心组件构建:
案例选择:EWB 整理了一个涵盖 2020 年至 2024 年的事件数据集,该时期在很大程度上独立于许多全球 AI 模型的训练数据。该套件涵盖五类高影响现象:
- 热浪
- 重大大范围寒潮事件
- 强对流日
- 热带气旋(TCs)
- 大气河流(ARs)
为应对“预报员困境”(即模型可能为了最大化分数而过度预测极端事件),EWB 包含了一组“边缘事件”(例如非极端温度日或强天气风险较低的日子)用于对比。
基于观测的验证:与仅依赖再分析的基准不同,EWB 优先考虑地面实况观测。
- 温度:使用全球历史气候学网络(GHCNh)的小时地表观测数据。
- 强天气:利用美国国家海洋和大气管理局(NOAA)的风暴报告、加拿大强风暴实验室的数据以及澳大利亚人工整理的报告,构建“近乎完美后报”(PPH)区域。
- 热带气旋:使用 IBTrACS 数据进行路径和登陆验证。
- 大气河流:由于缺乏全球性、实时且经过质量控制的地面降水雷达数据,依赖 ERA5 积分水汽输送(IVT)数据,尽管该框架允许未来集成如 IMERG/GPM 等数据集。
基于影响的指标:EWB 超越了全球 RMSE,定义了针对特定危害和最终用户需求的指标。这些指标包括:
- 提前量:重大事件被预测提前的时间长度。
- 区域误差:针对温度极端值(重点关注日最高温和最低温)的区域平均绝对误差(MAE)和均方根误差(RMSE)。
- 空间重叠:针对强天气和大气河流足迹的交并比(IOU)和临界成功指数(CSI)。
- 位移:热带气旋登陆的空间和时间误差。
- 虚警率(FAR):用于评估在边缘日期的过度预测情况。
该框架包含用于事件识别、追踪(包括一种新的基于 Python 的大气河流追踪器)以及指标计算的开源 Python 代码。
主要贡献
- 首个全面的高影响基准:EWB 被呈现为第一个开源、由社区驱动的套件,专门设计用于验证 AI 和 NWP 模型在高影响极端事件上的一致性和质量。
- 多样化的观测来源:整合地面观测(GHCNh、风暴报告)与再分析数据,提供了比仅依赖再分析的方法更稳健的验证标准。
- 面向影响的指标:该套件引入了直接解决预报“价值”的指标,例如预测热浪发生时间的能力或热带气旋登陆的空间准确性,而不仅仅是全球场统计量。
- 缓解评估偏差:通过包含边缘事件,EWB 提供了一种机制,用于检测和惩罚那些为了操纵全球分数而过度预测极端事件的模型。
- 开源生态系统:代码和数据公开可用,以促进可重复性和社区扩展,旨在成为类似于计算机视觉领域 ImageNet 的标准。
结果
论文通过评估最先进的 AI 模型(AIFS-Single、GraphCast、Pangu-Weather)在 curated 事件集上与 ECMWF IFS HRES 基准的表现,展示了 EWB 的效用:
- 热浪:虽然所有模型在全球 RMSE 上表现良好,但性能因地区而异。AIFS-Single 是唯一在 2021 年太平洋西北地区热浪中,在所有提前量上预测事件最高温均优于 HRES 的 AI 模型,尽管在事件最低温方面没有模型优于 HRES。
- 寒潮事件:AI 模型通常难以在较长提前量下预测事件最低温,显示出暖偏差。与其他 AI 模型相比,AIFS-Single 在全球和北美地区表现出更快的修正此偏差的能力。
- 对流爆发:当针对“近乎完美后报”区域进行评估时,AI 模型在临界成功指数(CSI)和虚警率(FAR)方面通常优于 HRES。然而,它们在边缘强天气日往往倾向于过度预测风险。
- 大气河流:AI 模型在北美地区的 CSI 和空间位移方面通常优于 HRES,尽管在欧洲和澳大利亚的表现参差不齐。
- 热带气旋:AI 模型结果喜忧参半。它们在西半球热带气旋的气压预测上大多优于 HRES,但在东半球的风速误差较高。早期初始化时间往往导致更大的路径误差,尽管某些模型(例如 GraphCast 在 TC Beryl 上)比其他模型更早锁定路径。
意义与主张
作者声称,EWB 代表了朝着使 AI 天气模型在 Murphy 所定义的意义(一致性、质量和价值)上变得“可信”和“优秀”迈出的关键一步。通过将重点从全球统计分数转移到具体的、高影响的案例研究和基于影响的指标,EWB 实现了:
- 真正的模型比较:促进不同模型架构和类型(AI 与 NWP)之间直接、公平的比较。
- 科学创新:提供一个标准化的测试平台,推动模型开发的改进,类似于 ImageNet 如何推动计算机视觉的发展。
- 社区成长:作为一个开源项目,它邀请全球气象社区扩展事件目录(例如扩展到干旱、洪水、暴风雪)并完善指标,确保基准随着科学的发展而演进。
论文谦逊地承认了局限性,例如由于数据可用性而依赖 ERA5 进行大气河流分析,以及目前专注于确定性预报,概率扩展计划在未来工作中进行。最终目标是确立 EWB 作为评估模型预测对生命和财产具有最大实质性影响的“分布尾部”能力的标准。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。