Benchmarking machine and deep learning for retrospective multi-horizon prediction of GloFAS-modelled high flows at Hardinge Bridge in Bangladesh
这项研究基准测试了用于预测孟加拉国哈丁格大桥高流量事件的各种机器学习和深度学习模型,发现虽然随机森林在仅包含气象数据的场景下优于神经网络,但引入当前水文状态数据对预测准确度的提升显著大于架构复杂度的提升,尽管由于预测因子与目标之间存在共享的数据谱系,其结果仍是可重复的代理基准而非具备业务能力的技能。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
河流洪水是一种无情的力量,它重塑着景观并威胁着生命,尤其是在天气模式复杂且预测数据匮乏的地区。在像孟加拉国这样,巨大的河流系统从遥远的山脉流经多个国家才最终汇入大海的地方,预测何时会出现危险的高水位是一项极其艰巨的挑战。洪水逼近的信号往往埋藏在广阔上游区域的历史天气数据之中,这使得人们很难判断数英里外的强降雨风暴是否会在几天后转化为特定桥梁处的洪峰。长期以来,科学家们一直依赖物理模型来模拟降雨如何通过土壤和河流,但这些模拟并不完美。近年来,一种新的方法出现了:利用人工智能从历史数据中学习模式,希望计算机能比传统方法更好地发现即将到来的洪水的细微迹象。驱动这一新研究浪潮的问题是:这些模仿人类大脑处理序列能力的复杂深度学习系统,在预测罕见高水位事件时,是否真的比更简单、更成熟的统计工具具有优势。
一个研究小组决定在哈丁格大桥(Hardinge Bridge)——这是恒河进入孟加拉国的一个关键点——来回答这个问题。他们并没有尝试预测实际的洪水破坏或由物理测量仪记录的水位(这些数据在该地区通常难以获取或不可靠),而是将目光投向了由被称为全球洪水预警系统(GloFAS)的全球系统生成的河流流量数字模拟。该系统利用天气数据来模拟任何给定时间内河流中应有的水量。研究人员将这种模拟流量视为他们的目标,探讨机器学习能否预测模拟水位何时会超过高阈值,具体而言,即超过过去四十二年间记录的流量前百分之五的值。他们收集了涵盖1981年至2023年的每日天气数据,包括温度、土壤湿度和降水量,数据来自两个不同的公开来源。随后,他们将这些信息输入到各种计算机模型中,从简单的统计方法到旨在记忆过去事件的复杂神经网络,以观察哪种模型最能预测提前一天、三天、五天或七天的高水位情况。
这项实验的结果揭示了一个关于复杂度力量的惊人真相。最先进的深度学习模型——包括那些能够学习时间序列数据中长期依赖关系的复杂架构——并未超越一种被称为随机森林(random forest)的简单方法。这种较简单的方法通过构建大量的决策树并进行投票来决定结果,它始终能提供对高水位天数最准确的排名。虽然深度学习模型有时具有竞争力,但它们也较不稳定;其表现高度依赖于初始化方式,而简单的模型则保持稳定。研究发现,预测未来洪水最强大的预测因子并非复杂的算法,而是河流当前的状态。如果河流水位已经很高,那么第二天很可能依然很高。更具启发性的是,研究发现,了解河流当前的流量水平对预测的提升作用,远比增加神经网络的复杂层级更为显著。当研究人员将当天的模拟河流流量加入输入数据时,所有模型的准确度都大幅跃升,这证明了河流的初始状态是最关键的信息,其重要性远超架构复杂度的收益。
研究人员还发现,虽然这些学习型模型有时可以比单纯假设河流将维持现状提供更早的预警,但这种早期预警也带来了显著的代价。这些模型容易发出虚假警报,即在洪水并未到来时预测高水位。在包含八个不同洪水事件的具体测试期内,模型检测到了大多数事件,但也产生了大量的错误警告。这种权衡凸显了预测中的一个关键区别:一个模型可以非常擅长对可能发生洪水的日子进行排序,但在给出具体概率或决定何时鸣响警报方面却可能并不可靠。研究表明,深度学习模型并非天生优越;事实上,它们的复杂性并不能补偿单个地点可用历史洪水数据的有限性。事实证明,简单的模型结合对河流当前状态的清晰理解,表现得更加稳健且一致。
最终,这项工作是一个严谨的基准测试,而非洪水预警的最终解决方案。研究人员谨慎地指出,他们的结果适用于模拟的河流流量,而非实际的物理水位或其可能造成的破坏。由于用于训练模型的天气数据与试图预测的河流流量数据属于同一类大气模型,因此该研究衡量的是这些系统之间的契合程度,而非它们对现实的预测能力。研究结果表明,对于这个特定的问题和特定的位置,提高预测质量的关键不在于构建更大、更复杂的神经网络,而在于收集更多关于河流实际状态和上游天气模式的、更独立的观测数据。研究结论认为,尽管人工智能具有巨大的潜力,但其在水文学中的应用需要对模型复杂度和输入信息的质量之间进行仔细的平衡。在获得更多独立数据之前,最可靠的方法仍然是结合简单的、经过验证的统计方法以及对河流当前行为的深刻理解。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。