Why Deterministic AI Weather Models Fail at Extremes and Physical Conservation: From the Perspective of Probabilistic Mean Field
本文认为,确定性人工智能天气模型无法捕捉极端情况并遵守物理定律,因为最小化均方误差迫使它们预测条件均值而非完整的转移分布,而概率生成方法可以通过更好地表示内在的大气变率来克服这一局限性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,大气层和海洋就像一个巨大的、混乱的舞池。空气和水在不断地旋转、碰撞和盘旋,形成复杂的图案,而这些图案遵循着严格且无形的物理规则。几十年来,科学家们一直试图利用超级计算机,通过逐步求解这些物理方程来预测这场舞蹈的下一步走向。但现在,舞池里出现了一个新玩家:人工智能(AI)。这些 AI 模型就像是看过数百万小时往期天气视频的超快速舞者。它们能在不到一秒的时间内预测出下一个动作,且消耗的能量仅为传统计算机的一小部分。这意义重大,因为它可以帮助我们更快地预警风暴、规划可再生能源以及管理洪水。
然而,问题在于——这些 AI 舞者虽然速度极快,且往往能猜中“平均”的动作,但它们有时看起来过于“平滑”了。它们容易错过那些狂野、疯狂的旋转(极端天气),偶尔还会跌撞在基础的舞蹈规则(如能量守守恒等物理定律)之上。科学家们一直在苦思冥想,为何这些看似聪明的 AI 模型总是在抹平现实中的粗糙边缘。是因为它们在训练中见到的极端天气不够多吗?还是数学逻辑上的缺陷?本文深入探讨了这个谜团,提出了一种统一理论来解释这些模型的行为方式,并利用“概率平均场”(probabilistic mean field)这一概念展示了:正是使它们变得精准的训练方法,导致了它们在面对极端情况时的失败。
“平均值”陷阱:为什么 AI 天气模型会抹平现实
那么,来自第二海洋研究所和上海交通大学的研究人员究竟发现了什么?他们发现,问题不仅仅是缺乏数据或算法不好,而是一个根本性的数学后果,源于目前大多数 AI 天气模型学习的方式。
可以这样理解:想象你在根据舞者的过往动作来猜测其下一个动作。如果你被训练去最小化你的“平均误差”(一个被称为均方根误差,即 RMSE 的数学概念),你的大脑自然会开始寻找所有可能动作的平均值。如果舞者可能会向左转、向右转或跳跃,而你想要在统计上“平均而言”是对的,你可能会预测一个既像半圈旋转又像半个跳跃的怪异动作,而这种动作在现实中从未发生过。你找到了数学上的中心点,却失去了舞蹈的真实性。
作者认为,目前的 AI 天气模型正是如此。通过训练它们去最小化平均误差,实际上是在教 AI 去预测条件期望——本质上,就是所有可能未来的统计平均值。在现实世界中,天气是一个“非线性”系统,这意味着如果你将两个有效的天气状态取平均值,得到的结果通常不是一个有效的天气状态。这就像把热水和冷水混合成“温水”,这没问题;但如果你把一场飓风和一个晴天混合在一起,你得到的不会是一个遵循物理定律的“中等强度”风暴,而是一个违反自然法则的“数学幽灵”。
实验:从简单的骰子到旋转的流体
为了证明这一点,研究团队进行了两个巧妙的实验。
首先,他们创建了一个简单的“玩具”世界,使用马尔可夫链(可以将其想象为一个棋盘游戏,你的下一步取决于你当前的位置)。他们训练了两个 AI “玩家”:一个试图猜出精确的下一个数字(最小化误差),另一个试图猜出每个可能数字的完整概率列表。
- 结果: 两名玩家都几乎完美地达到了“平均”得分。但那个追求误差最小化的玩家在捕捉可能性“分布”方面表现极差。它将复杂的多样性坍缩成了一个单一、安全且乏味的猜测。这就像一个背下了平均考试成绩的学生,却无法告诉你实际考题是什么。论文表明,这种“平均”猜测往往落在了一个在游戏中甚至不属于合法状态的位置。
其次,他们转向了一个更真实的旋转流体模拟(开尔文-亥姆霍兹不稳定性),这模拟了大气中空气和水如何混合。他们将标准的 AI 模型(旨在最小化误差)与“扩散模型”(一种学习生成一整套可能未来的 AI 类型,类似于一位创意艺术家)进行了对比。
- 结果: 标准 AI 模型生成的预报看起来极其平滑。虽然在纸面上的误差得分略低,但当你仔细观察时,它抹平了所有让天气显得真实的微小湍流漩涡和锐利边缘。它就像一张经过重度模糊处理以去除噪点的照片。
- 然而,扩散模型生成了一系列可能的未来。虽然这些未来的“平均值”看起来与标准 AI 模型一样平滑,但其单个样本却是清晰、细腻且保留了微小漩涡和极端梯度特征的。
“过度自信”的 AI
论文指出,核心问题在于熵,或者说信息量。真实的天气是混乱、不确定且充满可能性的(高熵)。一个标准的 AI 模型通过只给出一个单一的“最佳猜测”,本质上是在说:“我百分之百确定这就是会发生的情况。”这是过度自信。这就像气象预报员说:“雨会在下午 2:03 准时落下,”而实际上,雨可能在 1:00 到 4:00 之间的任何时间落下。
由于 AI 对其单一、平滑的平均值过于自信,它无法预测极端情况。如果一场风暴将是 100 英里的飓风或 50 英里的强风,AI 可能会预测一个安全的 75 英里风速——这虽然是平均值,但对于那些试图为最坏情况做准备的人来说,却是灾难性的。此外,由于那个“平均”状态是不同物理现实的数学混合体,它经常违反物理定律,例如无法保持能量或质量守恒。
这对未来意味着什么
作者总结道,解决方案不仅仅是微调训练数据或稍微改变损失函数。问题在于,确定性模型(给出单一答案的模型)从根本上就不适合像天气这样混沌且具有概率性的世界。
我们不应该问 AI:“明天最可能出现什么样的天气?”而应该问:“明天会出现哪些可能的天气,以及它们的可能性分别是多少?”论文指出,生成式模型(如扩散模型)才是未来。这些模型不仅猜测一个数字,它们还从分布中进行采样,创造出一组能够捕捉大气真实不确定性和复杂性的可能未来。
简而言之,论文建议,要真正掌握天气预报,AI 需要停止试图做一个完美的“平均值”猜测者,而是要开始扮演一个更具创意的“集成模型”,生成一系列丰富、真实且符合物理规律的可能性。这种转变可能是让 AI 最终能够处理极端事件和物理定律的关键。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。