OceanDepths: A Global Dataset of Paired Subsurface and Surface Ocean Observations
本文介绍了 OceanDepths,这是首个开放、全球性、面向人工智能的数据集,它将高分辨率的卫星衍生表层海洋场(SST、SSS、SSH)与 2000 年至 2024 年间共定位的原位次表层温度和盐度剖面相结合,旨在为关于海洋动力学和状态重建的高级机器学习研究提供支持。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
海洋覆盖了地球表面百分之七十以上的面积,然而它们仍然是我们自身世界中最不为人所知的部分之一。虽然卫星可以以惊人的细节观察海洋的“皮肤”,测量表层水的温度和盐度,但它们无法看到隐藏在水面之下的景象。为了真正理解海洋如何调节地球气候、吸收热量以及驱动天气模式,科学家需要看到海洋的三维完整结构——从海平面一直到深海。几十年来,研究人员一直依赖于在水中漂流的浮动仪器,这些仪器在特定点进行测量,但与卫星提供的连续视图相比,这些数据点是零散且稀疏的。这一差距使得构建完整的海洋隐藏层图像,或训练能够帮助预测未来变化的下一代人工智能工具变得十分困难。
一组研究人员现在通过创建一个大规模的统一数据集填补了这一空白,该数据集将卫星观测到的海表情况与仪器测量的深层数据进行了配对。这个被称为 OceanDepths 的新资源将近二十五年的观测数据(从 2000 年到 2024 年)整合到了一个计算机易于读取的单一组织格式中。该数据集将高分辨率的海表温度、盐度和高度卫星图谱,与来自自主浮标的数百万个温度和盐度垂直剖面联系起来。通过将这两种截然不同的数据类型对齐到同一个网格上,研究人员为人工智能创造了一个训练场,使其学习海洋表层条件如何与其隐藏的深度相关联。这项工作不仅填补了一个数据漏洞,还提供了一个标准化的全球测试平台,使科学家能够超越粗略的近似值,开始以空前的精度对海洋复杂的、三维的行为进行建模。
理解海洋的挑战长期以来一直由观测的不匹配所定义。卫星提供了连续的、全球性的表面视图,捕捉全球范围内每日的温度和高度变化。相比之下,波浪之下的测量来自于大约 4,000 个自主浮标组成的编队,即 Argo 计划,这些浮标随电流漂流并定期潜入水下测量水柱。虽然这些浮标提供了对上层海洋最系统的采样,但相对于辽阔的海洋而言,其覆盖范围极其稀疏。在许多地方,每隔几百公里才有一个测量点,留下了巨大的知识空白。历史上,科学家试图利用计算机模型或通过有限的观测来重建数据来填补这些空白,但这些方法通常依赖于可能并不适用于所有地方的假设。其结果是缺乏一个单一、可靠的配对数据源,用于教导人工智能如何根据可见的表面特征来推断海洋的隐藏结构。
为了解决这个问题,OceanDepths 的研究人员组建了一个在全球范围内将卫星观测与原位测量相匹配的数据集。他们收集了海水表面温度、海水表面盐度和海水表面高度(指示海洋表面的动态形状)的卫星数据。这些表面测量值与水下仪器的数百万个温度和盐度剖面进行了匹配。团队仔细地将这些差异巨大的数据源对齐到一个共同的网格上,将整个地球划分为小方块,并确保每个表面测量值在附近都有对应的深度剖面。该数据集涵盖了从 2000 年到 2024 年的时段,提供了每周一次的海洋状态视图。它包含了超过 950 万个配对剖面,这些剖面被插值到 50 个标准深度层,在某些区域深度可达近 6,000 米。这种细粒度的水平允许研究人员以足以观察主导海洋动力学的旋转涡流和洋流的分辨率来研究海洋,而不仅仅是观察宽广、缓慢移动的趋势。
该新数据集的一个关键特征是,它提供的是原始的配对观测值,而非预先重建的模型。以往的数据集通常由计算机模型生成的平滑、填补缺口的产物组成,这些产物可能会掩盖误差或引入偏差。相比之下,OceanDeplets 提供实际的测量值以及一个密集的再分析产品,后者作为参考但并非主要目标。这种区别对于训练人工智能至关重要,因为它允许模型直接从真实、杂乱的海洋数据中学习,而不是从一个完美的模拟版本中学习。该数据集还包含一个可配置的系统,将全球划分为易于处理的块(或称斑块),使得研究人员能够轻松加载和处理数据以进行不同类型的分析。这种方法解决了以往工作中存在的一个主要局限,即数据往往分布在不同的格式和分辨率中,导致难以比较结果或复现研究。
研究人员通过使用该新资源来训练简单的人工智能模型以重建海洋的次表层状态,从而测试了其效用。目标是观察一个模型是否可以通过观察表面条件和来自浮标的稀疏测量值,准确预测中间每一深度的温度和盐度。结果显示,虽然基于历史平均值的简单统计方法仍然具有很强的竞争力,但人工智能模型能够捕捉到更复杂的空间模式,特别是在盐度方面。研究发现,考虑了周围水平背景(即观察特定点周围的水域,而不仅仅是其上方垂直柱体)的模型表现得显著更好。这表明海洋的隐藏结构与可见的表面模式及更广泛的区域背景有着深刻的联系,而这一关系正是通过这个新数据集得以详细探索的。
OceanDepths 的创建代表了海洋学和人工智能领域的重大进步。通过提供一个标准化、全球化且高分辨率的配对观测数据集,研究人员消除了寻找应用机器学习于海洋问题的科学家的主要准入门槛。该数据集极高的稀疏性(即在任何给定深度,观测覆盖面积不足海洋的 1%)提出了一个独特的挑战,推动了当前 AI 方法的发展。它迫使开发出能够从不完整且不规则的数据中学习的新技术,就像人类通过触摸物体表面的几个点来推断其形状一样。作者强调,该数据集不是最终解决方案,而是一个基础资源,一个共享的基准,将允许社区比较不同方法并追踪随时间变化的进展。
这项工作的意义不仅在于绘制更好的海洋地图。深入理解海洋的三维结构对于预测极端天气事件、追踪热量和碳的移动以及改进气候预测至关重要。通过表面观测来重建海洋隐藏状态的能力,可能会带来更准确的海热浪预测和海洋循环变化预测。此外,该数据集为不完全依赖复杂物理模型的观测驱动型预测方法打开了大门,可能为预测海洋未来状态提供一种新途径。研究人员已公开了所有数据、代码和工具,邀请全球科学界以此为基础进行构建,并探索我们这个星球最重要的系统的深层与隐藏领域。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。