← 最新论文
🤖 machine learning

OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI

本文介绍了 OpenSeisML,这是一个源自英国国家数据仓库的精选真实地震与测井数据集集合,其配备了一套用于时深转换的自动化流程,旨在解决公共数据稀缺问题,并支持训练用于地震反演与不确定性量化的生成式人工智能模型。

原作者: Ipsita Bhar, Huseyin Tuna Erdinc, Thales Souza, Charles Jones, Felix J. Herrmann

发布于 2026-05-21
📖 1 分钟阅读☕ 轻松阅读

原作者: Ipsita Bhar, Huseyin Tuna Erdinc, Thales Souza, Charles Jones, Felix J. Herrmann

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正在教一位机器人厨师如何烘焙完美的蛋糕。为此,机器人需要品尝成千上万块真实的蛋糕,以理解面粉、糖和鸡蛋如何相互作用。然而,在石油和天然气勘探的世界里,“蛋糕”是地下岩层,而“食谱”则藏在私营公司的保险库中。训练这些“人工智能厨师”所需的高质量数据大多被锁了起来,导致研究人员只能在那些尝起来不像真东西的、计算机生成的“假蛋糕”上练习。

本文介绍了OpenSeisML,这是一个全新的开源“厨房”,里面装满了真实、高质量的地震数据和测井数据,专为训练下一代用于寻找石油和天然气的人工智能而设计。

以下是他们所做工作的分解,使用了简单的类比:

问题:“假蛋糕”困境

长期以来,研究人员一直试图利用合成数据(计算机模拟)来训练人工智能,以查明地下情况。

  • Compass 模型与 SEAM:这些就像非常详细、外观逼真的“假蛋糕”。它们看起来不错,但每种只有一个版本。如果你仅用一块假蛋糕训练人工智能,它就会死记硬背这块特定的蛋糕,而当它看到略有不同的真实蛋糕时就会失败。
  • OpenFWI:这就像一个拥有各种不同形状“假蛋糕”的巨大图书馆。虽然数量众多,但它们仍然是在受控实验室中制作的。它们缺乏真实地质那种混乱、无序的“风味”。

结果呢?在这些假数据上训练的人工智能模型,在遇到地球实际的混乱现实时,往往难以应对。

解决方案:“真蛋糕”库

作者们前往英国国家数据库(NDR),这是一个由政府运营的、包含真实世界地质数据的公共图书馆。他们建立了一个自动化流程,以获取真实的地震勘探数据(地下三维图像)和真实的测井数据(从实际钻孔中获取的测量值)。

可以将这个流程想象成一条超级高效的装配线,它清洗并准备这些原材料,以便人工智能可以立即“食用”。

装配线:他们如何准备数据

该论文描述了一个将原始数据转化为训练材料的四步流程:

  1. 收集原料(数据收集)
    他们从英国下载了海量的三维地震数据集及相关测井数据。他们非常挑剔,主要选择 1990 年代之后的数据,因为旧数据就像“过期的原料”——混乱、不一致且难以自动使用。

  2. 对齐地图(坐标系)
    想象一下,试图将一张城市卫星照片与一张手绘的地铁系统地图叠加在一起。如果比例尺不匹配,线条就无法对齐。研究人员确保所有地震数据和测井数据都位于完全相同的坐标地图上,这样人工智能就能确切知道钻孔相对于地震图像的位置。

  3. 时间旅行转换(时深转换)
    这是最棘手的部分。地震数据通常以“时间”形式呈现(声波反弹回来所需的时间),而钻孔测量的是“深度”(向下多少米)。

    • 类比:这就像试图将写着“烹饪 10 分钟”的食谱转换为“烹饪直到中心温度达到 200 度”。你需要一张转换表。
    • 方法:他们利用“检查点”(checkshot)数据(确切告知声波传播到特定深度所需时间的测量值)来构建平滑的速度模型。这就像创建一张地下的“速度地图”。他们使用一种名为**径向基函数(RBF)**的数学工具来填补钻孔之间的空白,生成一张平滑的三维速度地图,充当时间与深度之间的翻译器。
  4. 切片面包(创建训练数据)
    一旦三维数据转换为深度,他们将其切割成穿过钻孔的二维条带。然后,他们将这些切片调整到标准尺寸(就像将所有照片调整为 1080p),以便人工智能可以一致地从中学习。

结果:一位新的人工智能厨师

研究人员通过训练一个扩散模型(一种学习模式以生成新图像的生成式人工智能)来测试这个新数据集。

  • 测试:他们仅用 40 口真实井的数据训练了人工智能。
  • 结果:人工智能成功学会了地下的统计“风味”。它能够生成新的、逼真的速度模型,这些模型看起来与真实的地下情况非常相似。
  • 目标:最终目标是利用该人工智能创建数千种“假设”情景。这有助于地质学家理解地下的不确定性,而不仅仅是给出一个单一的猜测。

总结

简而言之,这篇论文指出:“停止在虚假的、单一版本的模拟上训练你的人工智能。我们建立了一个自动化流程,从英国采集、清洗并整理真实的地震数据。这使人工智能能够学习地球真实、混乱的统计特性,从而为地震反演带来更好的预测。”

他们目前正使用二维切片工作,并计划将其扩展到三维,并纳入更多井(多达 1,000 口),以使人工智能更加智能。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →