OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI
本論文は、公共データの不足に対処し、地震波逆転および不確実性定量化のための生成 AI モデルの訓練を可能にするため、英国国立データリポジトリから収集した実地震データおよび井戸ログデータから構成され、時間深度変換のための自動化パイプラインを備えた、精選されたデータセット「OpenSeisML」を導入する。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ロボットシェフに完璧なケーキの焼き方を教えると想像してみてください。そのためには、ロボットは小麦粉、砂糖、卵がどのように相互作用するかを理解するために、何千もの本物のケーキを味見する必要があります。しかし、石油・ガス探査の世界では、「ケーキ」は地下の地層であり、「レシピ」は民間企業の金庫の中に隠されています。これらの AI シェフを訓練するために必要な高品質なデータのほとんどが封印されており、研究者たちは本物とはほど遠い味を持つ、人工的に生成されたコンピュータ上の「ケーキ」で練習せざるを得ない状況にあります。
本論文は、次世代の石油・ガス発見用 AI を訓練するために設計された、実在の高精度な地震データと井戸ログで満たされた新しいオープンソースの「キッチン」、OpenSeisML を紹介します。
以下に、彼らの行ったことを単純なアナロジーを用いて解説します。
問題点:「偽物のケーキ」のジレンマ
長年、研究者たちは合成データ(コンピュータシミュレーション)を用いて、地下の状況を AI に特定させようとしてきました。
- コンパスモデルと SEAM: これらは非常に詳細でリアルに見える偽物のケーキのようなものです。見た目には優れていますが、それぞれに存在するのはたった1 つのバージョンだけです。もし AI をたった一つの偽物のケーキで訓練すれば、その特定のケーキを暗記してしまい、少し異なる本物のケーキを見たときに失敗してしまいます。
- OpenFWI: これは様々な形状を持つ偽物のケーキの巨大な図書館のようなものです。数は多いものの、それらは制御された実験室で作られたものです。本物の地質が持つ厄介で混沌とした「風味」が欠けています。
その結果?これらの偽物で訓練された AI モデルは、実際の地球という厄介な現実に出会うと、しばしば苦戦します。
解決策:「本物のケーキ」の図書館
著者たちは、実世界の地質データの政府運営の公共図書館である英国国立データリポジトリ(NDR)を訪れました。彼らは、実在の地震探査(地下の 3 次元画像)と実在の井戸ログ(実際の掘削孔から採取された測定値)を取得するための自動化パイプラインを構築しました。
このパイプラインは、AI がすぐに摂取できるよう、これらの生データを洗浄・調製する超効率的な組立ラインと考えることができます。
組立ライン:データの準備方法
本論文では、生データを訓練用素材に変換する 4 段階のプロセスについて述べています。
材料の収集(データ収集)
彼らは英国から大規模な 3 次元地震データセットと関連する井戸ログをダウンロードしました。彼らは非常に厳格で、主に 1990 年代以降のデータを選択しました。なぜなら、古いデータは「賞味期限切れの材料」のように、乱雑で不整合があり、自動的に処理するのが困難だったからです。地図の整合(座標系)
都市の衛星写真と地下鉄の路線図を手書きしたものを重ね合わせようとしている状況を想像してください。スケールが一致しなければ、線は揃いません。研究者たちは、すべての地震データと井戸ログが正確に同じ座標マップ上にあり、AI が地震画像に対する掘削孔の位置を正確に把握できるようにしました。タイムトラベル変換(時間から深さへ)
これが最も難しい部分です。地震データは多くの場合「時間」(音波が跳ね返ってくるまでの時間)で提供されますが、掘削孔は「深さ」(何メートル下か)を測定します。- アナロジー: これは、「10 分間調理する」というレシピを「中心部が 200 度になるまで調理する」というレシピに変換しようとしているようなものです。変換表が必要です。
- 手法: 彼らは「チェックショット」データ(特定の深さまで音が伝わる時間を正確に示す測定値)を使用して、滑らかな速度モデルを構築しました。これは地下の「速度マップ」を作成するようなものです。彼らはラジアル基底関数(RBF)と呼ばれる数学的ツールを用いて、掘削孔間のギャップを埋め、時間と深さの間を翻訳する役割を果たす、滑らかな 3 次元速度マップを作成しました。
パンの切り分け(訓練データの作成)
3 次元データを深さに変換した後、彼らは掘削孔を貫通する 2 次元のストリップにそれをスライスしました。その後、AI が一貫して学習できるように、これらのスライスを標準サイズ(すべての写真を 1080p にリサイズするようなもの)にリサイズしました。
結果:新しい AI シェフ
研究者たちは、新しいパターンを学習して新しい画像を生成する生成 AI の一種である拡散モデルを訓練することで、この新しいデータセットをテストしました。
- テスト: 彼らはたった 40 本の実在の井戸で AI を訓練しました。
- 結果: AI は地下の統計的な「風味」を成功裡に学習しました。それは、実際の真の地盤と非常に似通った、新しい現実的な速度モデルを生成することができました。
- 目標: 究極の目的は、この AI を用いて数千の「もしも」シナリオを作成することです。これにより、地質学者は単一の推測を与えるのではなく、地下に何があるかという不確実性を理解できるようになります。
まとめ
要約すると、この論文はこう述べています。「偽物で、単一のバージョンのシミュレーションで AI を訓練するのをやめましょう。私たちは英国から実在の地震データを収集、洗浄、整理するための自動化パイプラインを構築しました。これにより、AI は地球の真実の、乱雑な、統計的な性質を学習できるようになり、地震逆解析の予測精度が向上します。」
彼らは現在 2 次元スライスで作業しており、今後はこれを 3 次元に拡張し、AI をさらに賢くするために、より多くの井戸(最大 1,000 本)を含めることを計画しています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。