OpenSeisML: Open Large-Scale Real Seismic and well-log Dataset for Generative AI
Dit artikel introduceert OpenSeisML, een gecureerde verzameling van echte seismische en boorlog-datasets uit het Nationaal Gegevensarchief van het VK, met een geautomatiseerde pijplijn voor tijddiepteconversie, om de schaarste aan publieke gegevens aan te pakken en de training van generatieve AI-modellen voor seismische inversie en onzekerheidskwantificering mogelijk te maken.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een robotkok te leren hoe hij de perfecte taart moet bakken. Om dit te doen, moet de robot duizenden echte taarten proeven om te begrijpen hoe bloem, suiker en eieren met elkaar interageren. In de wereld van olie- en gasexploratie zijn de "taarten" echter ondergrondse gesteentevormingen, en de "recepten" zitten verborgen in privékluisjes van bedrijven. Het merendeel van de hoogwaardige data die nodig is om deze AI-koks te trainen, is opgesloten, waardoor onderzoekers moeten oefenen met nep, door computers gegenereerde taarten die niet helemaal smaken als het echte werk.
Dit artikel introduceert OpenSeisML, een nieuwe, open-source "keuken" gevuld met echte, hoogwaardige seismische data en boorputlogs, speciaal ontworpen om de volgende generatie AI te trainen voor het vinden van olie en gas.
Hier is een uitleg van wat ze hebben gedaan, met behulp van eenvoudige analogieën:
Het Probleem: Het Dilemma van de "Nep-Taart"
Al geruime tijd proberen onderzoekers AI te trainen om te achterhalen wat er ondergronds zit met behulp van synthetische data (computersimulaties).
- Het Kompas-model & SEAM: Dit zijn als zeer gedetailleerde, realistisch ogende nep-taarten. Ze zien er goed uit, maar er is slechts één versie van elk. Als je je AI traint op slechts één nep-taart, onthoudt die die specifieke taart en faalt hij wanneer hij een iets andere echte taart ziet.
- OpenFWI: Dit is als een enorme bibliotheek van nep-taarten met verschillende vormen. Hoewel er veel van zijn, zijn ze nog steeds gemaakt in een gecontroleerd laboratorium. Ze missen de rommelige, chaotische "smaak" van echte geologie.
Het resultaat? AI-modellen die op deze nep-taarten zijn getraind, hebben vaak moeite wanneer ze geconfronteerd worden met de rommelige realiteit van de werkelijke Aarde.
De Oplossing: De Bibliotheek met "Echte Taarten"
De auteurs gingen naar het UK National Data Repository (NDR), een door de overheid beheerde openbare bibliotheek met geologische data uit de echte wereld. Ze bouwden een geautomatiseerde pijplijn om echte seismische surveys (3D-afbeeldingen van de ondergrond) en echte boorputlogs (metingen uit daadwerkelijke boorgaten) op te halen.
Zie deze pijplijn als een superefficiënte assemblagelijn die deze rauwe ingrediënten reinigt en voorbereidt zodat een AI ze direct kan "eten".
De Assemblagelijn: Hoe Ze De Data Voorbereidden
Het artikel beschrijft een vierstapsproces om ruwe data om te zetten in trainingsmateriaal:
Het Verzamelen van de Ingrediënten (Datacollectie):
Ze downloadden enorme 3D-seismische datasets en bijbehorende boorputlogs uit het VK. Ze waren kieskeurig en kozen voornamelijk data uit na de jaren 1990, omdat oudere data als "verlopen ingrediënten" was – rommelig, inconsistent en moeilijk automatisch te gebruiken.Het Uitlijnen van de Kaart (Coördinatenstelsel):
Stel je voor dat je probeert een satellietfoto van een stad te overlappen met een handgetekende kaart van een metronetwerk. Als de schalen niet overeenkomen, zullen de lijnen niet samenvallen. De onderzoekers zorgden ervoor dat alle seismische data en de boorputlogs op exact dezelfde coördinatenkaart stonden, zodat de AI precies weet waar de boorput zich bevindt ten opzichte van de seismische afbeelding.De Tijd-Reis Conversie (Tijd-naar-Diepte):
Dit is het lastigste deel. Seismische data komt vaak in "tijd" (hoe lang het een geluidsgolf kostte om terug te kaatsen), maar boorgaten meten "diepte" (hoeveel meter naar beneden).- De Analogie: Het is alsof je probeert een recept om te zetten dat zegt "bak 10 minuten" in "bak tot het centrum 200 graden bereikt". Je hebt een conversietabel nodig.
- De Methode: Ze gebruikten "checkshot"-data (metingen die precies aangeven hoe lang het geluid kost om naar specifieke diepten te reizen) om een glad snelheidsmodel te bouwen. Denk hierbij aan het maken van een "snelheidskaart" van de ondergrond. Ze gebruikten een wiskundig hulpmiddel genaamd Radiale Basisfuncties (RBF) om de gaten tussen de boorgaten op te vullen, waardoor een gladde, 3D-snelheidskaart ontstaat die fungeert als vertaler tussen tijd en diepte.
Het Snijden van het Brood (Trainingsdata Creëren):
Zodra de 3D-data naar diepte was omgezet, sneden ze deze in 2D-stroken die precies door de boorgaten liepen. Vervolgens herschalen ze deze stroken naar een standaardformaat (zoals het herschalen van alle foto's naar 1080p) zodat de AI er consistent van kon leren.
Het Resultaat: Een Nieuwe AI-Kok
De onderzoekers testten deze nieuwe dataset door een Diffusiemodel te trainen (een type Generatieve AI die patronen leert om nieuwe afbeeldingen te creëren).
- De Test: Ze trainden de AI op slechts 40 echte boorgaten.
- De Uitkomst: De AI slaagde erin de statistische "smaak" van de ondergrond te leren. Het kon nieuwe, realistische snelheidsmodellen genereren die zeer leken op de werkelijke grondwahrheid.
- Het Doel: Het ultieme doel is om deze AI te gebruiken om duizenden "wat-als"-scenario's te creëren. Dit helpt geologen de onzekerheid te begrijpen van wat er ondergronds ligt, in plaats van hen slechts één enkele gok te geven.
Samenvatting
Kortom, het artikel zegt: "Stop met het trainen van je AI op nep, single-versie simulaties. We hebben een geautomatiseerde pijplijn gebouwd om echte seismische data uit het VK te oogsten, te reinigen en te organiseren. Hierdoor kan AI de ware, rommelige, statistische aard van de Aarde leren, wat leidt tot betere voorspellingen voor seismische inversie."
Ze werken momenteel met 2D-stroken en plannen om dit op te schalen naar 3D en meer boorgaten op te nemen (tot 1.000) om de AI nog slimmer te maken.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.