← नवीनतम पेपर
📄 earth_science

GeoExtractor: A Framework for Structured Information Extraction from Geoscientific Literature

यह शोध पत्र GeoExtractor प्रस्तुत करता है, जो एक लार्ज लैंग्वेज मॉडल-संचालित मल्टी-एजेंट फ्रेमवर्क है जो असंरचित भू-वैज्ञानिक साहित्य को संरचित डेटा में स्वचालित रूप से परिवर्तित करने के लिए एक पदानुक्रमित निष्कर्षण रणनीति का उपयोग करता है, जो मौजूदा विधियों से काफी बेहतर प्रदर्शन करता है और ज़िरकॉन विश्लेषणों के एक संकलित डेटाबेस से ज्ञात विवर्तनिक पैटर्न को सफलतापूर्वक पुनर्निर्मित करता है।

मूल लेखक: Zhong Peng, Ziqi Song, Yufei Ye, Shuang Li, Zongyuan Xiang, Jiang Yang

प्रकाशित 2026-07-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhong Peng, Ziqi Song, Yufei Ye, Shuang Li, Zongyuan Xiang, Jiang Yang

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि पृथ्वी विज्ञान (Earth science) की दुनिया एक विशाल, अराजक पुस्तकालय की तरह है। इस पुस्तकालय के भीतर पिछले एक सदी से भूवैज्ञानिकों द्वारा लिखे गए लाखों लेख, किताबें और रिपोर्ट मौजूद हैं। ये दस्तावेज़ सोने के समान हैं: चट्टानों की आयु, रासायनिक संरचना और स्थानों के बारे में विशिष्ट संख्याएँ। लेकिन समस्या यह है: यह सोना अव्यवस्थित वाक्यों, बिखरे हुए तालिकाओं और छितरे हुए चित्रों के भीतर दबा हुआ है।

एक उपयोगी डेटाबेस बनाने के लिए, वैज्ञानिकों को पहले एक ऐसे पुस्तकालयाध्यक्ष (librarian) की तरह काम करना पड़ता था जिसके पास आवर्धक लेंस (magnifying glass) हो, जो हर एक पन्ने को हाथ से पढ़ने और उन संख्याओं को खोजने और कॉपी करने के लिए पढ़ता था। यह धीमा, थकाऊ था और इसका मतलब था कि बहुत सारा मूल्यवान डेटा बेकार पड़ा था, जो कंप्यूटरों के लिए अनुपयोगी था।

जियोएक्सट्रैक्टर (GeoExtractor) का आगमन।

सोचिए कि जियोएक्सट्रैक्टर उपकरणों के एक विशेष सेट से लैस रोबोट पुस्तकालयाध्यक्षों की एक सुपर-स्मार्ट, अथक टीम है। पूरी किताब को एक साथ पढ़ने और उत्तरों का अनुमान लगाने के बजाय, यह टीम जानकारी निकालने के लिए एक चतुर, चरण-दर-चरण रणनीति का उपयोग करती है।

यह "टीम" कैसे काम करती है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. रणनीति: हाथी को एक बार में न खाएं

यदि आप एक सामान्य कंप्यूटर से एक 50 पन्नों के भूविज्ञान संबंधी पेपर को पढ़ने और उससे एक साथ 20 अलग-अलग संख्याएँ निकालने के लिए कहें, तो वह भ्रमित हो जाएगा या चीजें छोड़ देगा। यह किसी को एक ही बैठक में पूरी विश्वकोश (encyclopedia) याद करने के लिए कहने जैसा है।

जियोएक्सट्रैक्टर इस काम को टुकड़ों में तोड़ देता है:

  • चरण 1: "मुख्य पात्रों" (प्राइमरी कीज़) को खोजें। सबसे पहले, सिस्टम दस्तावेज़ को स्कैन करके मुख्य विषयों को खोजता है, जैसे कि "रॉक सैंपल A" या "ड्रिल कोर B"। यह उन्हें एंकर (anchors) के रूप में मानता है।
  • चरण 2: जासूसी लूप (The Detective Loop)। एक बार जब इसे एक रॉक सैंपल मिल जाता है, तो यह केवल उसकी आयु या स्थान का अनुमान नहीं लगाता है। इसके बजाय, यह एक लूप में प्रवेश करता है:
    • निर्णय: "मुझे इस चट्टान के लिए और क्या जानकारी चाहिए? आह, मुझे इसकी आयु चाहिए।"
    • प्राप्ति (Retrieve): यह एक विशिष्ट शेल्फ की तलाश करने वाले जासूस की तरह कार्य करता है, जो केवल उस पैराग्राफ या तालिका को खोजता है जिसमें उस विशिष्ट चट्टान की आयु का उल्लेख है।
    • निर्माण (Generate): यह उत्तर लिखता है।
    • दोहराव: यह अगली जानकारी (जैसे स्थान) पर जाता है, फिर से खोज करता है, और उसे लिख देता है।

2. दो-चरणीय खोज: जाल और भाला

कभी-कभी, जानकारी ढूँढना आसान होता है (जैसे एक स्पष्ट तालिका में संख्या)। अन्य समय में, यह छिपी होती है। पेपर इस मामले को संभालने के लिए एक "टू-स्टेज रिट्रीवल" (दो-चरणीय प्राप्ति) प्रणाली का वर्णन करता है:

  • चरण 1 (जाल - The Net): अधिकांश प्रश्नों के लिए, सिस्टम प्रासंगिक टेक्स्ट को जल्दी से पकड़ने के लिए एक विस्तृत जाल फेंकता है। यह कुशल है और बुनियादी बातों को कवर करता है।
  • चरण 2 (भाला - The Spear): यदि जाल खाली आता है, या यदि उत्तर के लिए तीन अलग-अलग पन्नों से कड़ियों को जोड़ने की आवश्यकता होती है (उदाहरण के लिए, "चट्टान इस स्थान पर है, जो इस प्रांत में है, जो इस पर्वत श्रृंखला का हिस्सा है"), तो सिस्टम "भाला" मोड में बदल जाता है। यह दस्तावेज़ के विभिन्न हिस्सों से सुरागों को जोड़ने के लिए एक गहरी, बहु-चरणीय खोज करता है। यह एक रहस्य सुलझाने जैसा है जहाँ संदिग्ध का स्थान पहले अध्याय में बताया गया है, लेकिन अपराध स्थल का वर्णन अंतिम अध्याय में किया गया है।

3. गुणवत्ता नियंत्रण: तथ्य-जांचकर्ता (The Fact-Checker)

इससे पहले कि रोबोट टीम अंतिम सूची सौंपे, एक "वेरिफिकेशन मॉड्यूल" एक सख्त संपादक के रूप में कार्य करता है। यह मूल टेक्स्ट के विरुद्ध टीम द्वारा खोजी गई प्रत्येक संख्या की जाँच करता है। यदि रोब सहित ने कोई संख्या बना ली या उसके पास यह साबित करने के लिए स्रोत टेक्स्ट नहीं था, तो संपादक उसे काट देता है। यह "हैलुसिनेशन" (मनगढ़ंत बातें बनाना) को रोकता है।

परिणाम: वर्षों से घंटों तक

शोधकर्ताओं ने इस प्रणाली का परीक्षण चार अलग-अलग प्रकार के भूविज्ञान विषयों (जैसे प्राचीन चुंबकीय क्षेत्र, तेल अन्वेषण और चट्टान रसायन विज्ञान) पर किया।

  • परीक्षण: उन्होंने जियोएक्सट्रैक्टर की तुलना अन्य तरीकों से की, जिसमें "एक साथ सब कुछ पढ़ने" वाला दृष्टिकोण और एक मानक उदाहरण-आधारित उपकरण शामिल था।
  • जीत: जियोएक्सट्रैक्टर सबसे सटीक था, विशेष रूप से तब जब डेटा जटिल या दस्तावेज़ में बिखरा हुआ था। यह उन कड़ियों को जोड़ने में विशेष रूप से अच्छा था जिन्हें अन्य विधियों ने छोड़ दिया था।

वास्तविक दुनिया का परीक्षण: मध्य एशियाई ओरोजेनिक बेल्ट (CAOB)

यह साबित करने के लिए कि यह वास्तव में काम करता है, टीम ने मध्य एशियाई ओरोजेनिक बेल्ट (CAOB) नामक एक विशाल पर्वत-निर्माण क्षेत्र के लिए डेटाबेस बनाने के लिए जियोएक्सट्रैक्टर का उपयोग किया।

  • कार्य: उन्होंने सिस्टम को 2,259 रॉक सैंपल्स के डेटा वाले 179 वैज्ञानिक पेपर दिए।
  • गति: एक मानव विशेषज्ञ को इसे मैन्युअल रूप से करने में लगभग 1,400 घंटे (लगभग 8 घंटे प्रति पेपर) लगते। जियोएक्सट्रैक्टर ने इसे 45 घंटों से भी कम में कर दिया।
  • परिणाम: रोबोट द्वारा निकाला गया डेटा केवल संख्याओं की सूची नहीं थी; जब वैज्ञानिकों ने पैटर्न देखे, तो डेटा पूरी तरह से ज्ञात भूवैज्ञानिक सिद्धांतों से मेल खाता था कि कैसे पृथ्वी की पपड़ी (crust) लाखों वर्षों में कैसे हिली और बदली। इसने साबित किया कि रोबोट ने केवल संख्याओं की नकल नहीं की; बल्कि इसने डेटा की संरचना को समझा।

निचोड़ (The Bottom Line)

जियोएक्सट्रैक्टर एक ऐसा उपकरण है जो अव्यवस्थित, अनियंत्रित वैज्ञानिक कहानियों को साफ, संरचित डेटा में बदल देता है। यह वैज्ञानिकों की जगह नहीं लेता है; यह उन्हें डेटा एंट्री के उबाऊ, दोहराव वाले काम से मुक्त करता है, जिससे वे बड़ी खोजों पर ध्यान केंद्रित कर पाते हैं। यह एक अपठनीय टेक्स्ट वाले पुस्तकालय को एक खोजने योग्य, कंप्यूटर-अनुकूल खजाने के बक्से में बदल देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →