← नवीनतम पेपर
💬 NLP

FormationEval, an open multiple-choice benchmark for petroleum geoscience

यह शोध पत्र FormationEval को प्रस्तुत करता है, जो पेट्रोलियम भूविज्ञान के सात डोमेन में 505 प्रश्नों वाला एक खुला बहुविकल्पीय बेंचमार्क है, जो 72 भाषा मॉडलों का मूल्यांकन करता है और यह प्रकट करता है कि शीर्ष प्रदर्शन करने वाले मॉडल लगभग पूर्ण सटीकता प्राप्त करते हैं, जबकि साथ ही निरंतर डोमेन-विशिष्ट चुनौतियों और ओपन-वेट एवं क्लोज्ड मॉडलों के बीच प्रदर्शन के अंतर के कम होने को भी उजागर करता है।

मूल लेखक: Almaz Ermilov

प्रकाशित 2026-02-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Almaz Ermilov

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तेल और गैस अन्वेषण (exploration) की दुनिया की कल्पना एक विशाल, जटिल पुस्तकालय के रूप में करें जो चट्टानों, भूमिगत तरल पदार्थों और पृथ्वी की गहराई में ड्रिलिंग के भौतिक विज्ञान के बारे में प्राचीन, धूल भरी किताबों से भरा है। लंबे समय से, हम कंप्यूटरों (विशेष रूप से, AI मॉडल्स) को इन किताबों को पढ़ने और विशेषज्ञ भूवैज्ञानिक (geologist) बनने के लिए सिखाने की कोशिश कर रहे हैं। लेकिन आप यह कैसे परखेंगे कि कंप्यूटर वास्तव में बुद्धिमान है, या वह केवल उत्तरों को रट रहा है?

यहाँ FormationEval आता है, एक नया "फाइनल एग्जाम" जिसे विशेष रूप से पेट्रोलियम भूविज्ञान (petroleum geoscience) के क्षेत्र में AI द्वारा देने के लिए डिज़ाइन किया गया है।

यहाँ इस शोध पत्र (paper) की कहानी है, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "चीटिंग" का परीक्षण

कल्प imagine करें कि आप किसी छात्र के इतिहास के ज्ञान का परीक्षण करना चाहते हैं। यदि आप उनसे केवल एक पाठ्यपुस्तक से एक वाक्य कॉपी करने के लिए कहते हैं, तो वे बिना कहानी समझे केवल उस एक वाक्य को याद कर सकते हैं। इसे "पैरोटिंग" (parroting) कहा जाता है।

आज के अधिकांश AI परीक्षण वैसे ही हैं—वे ऐसे प्रश्न पूछते हैं जिनका उत्तर AI प्रशिक्षण के दौरान देखे गए किसी वाक्यांश को पहचान कर दे सकता है। इस शोध पत्र के लेखकों ने महसूस किया कि तेल और गैस के लिए, हमें एक ऐसे परीक्षण की आवश्यकता थी जो AI को केवल याद करने के बजाय सोचने के लिए मजबूर करे। वे देखना चाहते थे कि क्या AI अवधारणाओं (जैसे कि तेल चट्टान के माध्यम से कैसे चलता है) को समझता है या केवल शब्दों को।

2. समाधान: एक "अवधारणा-आधारित" परीक्षा

टीम ने 505 बहुविकल्पीय प्रश्नों (multiple-choice questions) के साथ एक परीक्षण बनाया। इसे एक विशाल, विशिष्ट क्विज़ शो के रूप में समझें।

  • स्रोत सामग्री: उन्होंने केवल पाठ्यपुस्तकों से प्रश्न कॉपी-पेस्ट नहीं किए। इसके बजाय, उन्होंने एक चतुर विधि का उपयोग किया: उन्होंने तीन आधिकारिक पाठ्यपुस्तकों से विचारों को लिया और शून्य से नए प्रश्न लिखे।
    • उपमा: कल्पना करें कि एक शेफ एक प्रसिद्ध सूप का स्वाद लेता है, उसके स्वाद के प्रोफाइल को समझता है, और फिर एक ऐसा नया व्यंजन (recipe) लिखता है जो समान स्वाद वाला हो लेकिन उसमें अलग सामग्री का उपयोग किया गया हो। AI को "रेसिपी कार्ड" को पहचानने के बजाय "स्वाद" (concept) को चखना होगा।
  • विषय: परीक्षा तेल और गैस पुस्तकालय के सात अलग-अलग "कमरों" को कवर करती है:
    1. पेट्रोफिजिक्स (Petrophysics): चट्टानों का भौतिक विज्ञान (सबसे कठिन कमरा)।
    2. पेट्रोलियम जियोलॉजी (Petroleum Geology): तेल कैसे बनता है और कैसे फंसता है।
    3. जियोफिजिक्स (Geophysics): जमीन के नीचे "देखने" के लिए ध्वनि तरंगों का उपयोग करना।
    4. रिजर्वायर इंजीनियरिंग (Reservoir Engineering): तेल को बाहर कैसे निकाला जाए।
    5. ड्रिलिंग और प्रोडक्शन (Drilling & Production): ड्रिल और कुएं की यांत्रिकी (mechanics)।
    6. सेडिमेंटोलॉजी (Sedimentology): समय के साथ रेत और कीचड़ कैसे जमा होते हैं।

3. प्रतियोगी: AI ओलंपिक्स

लेखकों ने 72 विभिन्न AI मॉडल्स को यह परीक्षण देने के लिए आमंत्रित किया। यह एक मिश्रण था:

  • "क्लोज्ड" दिग्गज (The "Closed" Giants): Google, OpenAI और Anthropic जैसी कंपनियों के सुपर-पावरफुल, महंगे मॉडल्स (इन्हें महंगे, निजी ट्यूटर्स के रूप में सोचें)।
  • "ओपन" चुनौती देने वाले (The "Open" Challengers): मुफ्त या सस्ते मॉडल जिन्हें कोई भी डाउनलोड कर सकता है और चला सकता है (इन्हें प्रतिभाशाली स्व-शिक्षित छात्रों के रूप में सोचें)।

4. परिणाम: कौन पास हुआ?

परिणाम आश्चर्यजनक और रोमांचक थे:

  • सर्वश्रेष्ठ प्रदर्शन करने वाले: सबसे स्मार्ट AI, Gemini 3 Pro Preview, ने 99.8% का लगभग पूर्ण स्कोर प्राप्त किया। इसने केवल एक प्रश्न गलत किया!
  • ओपन-सोर्स का सरप्राइज: "ओपन" मॉडल्स ने अविश्वसनीय रूप से अच्छा प्रदर्शन किया। GLM-4.7 (एक ओपन मॉडल) ने 98.6% स्कोर किया, जो कई महंगे, क्लोज्ड मॉडल्स को पीछे छोड़ गया।
    • निष्कर्ष: आपको विशेषज्ञ भूविज्ञानी होने के लिए आवश्यक रूप से सबसे महंगे, निजी AI की आवश्यकता नहीं है। कुछ सस्ते, ओपन मॉडल्स भी उतने ही अच्छे हैं।
  • संघर्ष का क्षेत्र (The Struggle Zone): हर एक AI, यहाँ तक कि सबसे स्मार्ट भी, पेट्रोफिजिक्स (चट्टानों के भौतिक विज्ञान) के साथ सबसे अधिक संघर्ष करता है। यह एक "फाइनल बॉस" लेवल की तरह है। इसके लिए गहरे, तकनीकी समझ की आवश्यकता होती है जिसे बेहतरीन AI भी कठिन पाते हैं।
  • छोटे मॉडल्स: छोटे, सस्ते मॉडल्स (जैसे कि 3-बिलियन पैरामीटर वाला मॉडल) ने लगभग 57% सही उत्तर दिए। यह अनुमान लगाने से मुश्किल से बेहतर है, जो यह दर्शाता है कि इस विशिष्ट, जटिल क्षेत्र के लिए, आपको अभी भी एक "बड़े दिमाग" की आवश्यकता होती है।

5. "चीट कोड्स" (पूर्वाग्रह/Bias)

लेखक परीक्षण की खामियों के बारे में बहुत ईमानदार थे। उन्होंने पाया कि AI कभी-कभी उत्तरों की लंबाई देखकर "चीटिंग" कर रहा था।

  • द ग्लिच (The Glitch): कई प्रश्नों में, सही उत्तर गलती से गलत उत्तरों की तुलना में लंबा था। AI ने सीखा, "ओह, लंबा उत्तर शायद सही है!"
  • सुधार: लेखकों ने अधिकांश को ठीक कर दिया, लेकिन थोड़ा सा "लंबाई का पूर्वाग्रह" (length bias) अभी भी बना हुआ है। वे इसके बारे में पारदर्शी हैं ताकि जो कोई भी इस परीक्षण का उपयोग करता है उसे सावधानी बरतने के लिए पता हो।

6. यह क्यों मायने रखता है

यह शोध पत्र केवल तेल और गैस के बारे में नहीं है; यह विश्वास के बारे में है।

  • उद्योग के लिए: तेल कंपनियाँ अब इन AI का उपयोग चट्टानों का विश्लेषण करने और ड्रिलिंग की योजना बनाने में मदद के लिए कर सकती हैं, यह जानते हुए कि AI कितना स्मार्ट (या मूर्ख) है।
  • जनता के लिए: यह दिखाता है कि AI विशिष्ट, वैज्ञानिक नौकरियों में बहुत अच्छा हो रहा है, लेकिन इसे कठिन चीजों के लिए मानव विशेषज्ञों द्वारा दोबारा जांच की आवश्यकता है।
  • भविष्य के लिए: लेखकों ने परीक्षण, प्रश्न और परिणाम सार्वजनिक रूप से उपलब्ध करा दिए हैं। यह ऐसा है जैसे उन्होंने एक सार्वजनिक जिम बनाया है जहाँ कोई भी अपने AI की ताकत का परीक्षण करने आ सकता है।

सारांश

FormationEval तेल और गैस की दुनिया में AI के लिए एक नया, निष्पक्ष और कठिन परीक्षा है। इसने साबित किया कि AI अविश्वसनीय रूप से स्मार्ट हो रहा है (लग लगभग 100% स्कोर के साथ), मुफ्त/ओपन मॉडल्स महंगे मॉडल्स का मुकाबला कर रहे हैं, और चट्टानों के गहरे भौतिक विज्ञान को समझना अभी भी मशीनों के लिए सबसे बड़ी चुनौती है। यह हमें ऊर्जा खोजने में मदद करने के लिए AI का सुरक्षित और प्रभावी ढंग से उपयोग करने की दिशा में एक बड़ा कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →