← नवीनतम पेपर
💻 computer science

MineralBench: an evaluation benchmark of large language models for mineral resources

यह शोध पत्र MineralBench प्रस्तुत करता है, जो एक व्यापक मूल्यांकन बेंचमार्क है जिसमें तीन विशिष्ट कार्य और चार मेट्रिक्स शामिल हैं ताकि खनिज संसाधनों के क्षेत्र में 13 लार्ज लैंग्वेज मॉडल्स के प्रदर्शन का व्यवस्थित रूप से आकलन और तुलना की जा सके, जो सामान्य और डोमेन-विशिष्ट क्षमताओं के बीच महत्वपूर्ण प्रदर्शन अंतराल और फाइन-ट्यूनिंग की कार्य-निर्भर प्रकृति को प्रकट करता है।

मूल लेखक: Jiahao Dan, Shengwen Li, Hong Yao, Yuan Cong, Bingyi Li, Hang Zhou

प्रकाशित 2026-09-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jiahao Dan, Shengwen Li, Hong Yao, Yuan Cong, Bingyi Li, Hang Zhou

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

पृथ्वी पत्थर में लिखी सूचनाओं का एक विशाल, शांत पुस्तकालय समेटे हुए है। सदियों से, भूवैज्ञानिकों ने इस पुस्तकालय को हाथों से पढ़ा है, मूल्यवान खनिज कहाँ स्थित हैं, यह खोजने के लिए रिपोर्टों, मानचित्रों और फील्ड नोट्स के पहाड़ों को छानते रहे हैं। यह मैन्युअल काम धीमा, महंगा और मानवीय त्रुटियों के प्रति संवेदनशील है, विशेष रूप से तब जब डेटा जमा होने लगता है। हाल के वर्षों में, एक नए प्रकार के कंप्यूटर प्रोग्राम का उदय हुआ है जो आश्चर्यजनक प्रवाह के साथ मानव भाषा को पढ़ और समझ सकता है। 'लार्ज लैंग्वेज मॉडल्स' (LLMs) के रूप में जाने जाने वाले ये प्रोग्राम प्रश्नों के उत्तर देने, पाठ का सारांश बनाने और कई क्षेत्रों में समस्याओं को हल करने में सक्षम रहे हैं। लेकिन जबकि वे सामान्य ज्ञान में उत्कृष्ट हैं, कोई भी निश्चित रूप से नहीं जानता था कि क्या वे भूविज्ञान की विशिष्ट, तकनीकी भाषा को संभाल सकते हैं। प्रश्न केवल यह नहीं था कि क्या ये प्रोग्राम भूविज्ञान की किताब पढ़ सकते हैं, बल्कि यह था कि क्या वे वास्तव में एक भूविज्ञानी को एक नई खान खोजने या किसी जटिल चट्टान संरचना को बिना किसी खतरनाक गलती के समझने में मदद कर सकते हैं।

इसका उत्तर देने के लिए, चीन यूनिवर्सिटी ऑफ जियोसाइंसेज और चाइनीज एकेडमी ऑफ जियोलॉजिकल साइंसेज के शोधकर्ताओं ने 'मिनरलबेंच' (MineralBench) नामक एक नया परीक्षण मैदान बनाया। इसे आर्टिफिशियल इंटेलिजेंस के लिए विशेष रूप से खनिज जगत में डिज़ाइन की गई एक विशेष परीक्षा के रूप में समझें। शोधकर्ताओं ने कंप्यूटरों से केवल यादृच्छिक तथ्यों का अनुमान लगाने के लिए नहीं कहा; उन्होंने तीन अलग-अलग प्रकार की चुनौतियाँ बनाईं जो वास्तविक कार्य की नकल करती हैं। पहला, उन्होंने यह परीक्षण किया कि क्या मॉडल विशिष्ट खनिज शब्दों की परिभाषाओं को समझ सकते हैं, जैसे कि यह जानना कि "पायराइट डिके" (pyrite decay) का सटीक अर्थ क्या है। दूसरा, उन्होंने मॉडलों से खनिजों के विशिष्ट गुणों को पहचानने के लिए कहा, जैसे कि 'एक्टिनोलाइट' (Actinolite) नामक चट्टान को बनाने वाले रासायनिक तत्वों को सूचीबद्ध करना। अंत में, उन्होंने मॉडलों को भूवैज्ञानिक पाठ के लंबे, असंरचित पैराग्राफ दिए और उन्हें खनिजों और चट्टानों की परतों के विशिष्ट नाम निकालने के लिए कहा, जो शब्दों के ढेर में सुई खोजने जैसा कार्य है।

टीम ने तेरह अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडलों को इस कठिन परीक्षा से गुजारा। कुछ विशाल, क्लाउड-आधारित सिस्टम थे जिन्हें इंटरनेट के माध्यम से एक्सेस किया जा सकता था, जबकि अन्य छोटे संस्करण थे जिन्हें लैब में एक एकल कंप्यूटर पर चलाया जा सके। परिणामों ने एक स्पष्ट विभाजन प्रकट किया। मॉडल सामान्य विज्ञान के प्रश्नों के लिए काफी अच्छे थे, अक्सर गणित और बुनियादी विज्ञान के मानक परीक्षणों पर उच्च अंक प्राप्त करते थे। हालांकि, जब प्रश्न खनिजों की विशिष्ट दुनिया की ओर मुड़े, तो उनका प्रदर्शन काफी गिर गया। कोई भी एक मॉडल हर चीज़ में सर्वश्रेष्ठ नहीं था। एक मॉडल पाठ में नाम खोजने में सबसे तेज़ हो सकता था, जबकि दूसरा रासायनिक तत्वों को सूचीबद्ध करने में बेहतर था, और तीसरा शायद सबसे सुसंगत हो सकता था कि जब भी उससे एक ही प्रश्न पूछा जाए तो वह हर बार एक ही उत्तर दे। यह सुझाव देता है कि अभी तक कोई एक "परफेक्ट" जियोलॉजी एआई नहीं है; इसके बजाय, विभिन्न मॉडलों की विभिन्न ताकतें हैं, बिल्कुल एक विशेषज्ञों की टीम की तरह जहाँ प्रत्येक व्यक्ति काम के अलग-अलग हिस्से में उत्कृष्ट होता है।

शोधकर्ताओं ने उत्तरों की स्थिरता की भी जांच की। उन्होंने एक ही प्रश्न को कई बार पूछा यह देखने के लिए कि क्या मॉडल एक ही उत्तर देंगे या वे अपना मन बदल देंगे। उन्होंने पाया कि जबकि कुछ मॉडल बहुत सुसंगत थे, वे कभी-कभी लगातार गलत थे, बार-बार एक ही गलत उत्तर दोहरा रहे थे। अन्य परिवर्तनशील थे लेकिन कभी-कभी सही उत्तर तक पहुँच जाते थे। यह खोज महत्वपूर्ण है क्योंकि यह दिखाती है कि केवल एक बार कंप्यूटर से पूछना पर्याप्त नहीं है; गंभीर कार्य के लिए, आपको यह जानने की आवश्यकता है कि उत्तर सही और विश्वसनीय दोनों है या नहीं। अध्ययन में यह भी परीक्षण किया गया कि जब उन्होंने अतिरिक्त डेटा के साथ 'फाइन-ट्यूनिंग' करके मॉडल को भूविज्ञान के बारे में अधिक "सिखाने" की कोशिश की तो क्या हुआ। उन्होंने पाया कि यह प्रक्रिया एक दोधारी तलवार थी: मॉडल एक विशिष्ट कार्य में बहुत बेहतर हो गया, जैसे कि पाठ से नाम निकालना, लेकिन वह अन्य कार्यों में, जैसे गणित की समस्याओं को हल करने में कमजोर हो गया। यह इंगित करता है कि एआई को एक संकीर्ण क्षेत्र में विशेषज्ञ बनाने से कभी-कभी वह अन्य चीजों को अच्छी तरह से करने के तरीके भूल सकता है।

अंततः, यह कार्य उन सभी के लिए एक स्पष्ट मानचित्र प्रदान करता है जो खनिज उद्योग में आर्टिफिशियल इंटेलिजेंस का उपयोग करने की कोशिश कर रहे हैं। यह दिखाता है कि हालांकि इन उपकरणों में बड़ी क्षमता है, लेकिन वे अभी तक अपने आप में मानव विशेषज्ञों को बदलने के लिए तैयार नहीं हैं। सबसे अच्छा दृष्टिकोण एक विशिष्ट कार्य के लिए सही उपकरण का सावधानीपूर्वक चयन करना प्रतीत होता है, यह समझते हुए कि एक मॉडल जो तेज़ हो सकता है वह सटीक नहीं होगा, और एक मॉडल जो सटीक है वह धीमा हो सकता है। इन मानकों को स्थापित करके और वर्तमान तकनीक की विशिष्ट शक्तियों और कमजोरियों को उजागर करके, शोधकर्ताओं ने वैज्ञानिक समुदाय को प्रगति को मापने और पृथ्वी के संसाधनों की खोज के कठिन कार्य के लिए सही डिजिटल सहायक को चुनने का एक तरीका दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →