← नवीनतम पेपर
🔬 materials science

ERAF4XRD: A multimodal agentic framework for constructing validated experimental X-ray diffraction databases from scientific literature

ERAF4XRD एक पूर्णतः स्वचालित, मल्टीमॉडल मल्टी-एजेंट फ्रेमवर्क है जो वैज्ञानिक साहित्य के चित्रों और पाठ से एक्स-रे विवर्तन (X-ray diffraction) डेटा को निकालता है, जोड़ता है और सत्यापित करता है ताकि असंरचित प्रकाशनों को एआई-संचालित अनुसंधान के लिए उच्च-परिशुद्धता वाले, मशीन-पठनीय प्रयोगात्मक डेटासेट में परिवर्तित किया जा सके।

मूल लेखक: Afnan Mostafa, William Ratcliff, Simon J. L. Billinge, Niaz Abdolrahim

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Afnan Mostafa, William Ratcliff, Simon J. L. Billinge, Niaz Abdolrahim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

द दशकों से, सामग्री विज्ञान (मटेरियल्स साइंस) में सबसे मूल्यवान खोजें वैज्ञानिक जर्नलों के पन्नों के भीतर कैद रही हैं। जब शोधकर्ता इस बात का अध्ययन करते हैं कि एक नई धातु या सिरेमिक में परमाणु खुद को कैसे व्यवस्थित करते हैं, तो वे अक्सर अपने निष्कर्षों को ग्राफ और चार्ट के रूप में प्रकाशित करते हैं, साथ ही उस पाठ (टेक्स्ट) को भी शामिल करते हैं जो उन परिस्थितियों की व्याख्या करता है जिनमें प्रयोग चलाया गया था। ये रिकॉर्ड मानवीय आँखों के लिए लिखे गए हैं, जो कैप्शन, तालिकाओं और अनुच्छेदों में बिखरे हुए हैं, जिससे कंप्यूटर के लिए इन्हें पढ़ना अविश्वसनीय रूप से कठिन हो जाता है। आज, वैज्ञानिक नई सामग्रियों की भविष्यवाणी करने और जटिल समस्याओं को हल करने के लिए आर्टिफिशियल इंटेलिजेंस का उपयोग करने के इच्छुक हैं, लेकिन इन एल्गोरिदम को सीखने के लिए संरचित डेटा—साफ, व्यवस्थित संख्या और तथ्य—की आवश्यकता होती है। इन दशकों के प्रकाशित ग्राफों को डिजिटल डेटासेट में बदलने का कोई तरीका न होने के कारण, प्रयोगात्मक ज्ञान का एक विशाल पुस्तकालय सुरक्षित है, जो उन उपकरणों के लिए अप्राप्य है जो अगली पीढ़ी की वैज्ञानिक सफलताओं को अनलॉक करने में मदद कर सकते हैं।

शोधकर्ताओं की एक टीम ने अब एक ऐसा सिस्टम बनाया है जिसे इन तालों को तोड़ने के लिए डिज़ाइन किया गया है। उन्होंने ERAF4xrd नामक एक स्वचालित ढांचा (फ्रेमवर्क) बनाया है, जो एक अथक डिजिटल लाइब्रेरियन के रूप में कार्य करता है जो वैज्ञानिक शोध पत्रों को पढ़ने, उन विशिष्ट ग्राफों को खोजने में सक्षम है जो दिखाते हैं कि सामग्रियां एक्स-रे को कैसे विवर्तित (डिफ्रैक्ट) करती हैं, और एक साफ, उपयोगी डेटाबेस बनाने के लिए उनके आस-पास के विवरणों को निकालने में सक्षम है। एक्स-रे विवर्तन (एक्स-रे डिफ्रैक्शन) एक मानक तकनीक है जहाँ वैज्ञानिक यह देखने के लिए सामग्रियों से एक्स-रे टकराते हैं कि उनकी आंतरिक संरचना कैसे व्यवस्थित है; ग्राफ पर धब्बों या रेखाओं का परिणाम सामग्री के परमाणु ब्लूप्रिंट को प्रकट करता है। चुनौती हमेशा यह रही है कि ग्राफ स्वयं आधी कहानी है। यह समझने के लिए कि ग्राफ का क्या अर्थ है, कंप्यूटर को विशिष्ट सेटिंग्स, विकिरण के प्रकार और नमूने की रासायनिक संरचना की भी आवश्यकता होती है, ऐसी जानकारी जो अक्सर छवि से दूर टेक्स्ट में दबी होती है।

शोधकर्ताओं का सिस्टम एक मानव विशेषज्ञ द्वारा उपयोग की जाने वाली सावधानीपूर्वक, चरण-दर-चरण प्रक्रिया की नकल करके काम करता है, लेकिन ऐसी गति और पैमाने पर जिसे एक व्यक्ति कभी मैच नहीं कर सकता। सबसे पहले, सॉफ्टवेयर हजारों ओपन-एक्सेस वैज्ञानिक शोध पत्रों को एकत्र करता है और उन्हें जल्दी से स्कैन करता है ताकि यह तय किया जा सके कि क्या उनमें उस प्रकार का एक्स-रे डेटा है जिसकी वह तलाश कर रहा है। एक बार प्रासंगिक पेपर मिल जाने के बाद, सिस्टम उसके भीतर प्रत्येक छवि को अलग करता है, विशेष रूप से एक्स-रे विवर्तन पैटर्न के विशिष्ट वक्रों (कर्व्स) और शिखरों (पीक्स) की तलाश करता है। फिर यह निष्कर्षण और जुड़ाव की एक कठोर प्रक्रिया शुरू करता है। यह टेक्स्ट से संख्याओं और सेटिंग्स को निकालता है और उन्हें सीधे सही ग्राफ से जोड़ता है, यह सुनिश्चित करता है कि नमूने का विवरण उसके संरचना के चित्र से मेल खाता है। महत्वपूर्ण रूप से, सिस्टम केवल अनुमान नहीं लगाता; इसमें एक अंतर्निहित सत्यापन चरण शामिल है जहाँ एक अलग डिजिटल एजेंट मूल दस्तावेज़ के विरुद्ध अपने स्वयं के कार्य की जाँच करता है ताकि यह सुनिश्चित हो सके कि प्रत्येक तथ्य साक्ष्य द्वारा समर्थित है।

जब टीम ने इस सिस्टम का परीक्षण 273 वैज्ञानिक प्रकाशनों के बेंचमार्क पर किया जिसमें 3,000 से अधिक संभावित छवियां शामिल थीं, तो परिणाम उल्लेखनीय रूप से सटीक थे। सॉफ्टवेयर ने लगभग 99 प्रतिशत की सटीकता के साथ सही एक्स-रे ग्राफों की सफलतापूर्वक पहचान की। इससे भी महत्वपूर्ण बात यह है कि इसने 1,400 से अधिक विशिष्ट डेटा बिंदु उत्पन्न किए, जैसे कि सामग्री का रासायनिक सूत्र या वह तापमान जिस पर इसे मापा गया था, और उन्हें उनके संबंधित चित्रों से सही ढंग से जोड़ा। जब मानव विशेषज्ञों ने बाद में अंतिम आउटपुट की समीक्षा की, तो उन्होंने पाया कि निकाला गया 98.5 प्रतिशत सूचना सही था, और लगभग 91 प्रतिशत मामलों में जहाँ टेक्स्ट में जानकारी उपलब्ध थी, सिस्टम ने उसे ढूंढ लिया। शायद सबसे महत्वपूर्ण बात यह है कि सिस्टम ने कोई भी तथ्य मनगढ़ंत नहीं बनाया; इसके द्वारा रिपोर्ट किया गया प्रत्येक डेटा बिंदु स्रोत दस्तावेज़ के एक विशिष्ट वाक्य या कैप्शन तक खोजा जा सकता था, जिसका अर्थ है कि डेटाबेस में कोई भी 'हैलुसिनेशन' या असमर्थित दावा शामिल नहीं हुआ।

अध्ययन ने यह भी खुलासा किया कि केवल उपलब्ध सबसे शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करना हमेशा सर्वोत्तम परिणाम की गारंटी नहीं देता है। शोधकर्ताओं ने कई अलग-अलग AI सिस्टम की तुलना की और पाया कि एक संतुलित दृष्टिकोण, जो विशिष्ट दृश्य इनपुट को लक्षित टेक्स्ट प्रोसेसिंग के साथ जोड़ता है, पूरे दस्तावेज़ को एक एकल मॉडल में फीड करने की तुलना में बेहतर काम करता है। उन्होंने पाया कि अपने स्वयं के कार्य को सत्यापित करने की सिस्टम की क्षमता ही इसकी सफलता की कुंजी थी। इस स्वतंत्र जांच के बिना, सिस्टम बहुत अधिक गलतियाँ करता, लेकिन सत्यापन चरण ने लगभग आधे शुरुआती दोषों को ठीक कर दिया, जिससे गलत लिंक हट गए और छूटे हुए विवरण जुड़ गए। यह प्रक्रिया सुनिश्चित करती है कि अंतिम डेटाबेस न केवल बड़ा है, बल्कि विश्वसनीय भी है, एक ऐसा गुण जो किसी भी वैज्ञानिक प्रयास के लिए आवश्यक है जो भविष्यवाणियां करने के लिए डेटा पर निर्भर करता है।

बिखरे हुए, मानव-पठनीय रिकॉर्ड को संरचित, मशीन-पठनीय डेटासेट में बदलकर, यह ढांचा वैज्ञानिक खोज के लिए एक नया मार्ग प्रदान करता है। यह मानव वैज्ञानिकों की आवश्यकता को प्रतिस्थापित नहीं करता है, बल्कि यह मैनुअल डेटा एंट्री की थकाऊ बाधा को हटा देता है, जिससे शोधकर्ता दशकों के छिपे हुए प्रयोगात्मक ज्ञान तक तुरंत पहुँच सकते हैं। सिस्टम को अनुकूलन योग्य (एडैप्टेबल) बनाया गया है, जिसका अर्थ है कि समान दृष्टिकोण को अंततः एक्स-रे विवर्तन से परे अन्य प्रकार के वैज्ञानिक डेटा पर भी लागू किया जा सकता है। यह कार्य प्रदर्शित करता है कि सही स्वचालित निष्कर्षण और कठोर सत्यापन के संयोजन के साथ, वैज्ञानिक साहित्य के विशाल, असंरचित संग्रह को डेटा-संचालित विज्ञान के भविष्य के लिए एक शक्तिशाली, जीवंत संसाधन में बदलना संभव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →