← नवीनतम पेपर
🔬 materials science

SALSA: Semi-Autonomous Literature Summarization Assistant

SALSA एक ओपन-सोर्स, ह्यूमन-इन-द-लूप प्लेटफॉर्म है जो डॉक्यूमेंट पार्सिंग, लार्ज लैंग्वेज मॉडल्स और कंप्यूटर विजन को यूजर-गाइडेड करेक्शन टूल्स के साथ जोड़कर मल्टीमॉडल साहित्य से स्ट्रक्चर्ड वैज्ञानिक डेटासेट के निष्कर्षण को स्वचालित करता है ताकि विभिन्न विषयों में स्केलेबल डेटा क्यूरेशन को समर्थन दिया जा सके।

मूल लेखक: William Schertzer, Sonakshi Gupta, Rampi Ramprasad

प्रकाशित 2026-09-22
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: William Schertzer, Sonakshi Gupta, Rampi Ramprasad

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

विज्ञान हमेशा से नए ज्ञान के निर्माण के लिए पिछले कार्यों के सावधानीपूर्वक अध्ययन पर निर्भर रहा है। दशकों से, शोधकर्ता अपने निष्कर्षों को पत्रिकाओं (जर्नल्स) में प्रकाशित करते रहे हैं, जिससे पुस्तकालयों में ऐसे टेक्स्ट, टेबल और ग्राफ भर गए हैं जो यह वर्णन करते हैं कि सामग्रियां कैसे व्यवहार करती हैं, रसायन कैसे प्रतिक्रिया करते हैं, और प्रयोग कैसे संपन्न होते हैं। हाल के वर्षों में, इस जानकारी की मात्रा में विस्फोट हुआ है। कंप्यूटर अब एक साथ हजारों प्रयोग चला सकते हैं, और वैज्ञानिक अपने परिणामों को तुरंत दुनिया में किसी के भी साथ साझा कर सकते हैं। डेटा का यह सैलाब एक उपहार है, लेकिन यह एक समस्या के साथ आता है: यह जानकारी मानवीय आंखों के लिए लिखी गई है, मशीनों के लिए नहीं। एक कंप्यूटर आसानी से यह नहीं समझ सकता कि एक चार्ट में मौजूद संख्या उस विशिष्ट रासायनिक मिश्रण से संबंधित है जिसका वर्णन तीन पृष्ठ पहले एक पैराग्राफ में किया गया था, या कि तापमान परिवर्तन दिखाने वाला एक ग्राफ फुटनोट में दी गई सामग्रियों की एक तालिका से जुड़ा हुआ है। इस डेटा का नए खोजों के लिए उपयोग करने हेतु, विशेष रूप से सामग्री विज्ञान (मटेरियल्स साइंस) जैसे क्षेत्रों में जहां शोधकर्ता बैटरी या सौर पैनलों के लिए नए पदार्थों को डिजाइन करते हैं, किसी को हर दस्तावेज़ को मैन्युअल रूप से पढ़ना होगा, प्रासंगिक नंबर खोजने होंगे और उन्हें एक संरचित सूची में टाइप करना होगा। यह प्रक्रिया धीमी, महंगी है, और यह सीमित करती है कि कितनी जानकारी को नई तकनीक में बदला जा सकता है।

इस बाधा को दूर करने के लिए, जॉर्जिया इंस्टीट्यूट ऑफ टेक्नोलॉजी के शोधकर्ताओं की एक टीम ने SALSA नामक एक नया सॉफ्टवेयर टूल विकसित किया है, जिसका अर्थ है 'सेमी-ऑटोमोटेड लिटरेचर समराइजेशन असिस्टेंट' (Semi-Autonomous Literature Summarization Assistant)। यह टूल वैज्ञानिक पत्रों की अव्यवस्थित, जटिल दुनिया और आधुनिक विश्लेषण के लिए आवश्यक स्वच्छ, व्यवस्थित डेटा के बीच एक सेतु के रूप में कार्य करने के लिए डिज़ाइन किया गया है। मानव विशेषज्ञ को बदलने के बजाय, SALSA उनके साथ मिलकर काम करता है। यह दस्तावेजों को पढ़ने, चित्रों और चार्टों को खोजने और नंबर निकालने के लिए उन्नत कंप्यूटर प्रोग्रामों का उपयोग करता है, लेकिन यह अंतिम निर्णय लेने का कार्य एक व्यक्ति पर छोड़ देता है। यह प्रणाली एक वैज्ञानिक लेख को ले सकती है, चाहे वह जर्नल से डाउनलोड की गई डिजिटल फ़ाइल हो या लैब नोटबुक की स्कैन की गई छवि, और उसे उसके भागों में विभाजित कर सकती है। यह टेक्स्ट को पढ़ता है, उन तालिकाओं का पुनर्निर्माण करता है जो शायद पेज ब्रेक के कारण टूट गई हों, और डेटा पॉइंट्स को निकालने के लिए ग्राफों को भी देखता है जो उनके भीतर छिपे होते हैं।

सॉफ्टवेयर को वैज्ञानिक साहित्य की विशिष्ट चुनौतियों को संभालने के लिए बनाया गया है, जहाँ जानकारी अक्सर बिखरी हुई होती है। एक एकल प्रयोग की रासायनिक रेसिपी एक अनुभाग में हो सकती है, परिणामों की एक तालिका दूसरे में, और प्रदर्शन दिखाने वाला एक ग्राफ एक चित्र में हो सकता है जिसके कैप्शन में स्थितियाँ स्पष्ट की गई हों। SALSA इन कड़ियों को जोड़ता है। यह पहचान सकता है कि ग्राफ पर एक रेखा पाठ में वर्णित एक विशिष्ट सामग्री का प्रतिनिधित्व करती है, और यह उस सामग्री को तालिका में सूचीबद्ध तापमान और दबाव की स्थितियों से जोड़ सकता है। जब सॉफ्टवेयर किसी चार्ट का सामना करता है, तो यह डेटा पढ़ने के लिए दो-चरणीय प्रक्रिया का उपयोग करता है। पहले, यह अक्षों (axes) और लेबल को पढ़ने के लिए ऑप्टिकल कैरेक्टर रिकग्निशन का उपयोग करता है। फिर, यह वास्तविक संख्यात्मक मानों में बदलने के लिए ग्राफ की रेखाओं या बिंदुओं का पीछा करता है। यदि कंप्यूटर धुंधली छवि या जटिल लेआउट के कारण भ्रमित होता है, तो सिस्टम रुक जाता है और एक मानव उपयोगकर्ता को हस्तक्षेप करने के लिए कहता है। उपयोगकर्ता अपनी स्क्रीन पर ग्राफ देख सकता है, अक्ष लेबल को ठीक कर सकता है, या लाइन ट्रेसिंग को समायोजित कर सकता है, जिससे डेटा को सुरक्षित करने से पहले उसकी सटीकता सुनिश्चित हो सके।

यह दृष्टिकोण अन्य उपकरणों से अलग है जो बिना मानवीय सहायता के पूरी प्रक्रिया को स्वचालित करने का प्रयास करते हैं। वे पूरी तरह से स्वचालित सिस्टम अक्सर ऐसी गलतियाँ करते हैं जिन्हें पकड़ना कठिन होता है, जैसे कि तालिका से गलत नंबर निकालना या किसी ग्राफ की गलत व्याख्या करना क्योंकि वह दूसरे के समान दिखता है। SALSA मानव को प्रक्रिया में शामिल रखकर इससे बचता है। सॉफ्टवेयर काम को चरणों में व्यवस्थित करता है, जिससे उपयोगकर्ता प्रत्येक चरण में परिणामों की जांच कर सके। यदि सिस्टम रासायनिक सामग्रियों की एक सूची निकालता है, तो उपयोगकर्ता सत्यापित कर सकता है कि सूची उस प्रयोग से मेल खाती है जिसका वर्णन पेपर में किया गया है। यदि सिस्टम एक ग्राफ को डिजिटाइज़ करता है, तो उपयोगकर्ता पुष्टि कर सकता है कि स्केल सही है। यह इंटरैक्शन सुनिश्चित करता है कि अंतिम डेटासेट केवल नंबरों का संग्रह नहीं है, बल्कि एक विश्वसनीय रिकॉर्ड है जो मूल शोध के संदर्भ को संरक्षित करता है। शोधकर्ताओं ने विभिन्न प्रकाशकों और विभिन्न लेआउट वाले विभिन्न वैज्ञानिक लेखों पर इस प्रणाली का परीक्षण किया, और पाया कि यह डेटा को आगे के विश्लेषण के लिए तैयार प्रारूप में सफलतापूर्वक व्यवस्थित कर सकता है।

यह टूल रसायन विज्ञान और सामग्री विज्ञान जैसे क्षेत्रों के लिए विशेष रूप से उपयोगी है, जहाँ किसी पदार्थ के निर्माण के विवरण उतने ही महत्वपूर्ण होते हैं जितना कि इसके द्वारा उत्पन्न परिणाम। "कंडक्टिविटी" (चालकता) जैसा नंबर तब तक अर्थहीन है जब तक यह न पता हो कि किस सामग्री का परीक्षण किया गया था, इसे कैसे संसाधित किया गया था, और किन परिस्थितियों में किया गया था। SALSA इन सभी विवरणों को एक साथ कैप्चर करने के लिए डिज़ाइन किया गया है। इसे विशिष्ट प्रकार की जानकारी खोजने के लिए कॉन्फ़िगर किया जा सकता है, जैसे कि समय के साथ एक झिल्ली (मेम्ब्रेन) का क्षरण या एक नई मिश्र धातु की मजबूती। शोधकर्ताओं ने दिखाया कि सिस्टम एनियन एक्सचेंज मेम्ब्रेन के बारे में लेखों का एक सेट ले सकता है, प्रासंगिक ग्राफ और तालिकाओं को खोज सकता है, और एक ऐसा डेटासेट बना सकता है जो चालकता मूल्यों को विशिष्ट उम्र बढ़ने के समय और परीक्षण स्थितियों से जोड़ता है। इस प्रकार का संरचित डेटा नए पदार्थों की भविष्यवाणी करने के लिए आर्टिफिशियल इंटेलिजेंस मॉडल को प्रशिक्षित करने के लिए आवश्यक है, लेकिन अब तक इसे बड़े पैमाने पर बनाना बहुत कठिन था।

यह सॉफ्टवेयर ओपन-सोर्स है, जिसका अर्थ है कि कोई भी इसका उपयोग कर सकता है और इसे अपनी आवश्यकताओं के अनुसार बदल सकता है। इसे स्थानीय कंप्यूटर पर चलाया जा सकता है, जो उन शोधकर्ताओं के लिए महत्वपूर्ण है जो संवेदनशील या मालिकाना डेटा के साथ काम करते हैं जिसे बाहरी सर्वर पर नहीं भेजा जा सकता है। सिस्टम उन दस्तावेजों तक पहुँचने या कॉपी करने की अनुमति नहीं देता है जिनके उपयोग का अधिकार उपयोगकर्ता के पास पहले से नहीं है; यह केवल उस जानकारी को व्यवस्थित करने में मदद करता है जिसे देखने का अधिकार उपयोगकर्ता के पास पहले से ही है। डेटा संग्रह के दोहराव वाले हिस्सों को स्वचालित करके, SALSA वैज्ञानिकों को व्याख्या और खोज पर अधिक समय बिताने के लिए मुक्त करता है, न कि स्प्रेडशीट में नंबर टाइप करने में। शोधकर्ता इस बात पर जोर देते हैं कि लक्ष्य विज्ञान से मानवीय निर्णय को हटाना नहीं है, बल्कि उस निर्णय को अधिक प्रभावी बनाना है। टूल डेटा खोजने और निकालने का भारी काम संभालता है, जबकि विशेषज्ञ यह सुनिश्चित करता है कि डेटा सार्थक हो। स्वचालन और निरीक्षण का यह संयोजन बड़े, उच्च-गुणवत्ता वाले डेटासेट के निर्माण की अनुमति देता है जो अगली पीढ़ी की वैज्ञानिक सफलताओं को संचालित कर सकते हैं, जिससे पिछले शोध के विशाल पुस्तकालय को भविष्य के लिए एक उपयोगी संसाधन में बदला जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →