Research Entity Extraction and Topic Detection from UKRI Grant Proposals
यह शोध पत्र "ट्रैकिंग स्टार्स एंड यूनिकॉर्न" परियोजना के प्रारंभिक निष्कर्ष प्रस्तुत करता है, जो यह प्रदर्शित करता है कि एक मिस्ट्रल-आधारित दृष्टिकोण (Mistral-based approach) यूकेआरआई (UKRI) अनुदान प्रस्तावों के भीतर अनुसंधान संस्थाओं को सटीक रूप से निकालने और विषयों को वर्गीकृत करने में GPT-4o और एक विशेष DSIT-टैक्सोनॉमी एल्गोरिदम दोनों से बेहतर प्रदर्शन करता है, जो उभरते अनुसंधान क्षेत्रों की पहचान करने के लिए एक सुरक्षित और कुशल समाधान प्रदान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि यूके (UK) सरकार एक विशाल पुस्तकालय है जो हर साल हजारों नई किताबें (अनुसंधान परियोजनाएं) वित्तपोषित करती है। पुस्तकालयाध्यक्ष (UKRI) जानना चाहते हैं: अभी कौन सी सबसे रोमांचक नई कहानियाँ लिखी जा रही हैं? उन्हें "यूनिकॉर्न" (unidorns) को पहचानना है—यानी बिल्कुल नई, क्रांतिकारी विचार जो प्रसिद्ध होने से पहले ही दुनिया बदल सकते हैं।
समस्या यह है कि एक-एक करके सभी आवेदनों को पढ़ना बहुत कठिन है। इसलिए इस शोध पत्र के लेखकों ने तीन अलग-अलग "रोबोट पुस्तकालयाध्यक्षों" (AI टूल्स) का परीक्षण किया ताकि वे प्रस्तावों के सारांश को पढ़ सकें और बता सकें कि वे परियोजनाएं वास्तव में किस बारे में हैं।
उन्होंने इसे कैसे किया और उन्हें क्या मिला, इसका सरल विवरण यहाँ दिया गया है:
तीन रोबोट पुस्तकालयाध्यक्ष
टीम ने यह देखने के लिए तीन अलग-अलग AI "मस्तिष्कों" का परीक्षण किया कि प्रस्तावों को पढ़ने में कौन सबसे अच्छा है:
- GPT-4o: एक बहुत प्रसिद्ध, शक्तिशाली AI (एक अत्यंत बुद्धिमान, सुशिक्षित प्रोफेसर की तरह)।
- Mistral: एक थोड़ा छोटा, तेज़ AI (एक तीक्ष्ण, कुशल कनिष्ठ शोधकर्ता की तरह)।
- DSIT-Taxonomies: एक पुराना, नियम-आधारित कंप्यूटर प्रोग्राम (एक ऐसे पुस्तकालयाध्यक्ष की तरह जो केवल शब्दकोश में विशिष्ट कीवर्ड्स को खोजता है)।
परीक्षण: "एब्स्ट्रैक्ट्स" (Abstracts) को पढ़ना
शोधकर्ताओं ने विभिन्न क्षेत्रों (जैसे कला, चिकित्सा और इंजीनियरिंग) से 42 वास्तविक अनुदान प्रस्तावों (grant proposals) को लिया। उन्होंने प्रत्येक रोबोट को दो काम करने के लिए कहा:
- महत्वपूर्ण शब्दों को चुनना: (जैसे, "स्टेम सेल्स," "आर्टिफिशियल इंटेलिजेंस," "जलवायु परिवर्तन")।
- परियोजना को एक श्रेणी में वर्गीकृत करना: (जैसे, "क्या यह जीव विज्ञान के बारे में है? या भौतिकी के बारे में?")।
उन्होंने रोबोट के उत्तरों की तुलना एक-दूसरे से और मानव विशेषज्ञों से की ताकि देखा जा सके कि किसने सही उत्तर दिया।
परिणाम: कौन जीता?
1. "कीवर्ड हंटर" (DSIT-Taxonomies) संघर्ष करता रहा
पुराना नियम-आधारित रोबोट एक ऐसे व्यक्ति की तरह था जो केवल यह गिनकर किसी कविता को समझने की कोशिश कर रहा हो कि "प्रेम" शब्द कितनी बार आया है। वह अक्सर व्यापक दृष्टिकोण को समझने में विफल रहा।
- इसने अच्छे वाक्यांशों को छोटे, बेकार टुकड़ों में तोड़ दिया (उदाहरण के लिए, इसने "सिग्नल" और "एम्प्लीफायर" को एक एकल अवधारणा के बजाय दो अलग-अलग चीजों के रूप में देखा)।
- इसने "हालांकि" (however) या "हजारों" (thousands) जैसे यादृच्छिक शब्दों को पकड़ लिया जिनका कोई विशेष अर्थ नहीं था।
- स्कोर: यह विषय को केवल 71% बार सही पहचान पाया।
2. "सुपर-प्रोफेसर" (GPT-4o) ने शानदार प्रदर्शन किया
बड़ा AI उत्कृष्ट था। इसने संदर्भ को समझा और सही विचारों को चुना, ठीक वैसे ही जैसे एक मानव विशेषज्ञ करता है।
- स्कोर: इसने विषय को 90.5% बार सही पहचाना।
3. "कुशल कनिष्ठ" (Mistral) आश्चर्यजनक सितारा निकला
छोटे AI (Mistral) ने लगभग उतना ही अच्छा प्रदर्शन किया जितना कि बड़े प्रोफेसर ने।
- इसने GPT-4o के समान ही महत्वपूर्ण शब्दों को चुना।
- इसने उन गलतियों को कम किया जहाँ यह टेक्स्ट में मौजूद न होने वाले शब्द बना देता था (एक समस्या जिसे "हलुसिनेशन" या भ्रम कहा जाता है)।
- स्कोर: इसने भी विषय को 90.5% बार सही पहचाना।
क्यों Mistral इस कहानी का "यूनिकॉर्न" है
शोध पत्र निष्कर्ष निकालता है कि इस काम के लिए Mistral सबसे अच्छा विकल्प है, और इसके कारण यहाँ दिए गए हैं, एक सरल उपमा का उपयोग करते हुए:
- सुरक्षा: कल्पना कीजिए कि आप एक गुप्त डायरी पढ़ रहे हैं। आप नहीं चाहेंगे कि आप उस डायरी को एक विशाल, सार्वजनिक क्लाउड सर्वर पर भेजें जहाँ कोई भी उसे देख सके। Mistral एक ऐसे टूल की तरह है जिसे आप अपने स्वयं के सुरक्षित कार्यालय के भीतर रख सकते हैं। यह तेज़ है, सस्ता है, और डेटा को निजी रखता है।
- प्रदर्शन: हालांकि यह GPT-4o से छोटा है, फिर भी इसने उतना ही अच्छा काम किया।
- विश्वसनीयता: यह बड़े AI की तुलना में फर्जी तथ्य बनाने (hallucination) की संभावना कम रखता है।
मुख्य निष्कर्ष
शोधकर्ताओं ने पाया कि अनुसंधान प्रस्तावों को समझने के लिए आपको सबसे बड़े, सबसे महंगे AI की आवश्यकता नहीं है। एक स्मार्ट, कुशल और सुरक्षित AI (Mistral), भारी-भरकम दिग्गजों के समान ही शोध प्रस्तावों को पढ़ सकता है, महत्वपूर्ण विचारों को निकाल सकता है और उन्हें श्रेणियों में वर्गीकृत कर सकता है।
इसका अर्थ यह है कि यूके सरकार अब अपने 3,50,000 प्रस्तावों के विशाल पुस्तकालय को स्कैन करने के लिए इस टूल का उपयोग कर सकती है ताकि उन शुरुआती "यूनिकॉर्न्स" को खोजा जा सके—यानी वे नए, रोमांचक अनुसंधान क्षेत्र जो फंडिंग के योग्य हैं—बिना डेटा लीक या सबसे महंगी तकनीक के खर्च की चिंता किए।
नोट: शोध पत्र ने केवल यह सिद्ध करने के लिए 42 प्रस्तावों पर परीक्षण किया कि यह विधि काम करती है। अगला कदम (जो वे करने की योजना बना रहे हैं) पूरे पुस्तकालय के 3,50,000 प्रस्तावों पर इस विधि का उपयोग करना है ताकि यूके अनुसंधान के भविष्य का मानचित्र तैयार किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।