How Do Algorithms Interact in Scientific Research? Large-Scale Semantic Relation Identification and Analysis Based on Full-Text Papers
यह अध्ययन एनएलपी (NLP) पूर्ण-पाठ शोधपत्रों में एल्गोरिदम संस्थाओं के बीच अर्थ संबंधी संबंधों को पहचानने और विश्लेषण करने के लिए एक ढांचा निर्मित करता है, जो यह प्रकट करता है कि SciBERT संबंध निष्कर्षण में उत्कृष्ट है जबकि यह क्षेत्र तुलनात्मक संबंधों के प्रभुत्व वाले विस्तार, गहनता और तेजी से विकसित होते अंतःक्रिया नेटवर्क को प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
विज्ञान की दुनिया की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ हर किताब एक नया विचार है, और इन किताबों के अंदर के "पात्र" एल्गोरिदम हैं—निर्देशों के विशेष सेट जो कंप्यूटर को सोचना, सीखना और समस्याओं को हल करना सिखाते हैं। लंबे समय तक, शोधकर्ता इन एल्गोरिदम पात्रों को पहचानने और यह गिनने में कुशल रहे हैं कि वे कितनी बार दिखाई देते हैं। लेकिन केवल यह जानना कि कमरे में कौन मौजूद है, इससे यह पता नहीं चलता कि वे क्या कर रहे हैं। क्या वे साथ मिलकर काम करने वाले पक्के दोस्त हैं? क्या वे शीर्ष स्थान के लिए लड़ने वाले कट्टर प्रतिद्वंद्वी हैं? या क्या एक एल्गोरिदम दूसरे द्वारा काम पूरा करने के लिए इस्तेमाल किया जाने वाला महज एक उपकरण है? विज्ञान वास्तव में कैसे आगे बढ़ता है, इसे समझने के लिए हमें इन पात्रों के बीच के संबंधों का मानचित्र बनाने की आवश्यकता है, न कि केवल उनके नाम सूचीबद्ध करने की। यह एक हाई स्कूल ड्रामा को केवल बैठने के चार्ट को देखकर समझने की कोशिश करने जैसा है; आपको यह जानने की जरूरत है कि कौन रहस्य फुसफुसा रहा है, कौन एक-दूसरे को द्वंद्व के लिए चुनौती दे रहा है, और कौन काम देखने के लिए पेंसिल उधार ले रहा है ताकि वास्तविक कहानी समझी जा सके।
यह शोध पत्र नेचुरल लैंग्वेज प्रोसेसिंग (NLP) के "ड्रामा" की गहराई में उतरता है, जो एक ऐसा क्षेत्र है जहाँ कंप्यूटर मानव भाषा को समझना सीखते हैं। शोधकर्ताओं ने हजारों शैक्षणिक शोध पत्रों को एक विशाल पटकथा (स्क्रिप्ट) की तरह माना, और हर एल्गोरिदम के उल्लेख को खोजा। केवल उन्हें गिनने के बजाय, उन्होंने एक परिष्कृत प्रणाली बनाई ताकि यह पता लगाया जा सके कि ये एल्गोरिदम पाठ (टेक्स्ट) में एक-दूसरे से वास्तव में कैसे संबंधित हैं। उन्होंने विभिन्न "जासूसी" उपकरणों का परीक्षण किया, जिसमें शक्तिशाली नए एआई (AI) मॉडल शामिल थे, ताकि यह देखा जा सके कि कौन सा मॉडल संदर्भ को बेहतर ढंग से पढ़ सकता है और यह तय कर सकता है कि दो एल्गोरिदम आपस में नोट्स साझा कर रहे हैं, एक परियोजना पर सहयोग कर रहे हैं, या एक दूसरे का "जनक" (parent) है।
अध्ययन में पाया गया कि इस वैज्ञानिक दुनिया में सबसे आम अंतःक्रिया प्रतिस्पर्धा (competition) है। "तुलना" (Compare) का संबंध सुपरस्टार है, जो शोधकर्ताओं द्वारा पाए गए सभी संबंधों में आधे से अधिक बार दिखाई देता है। ऐसा प्रतीत होता है कि वैज्ञानिक अपने नए विचारों को मौजूदा विचारों के विरुद्ध रखकर यह देखना पसंद करते हैं कि कौन बेहतर प्रदर्शन करता है। हालांकि यहाँ कई "उपयोग" (Use) और "सहयोग" (Collaborate) संबंध भी हैं (जहाँ एक एल्गोरिदम दूसरे की मदद करता है), लेकिन यह क्षेत्र बेंचमार्क और आमने-सामने के मुकाबलों के एक उग्र पारिस्थितिकी तंत्र (ecosimystem) द्वारा नियंत्रित है। शोधकर्ताओं ने यह भी पाया कि ये संबंध समय के साथ और अधिक तीव्र होते जा रहे हैं। एल्गोरिदम के नेटवर्क बड़े, अधिक गहराई से जुड़े हुए और पहले से कहीं अधिक तेजी से बदलते जा रहे हैं। ऐसा लग रहा है जैसे वैज्ञानिक समुदाय एक शांत लाइब्रेरी से एक गर्जना करते अखाड़े की ओर बढ़ रहा है जहाँ प्रत्येक नए एल्गोरिदम को पिछले वाले से बेहतर खुद को साबित करना ही होगा।
यह पता लगाने के लिए कि कौन किससे संबंधित है, टीम को बहुत सावधान रहना पड़ा। उन्होंने दशकों तक फैले तीन प्रमुख सम्मेलनों से शोध पत्र एकत्र किए और अपने एआई मॉडलों को पाठ में सूक्ष्म सुरागों को पहचानने के लिए प्रशिक्षित किया। उन्होंने पाया कि जबकि विशाल, पूर्व-प्रशिक्षित एआई मॉडल (जैसे कि चैटबॉट्स को चलाने वाले मॉडल) बिना अधिक प्रशिक्षण के संबंधों का अनुमान लगाने में काफी अच्छे हैं, एक विशेष मॉडल जिसे SciBERT कहा जाता है, सबसे अच्छा जासूस था, जिसने उच्चतम सटीकता प्राप्त की। शोधकर्ताओं ने यह भी नोट किया कि कभी-कभी एआई भ्रमित हो जाता है, विशेष रूपकर जब एक वाक्य में चार या पांच अलग-अलग एल्गोरिदम का उल्लेख होता है, या जब संबंध स्पष्ट रूप से बताया जाने के बजाय निहित (implied) होता है। इन बाधाओं के बावजूद, अध्ययन ने सफलतापूर्वक एक "संबंध नेटवर्क" (relation network) का मानचित्र तैयार किया जो दिखाता है कि एल्गोरिदम कैसे विकसित होते हैं। यह सुझाव देता है कि इस क्षेत्र का भविष्य केवल नए उपकरण बनाने के बारे में नहीं है, बल्कि इस बारे में है कि कैसे वे उपकरण नवाचार के तेजी से बढ़ते चक्र में लगातार एक-दूसरे के विरुद्ध परीक्षण, तुलना और परिष्कृत किए जाते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।