The Reciprocal Impact of Science and Software: A Cross-Corpus Analysis of How Research Shapes Software and Software Enables Research
यह अध्ययन वैज्ञानिक साहित्य और सॉफ़्टवेयर रिपॉजिटरी को जोड़ने वाला एक बड़े पैमाने का क्रॉस-कॉर्पस ग्राफ़ निर्मित करता है ताकि यह प्रकट किया जा सके कि जबकि विज्ञान और सॉफ़्टवेयर प्रभाव के विशिष्ट, पूरक परतों के माध्यम से सह-विकसित होते हैं, वर्तमान मापन विधियाँ अभी भी विरल और पद्धतिगत विकल्पों के प्रति संवेदनशील बनी हुई हैं, जो उनके पारस्परिक प्रभाव के बारे में निर्णायक निष्कर्ष निकालने से रोकती हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
वैज्ञानिक खोज की दुनिया की कल्पना एक विशाल, हलचल भरे शहर के रूप में करें। लंबे समय से, इस शहर को दो अलग-अलग जिलों में विभाजित किया गया है जो शायद ही कभी एक-दूसरे से बात करते हैं:
- लाइब्रेरी डिस्ट्रिक्ट (पुस्तकालय जिला): यह वह स्थान है जहाँ वैज्ञानिक अपने शोध पत्र (papers) प्रकाशित करते हैं। इसे इस आधार पर मापा जाता है कि कितने लोग किताबें उधार लेते हैं (citations) और लेखकों की प्रसिति कितनी है।
- वर्कशॉप डिस्ट्रिक्ट (कार्यशाला जिला): यह वह स्थान है जहाँ वास्तविक उपकरण, कोड और सॉफ्टवेयर बनाए जाते हैं। इसे इस आधार पर मापा जाता है कि कितने लोग GitHub पर किसी प्रोजेक्ट को "स्टार" देते हैं या उसके कितने 'फोर्क्स' (forks) हैं।
समस्या यह है कि इन दोनों जिलों के पास अलग-अलग नक्शे हैं। एक वैज्ञानिक वर्कशॉप में एक क्रांतिकारी उपकरण बना सकता है, लेकिन लाइब्रेरी को इसके बारे में पता ही नहीं चलता। इसके विपरीत, लाइब्रेरी में मौजूद एक प्रसिद्ध पेपर एक छोटे, अदृश्य उपकरण पर निर्भर हो सकता है जिसे कोई कभी उल्लेखित भी नहीं करता।
यह शोध पत्र, ऑड्रिस मॉकस द्वारा, इन दोनों जिलों के बीच एक पुल बनाने की कोशिश करता है ताकि विज्ञान वास्तव में कैसे काम करता है, इसका एक एकल, एकीकृत नक्शा बनाया जा सके। लेखक इसे "साइंस-सॉफ्टवेयर सप्लाई चेन" कहते हैं।
यहाँ अध्ययन के निष्कर्ष दिए गए हैं, जिन्हें सरल उपमाओं के माध्यम से समझाया गया है:
1. दो-तरफा रास्ता
शोधकर्ताओं ने दो विशाल डेटाबेसों को जोड़ा: एक जिसमें लगभग सारा सार्वजनिक सॉफ्टवेयर कोड था (World of Code) और दूसरा जिसमें वैज्ञानिक शोध पत्र थे (Semantic Scholar/OpenAlex)। उन्होंने दो दिशाओं में कनेक्शन देखे:
दिशा A (विज्ञान सॉफ्टवेयर): कौन से वैज्ञानिक शोध पत्र वास्तव में उन उपकरणों को आकार देते हैं जिनका वैज्ञानिक उपयोग करते हैं?
- आश्चर्य: ये सबसे प्रसिद्ध पेपर नहीं हैं जिनमें सबसे अधिक उद्धरण (citations) होते हैं। इसके बजाय, वे उपकरण सबसे अधिक अपनाए जाते हैं जो वैज्ञानिकों को उनके काम को पैकेज करने और व्यवस्थित करने में मदद करते हैं (जैसे "nf-core" या "Nextflow")।
- उपमा: इसे एक निर्माण स्थल की तरह समझें। सबसे प्रसिद्ध वास्तुकार (अत्यधिक उद्धृत पेपर) शायद एक सुंदर इमारत का डिजाइन बनाता है, लेकिन वे उपकरण जो हर निर्माण दल द्वारा उपयोग किए जाते हैं, वे पाड़ (scaffolding) और क्रेन हैं (पैकेजिंग टूल्स)। पेपर वास्तुकार की प्रसिति को गिनता है, लेकिन सॉफ्टवेयर पाड़ की उपयोगिता को गिनता है।
दिशा B (सॉफ्टवेयर विज्ञान): कौन से सॉफ्टवेयर उपकरण वास्तव में नई वैज्ञानिक खोजों को सक्षम बनाते हैं?
- आश्चर्य: वे उपकरण जो सबसे अधिक विज्ञान को सक्षम करते हैं, अक्सर अदृश्य होते हैं। वे "छिपे हुए बुनियादी ढांचे" जैसे हैं, जैसे PyTorch (AI के लिए) या डेटा विज़ुअलाइज़ेशन टूल्स। इनका शोध पत्रों के शीर्षकों में शायद ही कभी उल्लेख किया जाता है, लेकिन हजारों अन्य प्रोजेक्ट्स इन्हीं पर निर्भर हैं।
- उपमा: एक विशाल शहर की कल्पना करें जहाँ हर कोई सड़कों पर गाड़ी चलाता है। आप कारों के बारे में समाचार रिपोर्टों में सड़कों को नहीं देखते; आप केवल कारों को देखते हैं। लेकिन यदि सड़कें गायब हो गईं, तो कारें रुक जाएंगी। ये सॉफ्टवेयर उपकरण सड़कें हैं। वे आवश्यक हैं, लेकिन क्योंकि वे हर जगह हैं, इसलिए कोई यह लिखने के लिए नहीं रुकता कि "मैंने आज एक सड़क का उपयोग किया।"
2. "स्टार" रेटिंग का जाल
सॉफ्टवेयर की दुनिया में, लोग अक्सर GitHub पर किसी टूल के महत्व को उसके कितने "स्टार्स" (पसंद) हैं, उससे आंकते हैं। अध्ययन में पाया गया कि स्टार्स वास्तविक उपयोग का एक बहुत खराब संकेतक हैं।
- उपमा: एक रेस्टोरेंट की कल्पना करें। एक ऐसी जगह जिसे सोशल मीडिया ऐप पर 500 "लाइक्स" मिलते हैं, वह एक ट्रेंडी जगह हो सकती है जहाँ लोग केवल एक फोटो के लिए जाते हैं। लेकिन केवल 10 लाइक्स वाली जगह वह स्थानीय बेकरी हो सकती है जो हर सुबह 10,000 अन्य रेस्टोरेंट्स को ब्रेड की आपूर्ति करती है।
- निष्कर्ष: अध्ययन में पाया गया कि "स्टार्स" और "डिपेंडेंसीज" (कितने अन्य प्रोजेक्ट वास्तव में उस कोड का उपयोग करते हैं) के बीच बहुत कमजोर संबंध है। 150 स्टार वाला एक टूल 9,000 अन्य प्रोजेक्ट्स द्वारा उपयोग किया जा सकता है, जबकि 50,000 स्टार वाला टूल बहुत कम द्वारा उपयोग किया जा सकता है। लोकप्रियता का अर्थ उपयोगिता नहीं है।
3. "अदृश्य" अंतराल
शोधकर्ताओं ने यह गिनने की कोशिश की कि शोध पत्र कितनी बार सॉफ्टवेयर का उल्लेख करते हैं। उन्होंने एक बड़ा अंतर पाया।
- समस्या: जब वैज्ञानिक शोध पत्र लिखते हैं, तो वे अक्सर सॉफ्टवेयर का उल्लेख टेक्स्ट के बीच में (मेथड्स सेक्शन में) करते हैं, न कि औपचारिक संदर्भ सूची (reference list) में। स्वचालित उपकरण अक्सर इन उल्लेखों को मिस कर देते हैं।
- परिणाम: एक पेपर और उसके द्वारा उपयोग किए जाने वाले सॉफ्टवेयर के बीच का लिंक "विरल (sparse)" और "शोर भरा (noisy)" है। यह केवल पार्टी में बोले गए नामों का उपयोग करके एक वंशावली (family tree) बनाने जैसा है, बजाय वास्तविक जन्म प्रमाण पत्रों को देखने के। चूंकि डेटा इतना अधूरा है, इसलिए शोधकर्ता यह नहीं बता सके कि सॉफ्टवेयर विज्ञान को कितना प्रभावित करता है, इसकी एक सटीक संख्या दे सकें। इसके बजाय, उन्होंने दिखाया कि मापने के अलग-अलग तरीके अलग-अलग उत्तर देते हैं, और हमें केवल एक संख्या पर भरोसा करने में सावधान रहने की आवश्यकता है।
4. नए कर्मचारी: AI एजेंट
अध्ययन ने एक नई घटना को भी देखा: AI कोडिंग एजेंट (रोबोट जो कोड लिखते हैं)।
- निष्कर्ष: ये AI एजेंट वैज्ञानिक सॉफ्टवेयर प्रोजेक्ट्स में दिखाई देने लगे हैं। वे अभी तक मनुष्यों की जगह नहीं ले रहे हैं, लेकिन वे कार्यबल में शामिल हो रहे हैं।
- कौन उपयोग करता है? यह विज्ञान के प्रकार (जैसे जीव विज्ञान बनाम भौतिकी) के बारे में नहीं है। इसके बजाय, AI एजेंट तेजी से चलने वाले, सक्रिय प्रोजेक्ट्स द्वारा उपयोग किए जाते हैं। यदि कोई प्रोजेक्ट नया है और उसके डेवलपर्स तेजी से कोडिंग कर रहे हैं, तो वे AI सहायकों का उपयोग करने की अधिक संभावना रखते हैं। यह एक स्टार्टअप की तरह है जो तेजी से आगे बढ़ रहा है और नए गैजेट्स का उपयोग कर रहा है, बजाय एक धीमी, स्थापित फैक्ट्री के।
मुख्य निष्कर्ष
यह पेपर तर्क देता है कि हमें विज्ञान और सॉफ्टवेयर को अलग-अलग चीजों के रूप में देखना बंद करने की आवश्यकता है।
- पुराना दृष्टिकोण: विज्ञान शोध पत्र है; सॉफ्टवेयर केवल एक उपकरण है।
- नया दृष्टिकोण: विज्ञान एक सप्लाई चेन है। शोध पत्र और सॉफ्टवेयर समान रूप से महत्वपूर्ण वस्तुएं हैं।
वैज्ञानिक प्रगति को वास्तव में समझने के लिए, हम केवल उद्धरणों (citations) या "स्टार्स" को नहीं गिन सकते। हमें डिपेंडेंसीज (dependencies) को देखने की आवश्यकता है—कोड का वह अदृश्य जाल जो सब कुछ थामे हुए है। जिस तरह एक शहर को केवल प्रसिद्ध इमारतों के बजाय अपने पानी के पाइपों और बिजली ग्रिडों के बारे में जानने की आवश्यकता होती है, उसी तरह वैज्ञानिक समुदाय को उस "छिपे हुए नायक" सॉफ्टवेयर को महत्व देने की आवश्यकता है जो खोज को संभव बनाता है, भले ही कोई इसके बारे में शोध पत्र न लिखे।
संक्षेप में: विज्ञान में सबसे महत्वपूर्ण उपकरण वे हैं जिनके बारे में आप कभी सुनते नहीं हैं, और सबसे लोकप्रिय उपकरण वे हैं जिनकी आपको वास्तव में आवश्यकता नहीं होती है। इसे ठीक करने के लिए, हमें एक बेहतर नक्शे की आवश्यकता है जो लाइब्रेरी को वर्कशॉप से जोड़ता हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।