Recipe for Discovery: A Pipeline for Institutional Open Source Activity
यह शोध पत्र एक एंड-टू-एंड फ्रेमवर्क प्रस्तुत करता है जो संस्थागत योगदानों की पहचान करने, ओपन सोर्स प्रथाओं का आकलन करने और अकादमिक सॉफ्टवेयर स्थिरता को मजबूत करने की रणनीतियों के मार्गदर्शन के लिए GitHub के API का उपयोग करके दस विश्वविद्यालयों के 2,00,000 से अधिक ओपन सोर्स रिपॉजिटरीज़ की व्यवस्थित रूप से खोज और विश्लेषण करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
विश्वविद्यालय अनुसंधान की दुनिया की कल्पना एक विशाल, विस्तृत पुस्तकालय के रूप में करें। लेकिन यहाँ अलमारियों पर रखी किताबों के बजाय, इंटरनेट पर बिखरे हुए लाखों डिजिटल "प्रोजेक्ट्स" (सॉफ्टवेयर कोड) हैं, जो मुख्य रूप से GitHub नामक साइट पर मौजूद हैं।
समस्या क्या है? यह पुस्तकालय अविश्वसनीय रूप से अव्यवस्थित है।
- "खोया और पाया गया" (Lost and Found) की समस्या: हजारों प्रोजेक्ट्स छिपे हुए हैं। हो सकता है कि UC Berkeley के एक प्रोफेसर ने एक शानदार टूल बनाया हो, लेकिन उन्होंने इसे स्पष्ट रूप से "UC Berkeley" के नाम से लेबल न किया हो। यह शायद उनके व्यक्तिगत नाम के तहत हो सकता है।
- "फेक न्यूज" की समस्या: यदि आप "UC Berkeley" खोजते हैं, तो आपको 2010 का किसी छात्र का होमवर्क असाइनमेंट, किसी और के कोड की एक प्रति (fork), या एक ऐसा प्रोजेक्ट मिल सकता है जिसमें केवल विश्वविद्यालय का उल्लेख है लेकिन वह वास्तव में उनके द्वारा नहीं बनाया गया है।
- "नो मैनुअल" (No Manual) की समस्या: इनमें से कई प्रोजेक्ट्स बिना ओनर मैनुअल वाली कारों की तरह हैं। उनके पास कोई लाइसेंस (उपयोग करने की कानूनी अनुमति) नहीं है, उन्हें ठीक करने के लिए कोई निर्देश नहीं हैं, और दूसरों के पास मदद करने का कोई तरीका नहीं है। इनके टूटने और हमेशा के लिए गायब होने की संभावना है।
पेपर का समाधान: एक "डिजिटल डिटेक्टिव" पाइपलाइन
लेखकों ने इस अव्यवस्था को साफ करने के लिए एक स्मार्ट, स्वचालित जासूसी प्रणाली (detective system) बनाई है। वे तीन प्रश्नों के उत्तर देना चाहते थे:
- इसका मालिक कौन है? (क्या यह वास्तव में एक विश्वविद्यालय का प्रोजेक्ट है?)
- यह क्या है? (क्या यह एक टूल है, क्लास असाइनमेंट है, या एक वेबसाइट है?)
- क्या यह स्वस्थ है? (क्या इसके पास लाइसेंस है? क्या इसका उपयोग किया जा रहा है?)
यहाँ बताया गया है कि उनका "डिटेक्टिव" कैसे काम करता है, चरण-दर-चरण:
1. "चौड़ा जाल" (खोज/Discovery)
कल्पना कीजिए कि आप समुद्र में एक विशाल मछली पकड़ने वाला जाल फेंक रहे हैं ताकि हर उस मछली को पकड़ा जा सके जो शायद सैल्मन (salmon) हो सकती है।
- सिस्टम "UC Berkeley," "UC Davis," और उनके ईमेल डोमेन जैसे कीवर्ड्स का उपयोग करके GitHub को खोजता है।
- यह प्रोजेक्ट का नाम, विवरण, कोड और यहाँ तक कि कोड लिखने वाले लोगों की प्रोफाइल को भी देखता है।
- परिणाम: उन्होंने एक बहुत ही चौड़ा जाल फेंका और 236,000 संभावित प्रोजेक्ट्स पकड़े। लेकिन जैसा कि लेखक कहते हैं, इस जाल ने बहुत सारा "कचरा" (गलत सकारात्मक परिणाम/false positives) भी पकड़ा।
2. "स्मार्ट फिल्टर" (AI डिटेक्टिव)
अब, एक सुपर-स्मार्ट लाइब्रेरियन (AI) की कल्पना करें जो यह तय करने के लिए उन सभी 236,000 वस्तुओं को पढ़ता है कि असली क्या है।
- पुराना तरीका: आप एक साधारण चेकलिस्ट का उपयोग कर सकते हैं (जैसे, "क्या शीर्षक में 'University' लिखा है?")। यह विफल हो जाता है क्योंकि यह सूक्ष्म सुरागों को छोड़ देता है।
- नया तरीका: लेखकों ने एक लार्ज लैंग्वेज मॉडल (LLM) का उपयोग किया—जो मूल रूप से एक बहुत ही उन्नत AI है जो संदर्भ (context) को समझता है।
- परीक्षण: उन्होंने AI को एक "वास्तविक" विश्वविद्यालय प्रोजेक्ट की परिभाषा दी (जैसे, "क्या यह किसी लैब द्वारा बनाया गया है? क्या प्रोफेसर का ईमेल सूचीबद्ध है?")। AI ने फिर प्रोजेक्ट के विवरण को पढ़ा और उसे एक "कॉन्फिडेंस स्कोर" दिया।
- परिणाम: AI अविश्वसनीय रूप से सटीक था (90% से अधिक)। इसने शोर को छाँट दिया और 81,640 ऐसे प्रोजेक्ट्स की पहचान की जो वास्तव में कैलिफोर्निया विश्वविद्यालय प्रणाली से जुड़े थे।
3. "सॉर्टर" (वर्गीकरण/Categorization)
एक बार वास्तविक प्रोजेक्ट मिल जाने के बाद, AI ने उन्हें एक मेलरूम की तरह अलग-अलग डिब्बों में छाँट दिया:
- DEV (डेवलपमेंट): उपकरण और सॉफ्टवेयर जिन्हें दूसरों द्वारा उपयोग करने के लिए बनाया गया है (जैसे प्रसिद्ध Jupyter Notebook)।
- EDU (शिक्षा): क्लास असाइनमेंट, होमवर्क और कोर्स सामग्री।
- WEB: वेबसाइटें।
- DATA: डेटा के संग्रह।
- OTHER: रैंडम प्रयोग।
बड़ी हैरानी: उन्होंने पाया कि शिक्षा (EDU) और डेवलपमेंट (DEV) दो सबसे बड़े वर्ग थे, जो कुल मिलाकर लगभग 85% हिस्सा बनाते हैं। इसका मतलब है कि विश्वविद्यालय GitHub का उपयोग कक्षा और नए टूल्स बनाने वाली फैक्ट्री, दोनों के रूप में कर रहे हैं।
4. "हेल्थ चेक" (अंतर्दृष्टि/Insights)
अंत में, टीम ने इन प्रोजेक्ट्स के "स्वास्थ्य" की जाँच की। उन्होंने "कम्युनिटी स्टैंडर्ड्स" की तलाश की—जो कि एक यूजर मैनुअल, सुरक्षा गाइड और कानूनी अनुबंध का डिजिटल समकक्ष है।
- अच्छी खबर: अधिकांश प्रोजेक्ट्स के पास एक "README" (एक बुनियादी निर्देश पत्र) होता है।
- बुरी खबर: 70% से अधिक प्रोजेक्ट्स के पास कोई लाइसेंस नहीं है। यह एक घर बनाने लेकिन उस पर स्वामित्व का दस्तावेज़ (deed) न लगाने जैसा है। कोई नहीं जानता कि क्या उन्हें वहां रहने या छत ठीक करने की अनुमति है।
- "लोकप्रियता" का सुराग: उन्होंने पाया कि एक प्रोजेक्ट जितना अधिक लोकप्रिय होता है (सितारों या लाइक्स द्वारा मापा जाता है), उसके पास लाइसेंस और मैनुअल होने की संभावना उतनी ही अधिक होती है। लेकिन लोकप्रिय वाले भी अक्सर सुरक्षा गाइड (जैसे अन्य योगदानकर्ताओं के साथ कैसा व्यवहार करें, इसके लिए "कोड ऑफ कंडक्ट") की कमी रखते हैं।
यह क्यों मायने रखता है?
ओपन-सोर्स सॉफ्टवेयर को एक सामुदायिक उद्यान (community garden) के रूप में सोचें।
- अभी, कई विश्वविद्यालय बीज (कोड) तो बो रहे हैं लेकिन उन्हें बिना चिह्नित किए और बिना पानी दिए छोड़ रहे हैं।
- यह पेपर उस उद्यान का एक मानचित्र (map) प्रदान करता है।
- अब, विश्वविद्यालय के नेता स्पष्ट रूप से देख सकते हैं कि कौन से पौधे मर रहे हैं (कोई लाइसेंस नहीं), कौन से केवल खरपतवार हैं (वास्तव में विश्वविद्यालय के प्रोजेक्ट नहीं हैं), और कौन से फल-फूल रहे हैं।
निष्कर्ष:
लेखकों ने केवल पौधों को नहीं गिना; उन्होंने एक ऐसा टूल बनाया जिसे कोई भी विश्वविद्यालय अपने स्वयं के उद्यान को खोजने के लिए उपयोग कर सकता है। इस "पाइपलाइन" का उपयोग करके, विश्वविद्यालय अनुमान लगाना बंद कर सकते हैं और मदद करना शुरू कर सकते हैं। वे बिना लाइसेंस वाले प्रोजेक्ट्स को लाइसेंस दे सकते हैं, भ्रमित करने वाले प्रोजेक्ट्स के लिए मैनुअल लिख सकते हैं, और यह सुनिश्चित कर सकते हैं कि छात्रों और प्रोफेसरों द्वारा बनाया गया शानदार सॉफ्टवेयर डिजिटल झाड़ियों में खो न जाए।
संक्षेप में: उन्होंने एक रोबोट लाइब्रेरियन बनाया जिसने एक अव्यवस्थित पुस्तकालय में छिपे हुए रत्नों को खोजा, उन्हें छाँटा, और विश्वविद्यालय को बताया, "हे, आपके पास 80,000 बेहतरीन प्रोजेक्ट्स हैं, लेकिन आपको कुछ और निर्देश मैनुअल लिखने की आवश्यकता है!"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।