← नवीनतम पेपर
🤖 AI

Industry Classification of GitHub Repositories Using the North American Industry Classification System (NAICS)

यह शोध पत्र NAICS-GH प्रस्तुत करता है, जो 6,588 GitHub रिपॉजिटरी का एक उच्च-परिशुद्धता, सार्वजनिक रूप से जारी कॉर्पस है जिसे BAAI/bge-large-en एम्बेडिंग्स और GPT-4.1 को संयोजित करने वाले एक 'रिट्रीव-एंड-वेरिफाई' पाइपलाइन का उपयोग करके NAICS 2022 उद्योग क्षेत्रों के साथ लेबल किया गया है, जो 96.98% मानव-सत्यापित परिशुद्धता प्राप्त करता है और ओपन-सोर्स नवाचार अनुसंधान में उद्योग वर्गीकरण के लिए एक बेंचमार्क के रूप में कार्य करता है।

मूल लेखक: Kevin Xu, Alexander Quispe

प्रकाशित 2026-07-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kevin Xu, Alexander Quispe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

GitHub को एक विशाल, अराजक पुस्तकालय के रूप में कल्पना करें जिसमें करोड़ों पुस्तकें (कोड रिपॉजिटरी) हैं। समस्या यह है कि हालांकि पुस्तकालय को हर पुस्तक का शीर्षक पता है, लेकिन उसके पास कोई "ड्यूई डेसिमल सिस्टम" (Dewey Decimal System) नहीं है जो यह बता सके कि वह पुस्तक वास्तव में किस प्रकार के व्यवसाय या उद्योग के लिए है। क्या यह कोड किसी बैंक के लिए है? किसी खेत के लिए? या किसी वीडियो गेम स्टूडियो के लिए? बिना इस लेबल के, अर्थशास्त्रियों, नीति निर्माताओं या कंपनियों के लिए यह समझना कठिन है कि विभिन्न उद्योग ओपन-सोर्स सॉफ़्टवेयर का उपयोग कैसे कर रहे हैं।

यह शोध पत्र NAICS-GH पेश करता है, जो एक नया सिस्टम है जो इन पुस्तकों को व्यवस्थित करने के लिए एक सुपर-स्मार्ट लाइब्रेरियन की तरह कार्य करता है—जो कि नॉर्थ अमेरिकन इंडस्ट्री क्लासिफिकेशन सिस्टम (NAICS) है, यानी अमेरिका, कनाडा और मैक्सिको में सरकारों द्वारा उपयोग की जाने वाली मानक फाइलिंग प्रणाली।

यहाँ बताया गया है कि उन्होंने इसे कैसे बनाया, सरल शब्दों में:

1. "फिशिंग नेट" (रिट्रीवल/खोज)

सबसे पहले, टीम पूरी लाइब्रेरी की हर एक किताब नहीं पढ़ सकती थी (वहाँ 1.3 मिलियन से अधिक उम्मीदवार हैं)। इसलिए, उन्होंने BGE एम्बेडिंग्स और FAISS नामक एक डिजिटल फिशिंग नेट का उपयोग किया।

  • रूपक (Metaphor): कल्पना करें कि आपके पास 1,000 विशिष्ट कीवर्ड्स की एक सूची है (जैसे "फसल की पैदावार," "बैंकिंग सुरक्षा," या "अस्पताल शेड्यूलिंग")। आप इन कीवर्ड्स को लाइब्रेरी में फेंकते हैं, और नेट तुरंत उन शीर्ष 20 किताबों को पकड़ लेता है जो उस कीवर्ड के सबसे समान सुनाई देती हैं।
  • परिणाम: इस नेट ने लगभग 31,000 संभावित मिलान पकड़े। उन्होंने एक विस्तृत जाल फैलाया ताकि वे कुछ भी मिस न कर दें, लेकिन इसमें कुछ "लगभग सही" (ऐसी किताबें जो सुनने में समान थीं लेकिन पूरी तरह सही नहीं थीं) भी शामिल हो गईं।

2. "विशेषज्ञ निर्णायक" (वेरिफिकेशन/सत्यापन)

नेट बहुत ढीला था, इसलिए उन्हें पकड़े गए मिलानों को सत्यापित करने के लिए एक सख्त निर्णायक की आवश्यकता थी। उन्होंने GPT-4.1 (एक बहुत ही उन्नत AI) को एक डोमेन विशेषज्ञ के रूप में काम पर रखा।

  • रूपक: GPT-4.1 को एक अनुभवी निरीक्षक के रूप में सोचें। नेट ने जिस भी किताब को पकड़ा, निरीक्षक उसका कवर, सारांश और शुरुआती कुछ पन्ने (रिपॉजिटरी का विवरण और README) पढ़ता है।
  • रूब्रिक (नियम पुस्तिका): निरीक्षक केवल अनुमान नहीं लगाता; वह एक सख्त चेकलिस्ट (एक "रूब्रिक") का उपयोग करता है। वह पूछता है: "क्या यह कोड वास्तव में इस विशिष्ट उद्योग के लिए किसी समस्या का समाधान करता है?"
    • यदि उत्तर स्पष्ट "हाँ" है, तो निरीक्षक उसे 9 या 10 का स्कोर देता है।
    • यदि उत्तर "शायद" है, तो स्कोर कम होता है।
    • यदि यह एक सामान्य टूल है जिसका उपयोग हर कोई करता है (जैसे एक बुनियादी कैलकुलेटर), तो इसे कम स्कोर मिलता है।
  • कट-ऑफ: उन्होंने केवल उन्हीं किताबों को रखा जिन्हें 8 या उससे अधिक का स्कोर मिला। इससे यह सुनिश्चित हुआ कि वे केवल उच्च-विश्वास वाले मिलान ही रखें।

3. अंतिम संग्रह (डेटासेट)

AI निर्णायक ने कमजोर मिलानों को फ़िल्टर करने के बाद, उनके पास 6,588 उच्च-गुणवत्ता वाली रिपॉजिटरी बचीं।

  • ये 19 अलग-अलग उद्योगों (जैसे कृषि, विनिर्माण, स्वास्थ्य सेवा और वित्त) में फैली हुई हैं।
  • उन्होंने जानबूझकर एक श्रेणी ("कंपनियों का प्रबंधन") को छोड़ दिया क्योंकि विश्वसनीय समूह बनाने के लिए पर्याप्त स्पष्ट उदाहरण नहीं थे।
  • महत्वपूर्ण: उन्होंने गोपनीयता की रक्षा के लिए मालिकों के नाम हटा दिए, केवल कोड की सामग्री और उद्योग का लेबल रखा।

4. क्या यह काम कर गया? (वैलिडेशन/सत्यापन)

यह सुनिश्चित करने के लिए कि AI निर्णायक भ्रमित (hallucinating) नहीं हो रहा है, टीम ने मानव अनुसंधान सहायकों को यादृच्छिक रूप से (randomly) 2,421 इन लेबल वाली किताबों की जांच करने के लिए काम पर लगाया।

  • परिणाम: मानव निर्णायकों ने AI के साथ 96.98% बार सहमति जताई।
  • बारीकी (Nuance): AI स्पष्ट-कट उद्योगों जैसे "सार्वजनिक प्रशासन" या "कला और मनोरंजन" के लिए लगभग सटीक था। हालाँकि, इसे "विनिर्माण" (Manufacturing) और "थोक व्यापार" (Wholesale Trade) के साथ थोड़ा संघर्ष करना पड़ा, जहाँ सॉफ़्टवेयर कभी-कभी सामान्य लग सकता है। शोध पत्र नोट करता है कि यदि आप स्कोर की आवश्यकता को बढ़ाकर 9 या 10 कर देते हैं, तो उन कठिन उद्योगों में सटीकता और भी बढ़ जाती है।

5. "शिक्षण उपकरण" (बेंचमार्क)

अंत में, टीम ने इस नए, लेबल वाले लाइब्रेरी का उपयोग छह अलग-अलग AI मॉडलों को अपने आप कोड को वर्गीकृत करने के लिए सिखाने के लिए किया।

  • उन्होंने RoBERTa, ModernBERT, और DeBERTa जैसे मॉडलों का परीक्षण किया।
  • विजेता: RoBERTa-large नामक एक मॉडल ने सबसे अच्छा सीखा, जिसने एक ऐसे टेस्ट सेट पर 86.45% सटीकता प्राप्त की जिसे उसने पहले कभी नहीं देखा था।
  • निष्कर्ष: यह साबित करता है कि एक बार आपके पास एक अच्छी "लेबल वाली लाइब्रेरी" हो जाने के बाद, आप भविष्य में वर्गीकरण का काम स्वचालित रूप से करने के लिए छोटे, तेज़ AI मॉडल को प्रशिक्षित कर सकते हैं।

सारांश

यह शोध पत्र एक सार्वजनिक रूप से उपलब्ध डेटासेट प्रस्तुत करता है जो GitHub कोड को वास्तविक दुनिया के उद्योगों से जोड़ता है। इसे इस प्रकार बनाया गया:

  1. संभावित मिलान खोजने के लिए एक विस्तृत जाल फैलाया गया
  2. एक विस्तृत चेकलिस्ट के विरुद्ध उन्हें सत्यापित करने के लिए एक सख्त AI निर्णायक का उपयोग किया गया
  3. 97% सटीकता सुनिश्चित करने के लिए काम को दोबारा जांचने के लिए मनुष्यों का उपयोग किया गया
  4. डेटा और कोड को जारी किया गया ताकि कोई भी अध्ययन कर सके कि विभिन्न उद्योग ओपन-सोर्स सॉफ़्टवेयर का उपयोग कैसे करते हैं।

लेखक स्पष्ट रूप से कहते हैं कि यह एक उत्तरी अमेरिकी वर्गीकरण प्रणाली है जिसे वैश्विक स्तर पर लागू किया गया है, और वे चेतावनी देते हैं कि हालांकि लेबल अत्यधिक सटीक हैं, लेकिन वे हर उद्योग (विशेष रूप से विनिर्माण और थोक व्यापार) के लिए पूर्ण नहीं हैं। वे यह भी नोट करते हैं कि वर्तमान में यह प्रणाली अंग्रेजी-भाषा के कोड विवरणों के साथ सबसे अच्छा काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →