← नवीनतम पेपर
💬 NLP

Building a Custom Taxonomy of AI Skills and Tasks from the Ground Up with Job Postings

यह शोधपत्र TaxonomyBuilder प्रस्तुत करता है, जो एक ऐसा ढांचा है जो यह प्रदर्शित करता है कि LLM-संवर्धित क्लस्टरिंग टूल्स के साथ अनफ़िल्टर्ड कॉर्पोरा का उपयोग करने की तुलना में, प्रोसेसिंग से पहले जॉब पोस्टिंग डेटा को फ़िल्टर करने से अधिक स्पष्ट और डोमेन-विशिष्ट AI स्किल टैक्सोनॉमी प्राप्त होती है।

मूल लेखक: Stephen Meisenbacher, Peter Norlander

प्रकाशित 2026-05-21
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Stephen Meisenbacher, Peter Norlander

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप आर्टिफिशियल इंटेलिजेंस (AI) के बारे में लाखों किताबों वाली एक विशाल, अराजक लाइब्रेरी को व्यवस्थित करने की कोशिश कर रहे हैं। आपका लक्ष्य एक स्पष्ट, आसानी से समझ में आने वाला मानचित्र (एक टैक्सोनॉमी) बनाना है जो लोगों को उनकी ज़रूरत के सटीक AI कौशल और कार्यों को खोजने में मदद करे।

इस शोध पत्र के लेखक, स्टीफन मीसेनबैचर और पीटर नॉरलैंडर ने इस काम को स्वचालित रूप से करने के लिए TAXONOMYBUILDER नामक एक नया टूल बनाया। उन्होंने इसका परीक्षण वास्तविक दुनिया के डेटा के दो विशाल ढेरों का उपयोग करके किया: अमेरिकी श्रम बाजार से प्राप्त लाखों जॉब पोस्टिंग।

यहाँ उनके निष्कर्षों की कहानी है, जिसे सरल शब्दों में समझाया गया है:

समस्या: "अधिक ही बेहतर है" का जाल

आमतौर पर, जब लोग किसी बड़ी अव्यवस्था को व्यवस्थित करने की कोशिश करते हैं, तो उनकी प्रवृत्ति सब कुछ मिश्रण में डाल देने की होती है। वे सोचते हैं, "यदि मैं अधिक जॉब पोस्टिंग शामिल करूँगा, तो मेरा मानचित्र अधिक पूर्ण होगा।" वे अपने डेटा के ढेर को और बड़ा करने के लिए समान वाक्यों को कॉपी-पेस्ट भी कर सकते हैं (एक प्रक्रिया जिसे डेटा ऑग्मेंटेशन कहा जाता है)।

लेखकों ने पूछा: क्या यह वास्तव में सहायक है? या यह केवल लाइब्रेरी को और अधिक अस्त-व्यस्त बना देता है?

प्रयोग: अलग-अलग सामग्रियों के साथ खाना बनाना

उत्तर खोजने के लिए, उन्होंने अपने TAXONOMYBUILDER टूल का उपयोग करके 24 अलग-अलग प्रयोग चलाए। उन्होंने अपने रेसिपी के तीन मुख्य "सामग्रियों" को बदला:

  1. डेटा ऑग्मेंटेशन (और जोड़ना): क्या उन्होंने डेटासेट को बड़ा करने के लिए अतिरिक्त, समान वाक्य जोड़े?
  2. फ़िल्टरिंग (शोर को हटाना): क्या उन्होंने सबसे "कमजोर" या अस्पष्ट जॉब विवरणों को हटा दिया, और केवल सबसे स्पष्ट 25%, 50%, या 75% को ही रखा?
  3. सॉफ्ट क्लस्टरिंग (धुंधला समूहीकरण): क्या उन्होंने "शोर वाले" आइटम्स को, जो पूरी तरह फिट नहीं बैठते थे, सुरक्षा के लिए जबरदस्ती किसी समूह में शामिल किया?

बड़ी हैरानी: कम ही अधिक है

परिणाम विरोधाभासी थे। टीम ने पाया कि अधिक डेटा जोड़ने से मानचित्र वास्तव में खराब हो गया।

  • "ऑग्मेंटेशन" की गलती: जब उन्होंने ढेर को बड़ा करने के लिए अतिरिक्त डेटा जोड़ा, तो परिणामी मानचित्र भ्रमित करने वाला और कम सटीक हो गया। यह एक लाइब्रेरी को व्यवस्थित करने जैसा था जहाँ आपने ऐसी किताबें जोड़ दीं जो मूल कहानी की ही थोड़ी अलग प्रतियां थीं; इसने केवल अव्यवस्था पैदा की।
  • "फ़िल्टरिंग" की जीत: सबसे अच्छे मानचित्र तब बने जब वे कठोर थे। उन्होंने अस्पष्ट, निम्न-गुणवत्ता वाले जॉब विवरणों को हटा दिया (केवल सर्वोत्तम डेटा के शीर्ष 75% या 50% को रखा)। "शोर" को हटाकर, AI स्पष्ट पैटर्न को बहुत बेहतर तरीके से देख सका।
  • "सॉफ्ट क्लस्टरिंग" की बारीकी: जबरदस्ती शोर वाले आइटम्स को समूहों में शामिल करना केवल तभी मददगार रहा जब उन्होंने पहले अतिरिक्त डेटा नहीं जोड़ा था। यदि उन्होंने अतिरिक्त डेटा जोड़ा, तो शोर वाले आइटम्स को जबरदस्ती शामिल करने से चीजें और खराब हो गईं।

उपमा: सोने की खोज का परीक्षण (Gold Panning Test)

कल्पना कीजिए कि आप एक विशाल नदी (जॉब पोस्टिंग) में सोना (AI कौशल) खोजने की कोशिश कर रहे हैं।

  • पुराना तरीका: आप पानी, कीचड़ और पत्थरों की हर बाल्टी उठाते हैं, इस उम्मीद में कि आपको अधिक सोना मिलेगा। अंत में आपके पास कीचड़ का एक बड़ा ढेर होता है जहाँ सोना देखना असंभव होता है।
  • नया तरीका (TAXONOMYBUILDER का निष्कर्ष): आप पहले पानी को ध्यान से छानते हैं। आप कीचड़ वाली, बेकार बाल्टियों को फेंक देते हैं (फ़िल्टरिंग)। आप केवल उन्हीं बाल्टियों को रखते हैं जो आशाजनक दिखती हैं। फिर, आप उन्हें छानते हैं। आपके पास एक छोटा ढेर होता है, लेकिन वह शुद्ध सोना होता है।

निष्कर्ष

यह शोध पत्र निष्कर्ष निकालता है कि जटिल कौशल का मानचित्र बनाने के लिए, मात्रा से अधिक गुणवत्ता महत्वपूर्ण है।

  • कोशिश न करें कि आप जो भी डेटा मिल सकता है उसे शामिल करने की कोशिश करें।
  • चयनशील बनें। कमजोर या शोर वाले सूचनाओं को फ़िल्टर करें।
  • AI को स्पष्ट, उच्च-गुणवत्ता वाले उदाहरणों पर ध्यान केंद्रित करने दें ताकि एक ऐसा मानचित्र बनाया जा सके जो वास्तव में उपयोगी और समझने में आसान हो।

संक्षेप में: यदि आप AI जॉब मार्केट का स्पष्ट मानचित्र चाहते हैं, तो आपको अस्तित्व में मौजूद हर एक जॉब पोस्टिंग को पढ़ने की आवश्यकता नहीं है। आपको बस सबसे अच्छी पोस्टिंग को ध्यान से पढ़ने की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →