← नवीनतम पेपर
💬 NLP

Breaking the HISCO Barrier: Automatic Occupational Standardization with OccCANINE

यह शोध पत्र OccCANINE को प्रस्तुत करता है, जो 15.8 मिलियन बहुभाषी डेटा युग्मों (data pairs) पर फाइन-ट्यून किया गया एक ओपन-सोर्स टूल है जो 96% सटीकता के साथ व्यावसायिक विवरणों को HISCO और अन्य वर्गीकरण प्रणालियों में मैप करने की प्रक्रिया को स्वचालित करता है, जिससे धीमी मैनुअल कोडिंग का स्थान मिलता है और आर्थिक अनुसंधान के लिए उच्च-गुणवत्ता वाले व्यावसायिक डेटा तक पहुंच का लोकतंत्रीकरण होता है।

मूल लेखक: Christian Møller Dahl, Torben Johansen, Christian Vedel

प्रकाशित 2026-02-26
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Christian Møller Dahl, Torben Johansen, Christian Vedel

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक इतिहासकार हैं जो 200 साल पहले के लोगों के जीवन को समझने की कोशिश कर रहे हैं। आपके पास लाखों पुराने दस्तावेज़ हैं—जनगणना रिकॉर्ड, विवाह प्रमाण पत्र, जहाज के लॉग—जो हस्तलिखित नोट्स से भरे हुए हैं कि लोगों ने जीविका के लिए क्या किया था। एक कहता है "मछली पकड़ना और खेती का काम," दूसरा कहता है "सेवक," और तीसरा कहता है "बुनकर।"

इस डेटा का अध्ययन करने के लिए, आपको इन अव्यवस्थित, हस्तलिखित विवरणों को साफ, मानकीकृत श्रेणियों (जैसे "किसान" या "मछुआरा") में बदलना होगा ताकि एक कंप्यूटर उन्हें गिन सके और उनका विश्लेषण कर सके। इस प्रक्रिया को व्यावसायिक कोडिंग (occupational coding) कहा जाता है।

समस्या: "HISCO बाधा"

द दशकों से, शोधकर्ता कोडिंग करने के लिए HISCO नामक एक मानक प्रणाली का उपयोग करते आए हैं। लेकिन इसमें एक बहुत बड़ी समस्या है: यह अविश्वसनीय रूप से धीमा और उबाऊ है।

कल्पना कीजिए कि आपके पास 10,000 जॉब विवरणों का एक ढेर है। यदि आप एक सुपर-फास्ट मानव कोडर हैं, तो एक विवरण को पढ़ने और सही कोड टाइप करने में आपको 10 सेकंड लगते हैं। यह केवल एक छोटे से नमूने के लिए 28 घंटे का निरंतर काम है। यदि आपके पास दस लाख रिकॉर्ड हों, तो आपको वर्षों तक काम करने वाली लोगों की एक टीम की आवश्यकता होगी। इसके अलावा, इंसान थक जाते हैं, गलतियाँ करते हैं, या चीजों की अलग-अलग व्याख्या करते हैं। एक व्यक्ति "सेवक" को "घरेलू कार्यकर्ता" मान सकता है, जबकि दूसरा उसे "अकुशल श्रम" मान सकता है। यह विसंगति एक "बाधा" पैदा करती है जो अनुसंधान को होने से रोकती है।

समाधान: OccCANINE (द "स्मार्ट ट्रांसलेटर")

इस शोध पत्र के लेखकों ने इस बाधा को तोड़ने के लिए OccCANINE नामक एक टूल बनाया है। OccCANINE को एक सुपर-स्मार्ट, अथक अनुवादक के रूप में सोचें जिसने लाखों जॉब विवरण पढ़े हैं और जानता है कि उन्हें कैसे वर्गीकृत किया जाए।

यह इस प्रकार काम करता है, एक सरल उपमा का उपयोग करते हुए:

1. "मस्तिष्क" (द मॉडल)

एक ऐसे छात्र की कल्पना करें जिसने अपना पूरा जीवन 15.8 मिलियन उदाहरणों को पढ़ने में बिताया है, जहाँ जॉब विवरण को उनके सही कोड के साथ जोड़ा गया है। उसने 13 अलग-अलग भाषाओं (अंग्रेजी, डेनिश, जर्मन, स्वीडिश, आदि) में रिकॉर्ड पढ़े हैं।

  • पुराना तरीका: एक कंप्यूटर प्रोग्राम शब्दों को मिलाने के लिए "ढूंढो और बदलो" (find and replace) नियम का उपयोग करता है (जैसे, यदि वह "farm" देखता है, तो वह अनुमान लगाता है कि यह "Farmer" है)। यह विफल हो जाता है यदि शब्द गलत तरीके से लिखा हो ("frm") या यदि विवरण जटिल हो ("मछली पकड़ना और खेती करना")।
  • OccCANINE का तरीका: यह मॉडल शब्दों को नहीं, बल्कि अर्थ को समझता है। यह जानता है कि "वह मछली पकड़ता है और अपने खेत की देखभाल करता है" वास्तव में दो काम हैं: मछुआरा और किसान। यह स्पेलिंग की गलतियों, पुराने जमाने की वर्तनी और अव्यवस्थित लिखावट को संभाल सकता है क्योंकि यह काम के अक्षरों को नहीं, बल्कि उसके अवधारणा (concept) को समझता है।

2. संचालन के दो "मोड"

यह टूल काम करने के दो तरीके प्रदान करता है, जैसे कि दो अलग-अलग प्रकार के सहायक:

  • "फास्ट" मोड (फ्लैट डिकोडर): यह एक तेज गति से पढ़ने वाले की तरह है। यह टेक्स्ट को स्कैन करता है और तुरंत संभावित कोडों की एक सूची निकाल देता है। यह अविश्वसनीय रूप से तेज़ है (हजारों रिकॉर्ड के लिए मिनटों में) लेकिन इसके लिए आपको एक "कॉन्फिडेंस फ़िल्टर" सेट करने की आवश्यकता होती है (जैसे, "केवल वे उत्तर स्वीकार करें जिनके बारे में मैं 90% सुनिश्चित हूँ")।
  • "गुड" मोड (सीक्वेंशियल डिकोडर): यह एक सावधान जासूस की तरह है। यह एक समय में एक अंक बनाता है (जैसे, "6... 1... 1... 1... 0")। यह थोड़ा धीमा है लेकिन अधिक मजबूत है, विशेष रूप से जटिल विवरणों के लिए जहाँ एक व्यक्ति के पास कई नौकरियां हो सकती हैं। इसे फ़िल्टर सेट करने की आवश्यकता नहीं है; यह बस सबसे अच्छा उत्तर देता है।

3. "जादुई" परिणाम

परिणाम आश्चर्यजनक हैं:

  • गति: जिस काम में मानव श्रम के हफ्तों लगते थे, अब उसमें मिनटों का समय लगता है।
  • सटीकता: यह 96% बार सही उत्तर देता है। यह एक मानव विशेषज्ञ के बराबर है, या उससे भी बेहतर है।
  • बहुमुखी प्रतिभा: यह केवल HISCO के लिए ही नहीं है। लेखकों ने दिखाया है कि इसे बहुत कम अतिरिक्त काम के साथ अन्य ऐतिहासिक कोडिंग प्रणालियों (जैसे अमेरिकी या ब्रिटिश जनगणना कोड) पर काम करने के लिए आसानी से पुन: प्रशिक्षित किया जा सकता है।

यह सब कुछ कैसे बदल देता है

सोचिए कि OccCANINE एक चाबी की तरह है जो एक विशाल पुस्तकालय को खोल देती है।
पहले, शोधकर्ता केवल कुछ किताबें ही पढ़ सकते थे क्योंकि शीर्षकों का अनुवाद करने में बहुत समय लगता था। अब, वे एक दिन में पूरा पुस्तकालय पढ़ सकते हैं।

  • लोकतांत्रीकरण: अब आपको महंगे शोध सहायकों की टीम की आवश्यकता नहीं है। एक अकेला शोधकर्ता अपने लैपटॉप के साथ विशाल डेटासेट को प्रोसेस कर सकता है।
  • नई खोजें: चूंकि डेटा अब विश्लेषण करना आसान है, इसलिए इतिहासकार नए प्रश्न पूछ सकते हैं। वे ट्रैक कर सकते हैं कि 200 वर्षों में महिलाओं की नौकरियों में कैसे बदलाव आया, औद्योगिक क्रांति ने कार्यबल को कैसे बदला, या भूगोल ने करियर को कैसे प्रभावित किया, और यह सब उच्च-गुणवत्ता वाले डेटा के साथ संभव है।
  • विश्वसनीयता: चूंकि कंप्यूटर सुसंगत है, इसलिए प्रत्येक शोधकर्ता को समान डेटा के लिए समान परिणाम मिलते हैं। अब कोई "मानवीय त्रुटि" या "व्याख्या का पूर्वाग्रह" नहीं है।

निचोड़

OccCANINE एक ऐसा उपकरण है जो लाखों पुराने जॉब विवरणों को मैन्युअल रूप से छाँटने के असंभव कार्य को एक सरल, स्वचालित प्रक्रिया में बदल देता है। यह मानव श्रम की "अवरोध" को एक स्मार्ट, तेज़ और सटीक AI से बदल देता है, जिससे इतिहासकार अंततः यह देख पाते हैं कि लोग इतिहास में कैसे काम करते थे।

यह केवल एक टूल नहीं है; यह एक टाइम मशीन है जो हमें अतीत को उतनी ही तेज़ी से प्रोसेस करने की अनुमति देती है जितनी तेज़ी से हम भविष्य की कल्पना कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →