An Agentic Hybrid Top-Down and Bottom-Up Approach to Knowledge Graph Generation
यह शोध पत्र एक एजेंटिक हाइब्रिड पाइपलाइन का प्रस्ताव करता है जो शोर वाले, असंरचित एचआर (HR) डेटा से एक स्केलेबल, स्व-उपचार योग्य बहुभाषी कौशल ज्ञान ग्राफ को स्वायत्त रूप से उत्पन्न करने के लिए विकीडेटा (Wikidata) में टॉप-डाउन ग्राउंडिंग को बॉटम-अप रिफ्लेक्सन (reflexion) के साथ जोड़ता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक पुस्तकालय है जहाँ हर कोई चिल्लाकर बता रहा है कि वह किस काम में कुशल है। कुछ लोग सटीक अंग्रेजी बोलते हैं, कुछ फ्रेंच, जर्मन या स्पेनिश बोलते हैं, और कुछ ऐसी शब्दावली (slang) का उपयोग कर रहे हैं जो अभी तक आविष्कार भी नहीं हुई है। भर्ती (hiring) की दुनिया में, यह पुस्तकालय एक अव्यवस्था है। यदि कोई कंपनी एक "प्रोजेक्ट मैनेजर" (Project Manager) को खोजना चाहती है, तो वह एक शानदार उम्मीदवार को खो सकती है जिसने "वेब प्रोजेक्ट मैनेजमेंट" (Web Project Management) या "Gestion de Projet" लिखा हो, क्योंकि कंप्यूटर को पता नहीं होता कि इन वाक्यांशों का अर्थ एक ही है। यहीं पर नॉलेज ग्राफ्स (Knowledge Graphs) काम आते हैं। नॉलेज ग्राफ को विचारों को जोड़ने वाले एक अत्यंत व्यवस्थित मानचित्र के रूप में सोचें। केवल शब्दों की एक सूची के बजाय, यह एक वेब की तरह है जहाँ "प्रोजेक्ट मैनेजमेंट" एक बड़ा केंद्र (hub) है, और "वेब प्रोजेक्ट मैनेजमेंट" उससे जुड़ी एक छोटी शाखा है। लक्ष्य उस चिल्लाती आवाजों वाले बिखरे हुए पुस्तकालय को एक साफ, सटीक मानचित्र में बदलना है ताकि कंप्यूटर वास्तव में मनुष्यों को सही नौकरियां खोजने में मदद कर सकें।
लेकिन इस मानचित्र को बनाना कठिन है। आप इसे ऊपर से नीचे की ओर (top-down) बनाने की कोशिश कर सकते हैं, जिसमें एक सख्त नियम पुस्तिका (जैसे नौकरियों की सरकारी सूची) का उपयोग किया जाता है, लेकिन इसमें वे सभी नए, अनोखे काम छूट जाते हैं जो अभी तक नियम पुस्तिका में मौजूद नहीं हैं। या, आप इसे नीचे से ऊपर की ओर (bottom-up) बनाने की कोशिश कर सकते हैं, जहाँ कंप्यूटर खुद से चीजों का अनुमान लगाता है और उन्हें समूहों में बांटता है, लेकिन इससे अक्सर एक अराजक स्थिति पैदा होती है जहाँ कंप्यूटर फर्जी नौकरियां बना लेता है या एक ही नौकरी को दस अलग-अलग नामों में विभाजित कर देता है। यह शोध पत्र इस मानचित्र को बनाने के एक चतुर नए तरीके को पेश करता है जो दोनों दुनियाओं के सर्वश्रेष्ठ का मिश्रण है: ज्ञात चीजों के लिए एक सख्त नियम पुस्तिका और नई चीजों के लिए एक स्मार्ट, स्वयं-सुधार करने वाली रोबोट टीम।
शोधकर्ताओं ने, एक यूरोपीय फ्रीलांसर प्लेटफॉर्म 'माल्ट' (Malt) के साथ मिलकर, एक ऐसी प्रणाली बनाई है जो जासूस रोबोटों की एक टीम की तरह काम करती है। वे इसे "एजेंटिक हाइब्रिड" (Agentic Hybrid) दृष्टिकोण कहते हैं। यह इस प्रकार काम करता है: सबसे पहले, सिस्टम एक मानव द्वारा लिखे गए बिखरे हुए कौशल (skill) को लेता है, जैसे कि "gestion de projet web" (वेब प्रोजेक्ट मैनेजमेंट के लिए फ्रेंच), और इसे विकीडेटा (Wikidata) नामक एक विश्वसनीय, पूर्व-मौजूद मानचित्र से मिलाने की कोशिश करता है। विकीडेटा को तथ्यों के "विकिपीडिया" के रूप में समझें जिस पर रोबोट पूरी तरह भरोसा करते हैं। यदि कौशल विकीडेटा में मौजूद किसी चीज़ से मेल खाता है, तो बहुत अच्छा! रोबोट उसे अपनी जगह पर लॉक कर देता है, जिससे यह सुनिश्चित होता है कि यह उन पांच भाषाओं (अंग्रेजी, फ्रेंच, जर्मन, डच और स्पेनिश) में सटीक और सुसंगत है जिनका वे ध्यान रखते हैं।
लेकिन क्या होगा यदि वह कौशल बिल्कुल नया है और विकीडेटा में मौजूद नहीं है? यहीं पर "एजेंटिक" (Agentic) हिस्सा चमकता है। हार मानने या मनगढ़ंत चीजें बनाने के बजाय, सिस्टम एक विशेष "रिफ्लेक्शन" (reflection) लूप का उपयोग करता है। कल्पना कीजिए कि एक रोबोट एक ड्राफ्ट लिखता है, फिर रुकता है और खुद से पूछता है, "रुको, क्या यह सही है? क्या यह अन्य कौशलों के साथ फिट बैठता है?" यदि रोब "प्रोजेक्ट मैनेजमेंट" के मुख्य छत्र के नीचे फिट होने के लिए बहुत विशिष्ट है, तो वह इसे फेंकता नहीं है। इसके बजाय, वह इसके लिए एक नया, विशेष "ऑर्फ़न" (orphan - अनाथ) ब्रांच बनाता है। वह इस नई शाखा को एक विशिष्ट आईडी और एक स्पष्ट नाम देता है, जैसे कि "वेब प्रोजेक्ट मैनेजमेंट", और इसे मुख्य केंद्र से जोड़ देता है। सिस्टम फिर इस प्रक्रिया को बार-बार चलाता है, अपने काम की जांच करता है, डुप्लिकेट्स को मिलाता है, और उस अव्यवस्था को साफ करता है जब तक कि मानचित्र यथासंभव सटीक न हो जाए।
यह शोध पत्र दिखाता है कि यह तरीका वास्तव में बहुत अच्छा काम करता है, लेकिन यह जादू नहीं है—यह कठोर है। उन्होंने वास्तविक फ्रीलांसरों के 36,000 से अधिक कच्चे, बिखरे हुए कौशल विवरणों पर इसका परीक्षण किया। सिस्टम ने उनके एक बड़े हिस्से को व्यवस्थित करने में सफलता प्राप्त की, लेकिन इसने उन चीजों के बारे में भी ईमानदार रहना आवश्यक समझा जिन्हें वह संभाल नहीं सका। कुल प्रयासों में से, लगभग 19% प्रयास कौशल को मानचित्र से मिलाने के "गलत अनुमान" थे क्योंकि इनपुट बहुत भ्रमित करने वाला या अस्पष्ट था। इसके अलावा, सिस्टम ने 13.7% इनपुट को सक्रिय रूप से खारिज कर दिया क्योंकि उसने निर्धारित किया कि वे केवल वैध कौशल नहीं थे (जैसे "NOT_A_SKILL" त्रुटियां) या अर्थ संबंधी शोर (semantic noise) थे। हालाँकि, उस डेटा के लिए जिसे उसने सफलतापूर्वक प्रोसेस किया, परिणाम प्रभावशाली थे: इसने 27,743 इनपुट को साफ और व्यवस्थित किया, उन्हें लगभग 13,300 स्पष्ट, मानक कौशल श्रेणियों में समूहित किया। इसका मतलब है कि इसने वैध डेटा के लिए अराजकता को आधे से अधिक कम कर दिया, हजारों भ्रमित करने वाले विविधताओं को एक व्यवस्थित सूची में बदल दिया। इससे भी बेहतर, सिस्टम पांचों भाषाओं में पूरी तरह से बोलने में सक्षम था, जिससे 66,490 मानकीकृत लेबल बनाए गए ताकि एक फ्रेंच बोलने वाला और एक जर्मन बोलने वाला एक ही नौकरी खोज सके।
शोधकर्ताओं ने पाया कि उनका "हाइब्रिड" दृष्टिकोण केवल एक सख्त नियम पुस्तिका या केवल कंप्यूटर के अनुमान लगाने की तुलना में बहुत बेहतर था। ज्ञात कौशलों को विकीडेटा से जोड़कर, उन्होंने कंप्यूटर द्वारा फर्जी नौकरियां बनाने (जिसे "हैलुसिनेशन" या मतिभ्रम कहा जाता है) की समस्या को टाल दिया। "रिफ्लेक्शन" लूप का उपयोग करके, उन्होंने उन नए उभरते हुए कामों को नहीं छोड़ा जो नियम पुस्तिकाओं ने अभी तक नहीं पकड़े हैं। परिणाम एक जीवित, सांस लेता हुआ कौशल मानचित्र है जो नौकरी के बाजार में बदलाव के साथ खुद को अपडेट कर सकता है, जिससे कंपनियों के लिए सही लोगों को ढूंढना और लोगों के लिए सही काम ढूंढना बहुत आसान हो जाता है। यह एक ऐसे लाइब्रेरियन की तरह है जो न केवल पुस्तकालय की हर किताब को जानता है, बल्कि यह भी तुरंत जानता है कि अभी आई एक बिल्कुल नई किताब को कैसे फाइल करना है, यह सुनिश्चित करते हुए कि चाहे वे किसी भी भाषा में बोलें, हर कोई उसे ढूंढ सके—साथ ही यह भी जानता है कि गलत अनुमान लगाने के बजाय कब कहना है, "मुझे नहीं पता कि यह क्या है।"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।