A Unified Structured Query Understanding Framework for Industrial Semantic Search
यह शोध पत्र औद्योगिक सिमेंटिक सर्च के लिए एक एकीकृत स्मॉल लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो खंडित क्वेरी समझ कार्यों को एक एकल स्कीमा-प्रतिबंधित जनरेशन सिस्टम में समेकित करता है, जिसे डेटा एनोटेशन और मूल्यांकन के लिए एक "क्वेरी इल्यूमिनेटर" द्वारा समर्थित किया गया है, जिसने सख्त लेटेंसी बाधाओं को पूरा करते हुए लिंक्डइन के जॉब और पीपल सर्च सिस्टम में उपयोगकर्ता जुड़ाव में सुधार किया और लागत को कम किया।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरी लाइब्रेरी (लिंक्डइन का जॉब सर्च सिस्टम) चला रहे हैं जहाँ हर दिन लाखों लोग किताबें (नौकरियाँ) माँगने आते हैं।
पुराने तरीके में, लाइब्रेरी में विशेषज्ञों की एक खंडित टीम (fragmented team) एक कतार में खड़ी थी।
- एक व्यक्ति यह अनुमान लगाने की कोशिश करता था कि आप क्या चाहते हैं (इरादा/Intent)।
- दूसरा व्यक्ति विशिष्ट लेखक या शैली खोजने की कोशिश करता था (टैगिंग/Tagging)।
- तीसरा व्यक्ति आपके बिखरे हुए वाक्य को एक स्पष्ट अनुरोध में फिर से लिखने की कोशिश करता था (रीराइटिंग/Rewriting)।
- चौथा व्यक्ति यह जाँचता था कि कहीं आप कुछ खतरनाक तो नहीं माँग रहे (सुरक्षा/Safety)।
समस्या: यह असेंबली लाइन धीमी थी, इसे बनाए रखना महंगा था, और इसमें गलतियों की संभावना अधिक थी। यदि पहला व्यक्ति आपको गलत समझ लेता, तो दूसरा व्यक्ति भ्रमित हो जाता, और तीसरा व्यक्ति अनुरोध को गलत तरीके से लिख देता। यह "टेलीफोन गेम" की तरह था जहाँ संदेश अंत तक पहुँचते-पहुँचते बिगड़ जाता था। साथ भी, यदि कोई अजीब, लंबा या जटिल प्रश्न पूछता (जैसे "मुझे एक रिमोट डेटा एंट्री जॉब चाहिए जो $50k से अधिक भुगतान करे लेकिन केवल अमेरिका में हो"), तो यह टीम बिखर जाती थी।
नया समाधान: "सुपर लाइब्रेरियन" (The Super Librarian)
इस पेपर के लेखकों ने एक एकीकृत संरचित क्वेरी समझ ढांचा (Unified Structured Query Understanding Framework) बनाया है। विशेषज्ञों की एक टीम के बजाय, उन्होंने एक अत्यधिक प्रशिक्षित "सुपर लाइब्रेरियन" (एक छोटा भाषा मॉडल, या SLM) नियुक्त किया जो सब कुछ एक साथ करता है।
यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:
1. एक ही बार में निर्णय (The "All-in-One" Menu)
आपकी रिक्वेस्ट को एक लाइन में भेजने के बजाय, आप अपनी रिक्वेस्ट सुपर लाइब्रेरियन को सौंप देते हैं। एक ही नज़र में, यह लाइब्रेरियन:
- तय करता है कि आप क्या ढूँढ रहे हैं (राउटर/Router)।
- विशिष्ट टैग्स निकालता है (जैसे, "रिमोट," "सीनियर," "डेटा साइंटिस्ट")।
- यदि आवश्यक हो, तो आपके बिखरे हुए वाक्य को एक स्पष्ट, पेशेवर अनुरोध में फिर से लिखता है।
- जाँचता है कि क्या आप नियमों के विरुद्ध कुछ माँग रहे हैं (ट्रस्ट/सुरक्षा/Trust/Safety)।
जादुई ट्रिक: लाइब्रेरियन केवल अनुमान नहीं लगाता; वह एक सख्ती से निर्धारित प्रारूप वाली चेकलिस्ट (स्कीमा-कन्स्ट्रेंड जनरेशन/Schema-Constrained Generation) भरता है। वह उपन्यास नहीं लिख सकता; उसे एक फॉर्म पर विशिष्ट बॉक्स भरने होते हैं। यह सुनिश्चित करता है कि डाउनस्ट्रीम में मौजूद कंप्यूटर सिस्टम बिना किसी उलझन के आपकी रिक्वेस्ट को पूरी तरह समझ सके।
2. "क्वेरी इल्यूमिनेटर" (शिक्षक और न्यायाधीश)
एक ही लाइब्रेरियन को सब कुछ करने के लिए प्रशिक्षित करना कठिन है क्योंकि आपको "परफेक्ट" जवाबों के हजारों उदाहरणों की आवश्यकता होती है, और मनुष्य उन्हें लिखने के लिए बहुत धीमे हैं।
इसे हल करने के लिए, टीम ने एक "क्वेरी इल्यूमिनेटर" बनाया। इसे एक "मास्टर लाइब्रेरियन" (एक बहुत बड़ा, अधिक स्मार्ट AI) के रूप में समझें जो बैक ऑफिस में काम करता है।
- एक शिक्षक के रूप में: मास्टर लाइब्रेरियन हजारों बिखरे हुए यूजर रिक्वेस्ट को पढ़ता है और उनके "परफेक्ट" चेकलिस्ट उत्तर लिखता है। फिर वह छोटे सुपर लाइब्रेरियन को भी वैसा ही करने के लिए सिखाता है (इसे डिस्टिलेशन/Distillation कहा जाता है)।
- एक न्यायाधीश के रूप में: जब सुपर लाइब्रेरियन कोई गलती करता है, तो मास्टर लाइब्रेरियन एक सरोगेट जज के रूप में कार्य करता है। वह नियमों के विरुद्ध (जैसे "क्या आपने ऐसी नौकरी का भ्रम पैदा किया जो अस्तित्व में ही नहीं है?") सुपर लाइब्रेरियन के काम की ग्रेडिंग करता है, बिना हर बार किसी इंसान द्वारा जाँच किए जाने के इंतज़ार के।
3. परिणाम: तेज़, स्मार्ट और सुरक्षित
टीम ने लिंक्डइन के वास्तविक जॉब सर्च इंजन में इस नए सिस्टम का परीक्षण किया।
- कम टूटी हुई रिक्वेस्ट: क्योंकि सुपर लाइब्रेरियन पूरी प्रक्रिया को एक साथ संभालता है, इसलिए कम रिक्वेस्ट ड्रॉप होती हैं या गलत समझी जाती हैं। पेपर में टूटी हुई रिक्वेस्ट में 17% की गिरावट दर्ज की गई है।
- खुशहाल उपयोगकर्ता: अधिक लोगों को वे नौकरियाँ मिलीं जो उन्हें पसंद थीं और उन्होंने उन पर आवेदन किया।
- गति: भले ही लाइब्रेरियन अधिक काम कर रहा है, फिर भी सिस्टम इतना तेज़ है कि वह प्रति सेकंड लाखों रिक्वेस्ट को बिना उपयोगकर्ताओं को इंतज़ार कराए संभाल सकता है।
- बहुमुखी प्रतिभा: उन्होंने साबित किया कि यह अन्य चीजों के लिए भी काम करता है, जैसे लोगों को खोजना (न कि केवल नौकरियों को), जिससे पता चलता है कि "सुपर लाइब्रेरियन" को न्यूनतम प्रयास के साथ अलग-अलग प्रकार की लाइब्रेरी के लिए फिर से प्रशिक्षित किया जा सकता है।
सारांश
यह पेपर छोटे उपकरणों की एक धीमी, त्रुटिपूर्ण असेंबली लाइन को एक स्मार्ट, कुशल रोबोट से बदलने का वर्णन करता है जो जटिल मानवीय भाषा को समझता है, सख्त नियमों का पालन करता है, और एक "मास्टर टीचर" AI से सीखता है। यह खोज के अनुभव को सभी के लिए सहज, तेज़ और अधिक विश्वसनीय बनाता है जो नौकरी की तलाश में हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।