← नवीनतम पेपर
🤖 machine learning

A Unified Structured Query Understanding Framework for Industrial Semantic Search

यह शोध पत्र औद्योगिक सिमेंटिक सर्च के लिए एक एकीकृत स्मॉल लैंग्वेज मॉडल फ्रेमवर्क प्रस्तुत करता है जो खंडित क्वेरी समझ कार्यों को एक एकल स्कीमा-प्रतिबंधित जनरेशन सिस्टम में समेकित करता है, जिसे डेटा एनोटेशन और मूल्यांकन के लिए एक "क्वेरी इल्यूमिनेटर" द्वारा समर्थित किया गया है, जिसने सख्त लेटेंसी बाधाओं को पूरा करते हुए लिंक्डइन के जॉब और पीपल सर्च सिस्टम में उपयोगकर्ता जुड़ाव में सुधार किया और लागत को कम किया।

मूल लेखक: Ping Liu, Qianqi Shen, Jianqiang Shen, Chunnan Yao, Kevin Kao, Rajat Arora, Dan Xu, Baofen Zheng, Yunxiang Ren, Benjamin Le, Ali Hooshmand, Igor Lapchuk, Juan Bottaro, Raghavan Muthuregunathan, Caleb
प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ping Liu, Qianqi Shen, Jianqiang Shen, Chunnan Yao, Kevin Kao, Rajat Arora, Dan Xu, Baofen Zheng, Yunxiang Ren, Benjamin Le, Ali Hooshmand, Igor Lapchuk, Juan Bottaro, Raghavan Muthuregunathan, Caleb Johnson, Liangjie Hong, Jingwei Wu, Wenjing Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हलचल भरी लाइब्रेरी (लिंक्डइन का जॉब सर्च सिस्टम) चला रहे हैं जहाँ हर दिन लाखों लोग किताबें (नौकरियाँ) माँगने आते हैं।

पुराने तरीके में, लाइब्रेरी में विशेषज्ञों की एक खंडित टीम (fragmented team) एक कतार में खड़ी थी।

  1. एक व्यक्ति यह अनुमान लगाने की कोशिश करता था कि आप क्या चाहते हैं (इरादा/Intent)।
  2. दूसरा व्यक्ति विशिष्ट लेखक या शैली खोजने की कोशिश करता था (टैगिंग/Tagging)।
  3. तीसरा व्यक्ति आपके बिखरे हुए वाक्य को एक स्पष्ट अनुरोध में फिर से लिखने की कोशिश करता था (रीराइटिंग/Rewriting)।
  4. चौथा व्यक्ति यह जाँचता था कि कहीं आप कुछ खतरनाक तो नहीं माँग रहे (सुरक्षा/Safety)।

समस्या: यह असेंबली लाइन धीमी थी, इसे बनाए रखना महंगा था, और इसमें गलतियों की संभावना अधिक थी। यदि पहला व्यक्ति आपको गलत समझ लेता, तो दूसरा व्यक्ति भ्रमित हो जाता, और तीसरा व्यक्ति अनुरोध को गलत तरीके से लिख देता। यह "टेलीफोन गेम" की तरह था जहाँ संदेश अंत तक पहुँचते-पहुँचते बिगड़ जाता था। साथ भी, यदि कोई अजीब, लंबा या जटिल प्रश्न पूछता (जैसे "मुझे एक रिमोट डेटा एंट्री जॉब चाहिए जो $50k से अधिक भुगतान करे लेकिन केवल अमेरिका में हो"), तो यह टीम बिखर जाती थी।

नया समाधान: "सुपर लाइब्रेरियन" (The Super Librarian)

इस पेपर के लेखकों ने एक एकीकृत संरचित क्वेरी समझ ढांचा (Unified Structured Query Understanding Framework) बनाया है। विशेषज्ञों की एक टीम के बजाय, उन्होंने एक अत्यधिक प्रशिक्षित "सुपर लाइब्रेरियन" (एक छोटा भाषा मॉडल, या SLM) नियुक्त किया जो सब कुछ एक साथ करता है।

यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए यहाँ दिया गया है:

1. एक ही बार में निर्णय (The "All-in-One" Menu)

आपकी रिक्वेस्ट को एक लाइन में भेजने के बजाय, आप अपनी रिक्वेस्ट सुपर लाइब्रेरियन को सौंप देते हैं। एक ही नज़र में, यह लाइब्रेरियन:

  • तय करता है कि आप क्या ढूँढ रहे हैं (राउटर/Router)।
  • विशिष्ट टैग्स निकालता है (जैसे, "रिमोट," "सीनियर," "डेटा साइंटिस्ट")।
  • यदि आवश्यक हो, तो आपके बिखरे हुए वाक्य को एक स्पष्ट, पेशेवर अनुरोध में फिर से लिखता है।
  • जाँचता है कि क्या आप नियमों के विरुद्ध कुछ माँग रहे हैं (ट्रस्ट/सुरक्षा/Trust/Safety)।

जादुई ट्रिक: लाइब्रेरियन केवल अनुमान नहीं लगाता; वह एक सख्ती से निर्धारित प्रारूप वाली चेकलिस्ट (स्कीमा-कन्स्ट्रेंड जनरेशन/Schema-Constrained Generation) भरता है। वह उपन्यास नहीं लिख सकता; उसे एक फॉर्म पर विशिष्ट बॉक्स भरने होते हैं। यह सुनिश्चित करता है कि डाउनस्ट्रीम में मौजूद कंप्यूटर सिस्टम बिना किसी उलझन के आपकी रिक्वेस्ट को पूरी तरह समझ सके।

2. "क्वेरी इल्यूमिनेटर" (शिक्षक और न्यायाधीश)

एक ही लाइब्रेरियन को सब कुछ करने के लिए प्रशिक्षित करना कठिन है क्योंकि आपको "परफेक्ट" जवाबों के हजारों उदाहरणों की आवश्यकता होती है, और मनुष्य उन्हें लिखने के लिए बहुत धीमे हैं।

इसे हल करने के लिए, टीम ने एक "क्वेरी इल्यूमिनेटर" बनाया। इसे एक "मास्टर लाइब्रेरियन" (एक बहुत बड़ा, अधिक स्मार्ट AI) के रूप में समझें जो बैक ऑफिस में काम करता है।

  • एक शिक्षक के रूप में: मास्टर लाइब्रेरियन हजारों बिखरे हुए यूजर रिक्वेस्ट को पढ़ता है और उनके "परफेक्ट" चेकलिस्ट उत्तर लिखता है। फिर वह छोटे सुपर लाइब्रेरियन को भी वैसा ही करने के लिए सिखाता है (इसे डिस्टिलेशन/Distillation कहा जाता है)।
  • एक न्यायाधीश के रूप में: जब सुपर लाइब्रेरियन कोई गलती करता है, तो मास्टर लाइब्रेरियन एक सरोगेट जज के रूप में कार्य करता है। वह नियमों के विरुद्ध (जैसे "क्या आपने ऐसी नौकरी का भ्रम पैदा किया जो अस्तित्व में ही नहीं है?") सुपर लाइब्रेरियन के काम की ग्रेडिंग करता है, बिना हर बार किसी इंसान द्वारा जाँच किए जाने के इंतज़ार के।

3. परिणाम: तेज़, स्मार्ट और सुरक्षित

टीम ने लिंक्डइन के वास्तविक जॉब सर्च इंजन में इस नए सिस्टम का परीक्षण किया।

  • कम टूटी हुई रिक्वेस्ट: क्योंकि सुपर लाइब्रेरियन पूरी प्रक्रिया को एक साथ संभालता है, इसलिए कम रिक्वेस्ट ड्रॉप होती हैं या गलत समझी जाती हैं। पेपर में टूटी हुई रिक्वेस्ट में 17% की गिरावट दर्ज की गई है।
  • खुशहाल उपयोगकर्ता: अधिक लोगों को वे नौकरियाँ मिलीं जो उन्हें पसंद थीं और उन्होंने उन पर आवेदन किया।
  • गति: भले ही लाइब्रेरियन अधिक काम कर रहा है, फिर भी सिस्टम इतना तेज़ है कि वह प्रति सेकंड लाखों रिक्वेस्ट को बिना उपयोगकर्ताओं को इंतज़ार कराए संभाल सकता है।
  • बहुमुखी प्रतिभा: उन्होंने साबित किया कि यह अन्य चीजों के लिए भी काम करता है, जैसे लोगों को खोजना (न कि केवल नौकरियों को), जिससे पता चलता है कि "सुपर लाइब्रेरियन" को न्यूनतम प्रयास के साथ अलग-अलग प्रकार की लाइब्रेरी के लिए फिर से प्रशिक्षित किया जा सकता है।

सारांश

यह पेपर छोटे उपकरणों की एक धीमी, त्रुटिपूर्ण असेंबली लाइन को एक स्मार्ट, कुशल रोबोट से बदलने का वर्णन करता है जो जटिल मानवीय भाषा को समझता है, सख्त नियमों का पालन करता है, और एक "मास्टर टीचर" AI से सीखता है। यह खोज के अनुभव को सभी के लिए सहज, तेज़ और अधिक विश्वसनीय बनाता है जो नौकरी की तलाश में हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →