← नवीनतम पेपर
💻 computer science

Efficient Generative Retrieval for E-commerce Search with Semantic Cluster IDs and Expert-Guided RL

यह शोध पत्र CQ-SID और EG-GRPO को प्रस्तुत करता है, जो ई-कॉमर्स के लिए एक व्यावहारिक जनरेटिव रिट्रीवल फ्रेमवर्क है जो पदानुक्रमित सिमेंटिक क्लस्टर आईडी (hierarchical semantic cluster IDs) और विशेषज्ञ-निर्देशित सुदृढीकरण लर्निंग (expert-guided reinforcement learning) का लाभ उठाकर वास्तविक उत्पादन प्रणालियों में रिकॉल दक्षता, रैंकिंग संरेखण और GMV जैसे प्रमुख व्यावसायिक मेट्रिक्स में महत्वपूर्ण सुधार प्राप्त करता है।

मूल लेखक: Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai

प्रकाशित 2026-05-15
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jianbo Zhu, Xing Fang, Jing Wang, Mingmin Jin, Bokang Wang, Guangxin Song, Zhenyu Xie, Junjie Bai

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अव्यवस्थित गोदाम (जैसे कि एक बड़ी ई-कॉमर्स साइट) में एक विशिष्ट वस्तु, जैसे कि "लाल रनिंग शू" (red running shoe) की तलाश में जा रहे हैं। पुराने दिनों में, गोदाम प्रबंधक पहले एक लाइब्रेरियन से संभावित जूतों की एक सूची खोजने के लिए कहता (Recall), फिर एक सॉर्टर से उन्हें व्यवस्थित करने के लिए कहता (Ranking), और अंत में एक सेल्सपर्सन से आपको सबसे अच्छा जूता दिखाने के लिए कहता। यह प्रक्रिया तेज़ तो थी लेकिन कभी-कभी सटीक जूता चूक जाती थी क्योंकि लाइब्रेरियन को केवल कुछ ही कीवर्ड्स का पता होता था।

हाल ही में, वैज्ञानिकों ने एक नया विचार आजमाया है: एक लाइब्रेरियन के बजाय, उन्होंने एक सुपर-स्मार्ट AI को काम पर रखा जो आपके द्वारा चाही गई सटीक चीज़ का "सपना देखता है" (dreams up) और उसे तुरंत शेल्फ से निकाल लेता है। इसे जेनेरेटिव रिट्रीवल (Generative Retrieval) कहा जाता है। हालांकि, सैकड़ों लाखों वस्तुओं वाले गोदाम में, यह AI घबरा जाता है। यह हर एक जूते का सटीक नाम अनुमान लगाने की कोशिश करता है, जिसमें बहुत समय लगता है और अक्सर गलतियाँ भी होती हैं।

यह पेपर इस बारे में है कि कैसे इस "सपना देखने वाले AI" को एक वास्तविक, विशाल गोदाम में काम करने के लिए एक नया, स्मार्ट तरीका बनाया गया। यहाँ बताया गया है कि उन्होंने यह कैसे किया, सरल शब्दों में:

1. समस्या: बहुत सारे नाम, पर्याप्त समय नहीं

इस AI का उपयोग करने का पुराना तरीका ऐसा था जैसे इसे गोदाम के हर एक जूते का अनूठा सीरियल नंबर याद करने के लिए कहना। यदि 10 करोड़ जूते हैं, तो AI को हर बार जब आप कोई सवाल पूछते हैं, तो 10 करोड़ विकल्पों में से चुनना पड़ता है। यह घास के ढेर में सुई खोजने जैसा है, जहाँ आपको हर एक तिनके को एक-एक करके चेक करना पड़ता है। यह बहुत धीमा और महंगा है।

2. समाधान: "वाइब" (Vibe) के आधार पर समूह बनाना (CQ-SID)

हर जूते को एक अनूठा सीरियल नंबर देने के बजाय, लेखकों ने जूतों को सिमेंटिक क्लस्टर्स (Semantic Clusters) में समूहबद्ध करने का निर्णय लिया।

  • उपमा (Analogy): कल्पना कीजिए कि गोदाम व्यक्तिगत जूते के सीरियल नंबरों द्वारा नहीं, बल्कि "वाइब्स" या "पड़ोस" (neighborhoods) द्वारा व्यवस्थित है। सभी "लाल रनिंग शूज़" "रेड रनर नेबरहुड" में रहते हैं। सभी "नीले सैंडल" "ब्लू सैंडल नेबरहुड" में रहते हैं।
  • यह कैसे काम करता है: उन्होंने CQ-SID नामक एक सिस्टम बनाया। AI से सटीक जूता अनुमान लगाने के बजाय, यह AI से उस "पड़ोस" (क्लस्टर ID) का अनुमान लगाने के लिए कहता है जहाँ वह जूता रहता है।
  • लाभ: AI को करोड़ों जूतों के बजाय केवल कुछ हज़ार पड़ोसों के बीच से चुनना होता है। यह आपकी खोज को "सटीक जूता ढूंढें" से बदलकर "रेड रनर नेबरहुड ढूंढें" करने जैसा है। यह बहुत तेज़ है और इसके लिए कम कंप्यूटिंग पावर की आवश्यकता होती है।

3. प्रशिक्षण: AI के लिए चार-चरणीय स्कूल

आप इस AI को केवल पड़ोसों की एक सूची देकर यह उम्मीद नहीं कर सकते कि वह उन्हें जान जाएगा। लेखकों ने इसे चार प्रगतिशील चरणों में प्रशिक्षित किया, जैसे कि एक छात्र प्राथमिक विद्यालय से कॉलेज तक स्नातक करता है:

  1. आइटम-टू-एसआईडी (Item-to-SID): सबसे पहले, AI एक जूते के विवरण को देखना सीखता है और कहता है, "आह, यह रेड रनर नेबरहुड में आता है।"
  2. क्वेरी-टू-एसआईडी (Query-to-SID): इसके बाद, यह एक इंसान द्वारा टाइप किए गए शब्दों ("लाल रनिंग शू") को देखना सीखता है और सीधे नेबरहुड का अनुमान लगाता है।
  3. व्यक्तिगत (Personalized): फिर, यह यह विचार करना सीखता है कि कौन पूछ रहा है। यदि एक पेशेवर धावक पूछता है, तो यह एक हाई-टेक रनिंग नेबरहुड का अनुमान लगाता है; यदि एक सामान्य यात्री पूछता है, तो यह कम्फर्ट (comfort) नेबरहुड का अनुमान लगाता है।
  4. "एक्सपर्ट" कोच (EG-GRPO): यह अंतिम और सबसे महत्वपूर्ण चरण है।

4. "एक्सपर्ट" कोच (EG-GRPO)

यहाँ पेचीदा हिस्सा है: AI नेबरहुड का अनुमान लगाने में बहुत अच्छा है, लेकिन कभी-कभी यह ऐसा नेबरहुड चुन लेता है जिसमें कुछ अच्छे जूते तो हैं लेकिन सबसे अच्छे जूते छूट गए हैं। पुराने दिनों में, AI को केवल तभी इनाम मिलता था जब उसने उस सटीक जूते का अनुमान लगाया हो जिस पर यूजर ने क्लिक किया था। लेकिन एक विशाल गोदाम में, AI केवल इसलिए क्लिक मिस कर सकता है क्योंकि उसने सटीक सही जूता नहीं चुना, भले ही उसने सही नेबरहुड चुना हो।

लेखकों ने एक्सपर्ट-गाइडेड आरएल (Expert-Guided RL) नामक एक विधि पेश की।

  • उपमा (Analogy): कल्पना कीजिए कि AI एक वीडियो गेम खेल रहा है। आमतौर पर, यदि वह लक्ष्य चूक जाता है, तो उसे केवल "गेम ओवर" मिलता है। लेकिन यहाँ, लेखक एक कोच के रूप में कार्य करते हैं।
  • यह कैसे काम करता है: प्रशिक्षण के दौरान, कोच चुपके से AI को फुसफुसाता है, "हे, मुझे पता है कि इस बार तुम क्लिक मिस कर गए, लेकिन देखो! वास्तविक विजेता आइटम इस नेबरहुड में था। अगली बार के लिए इसे याद रखना।"
  • परिणाम: AI न केवल एक सिंगल क्लिक के पीछे भागना सीखता है, बल्कि विभिन्न प्रकार के अच्छे नेबरहुड्स को एक्सप्लोर करना भी सीखता है। यह AI को "आलसी" होने से रोकता है और केवल सबसे लोकप्रिय आइटम्स को चुनने से रोकता है (जो कि एक आम समस्या है जिसे "मैथ्यू इफेक्ट" कहा जाता है)।

5. परिणाम: तेज़, स्मार्ट और अधिक बिक्री

जब उन्होंने इसका परीक्षण वास्तविक Tmall ऐप (एक बड़ा चीनी शॉपिंग प्लेटफॉर्म) में किया:

  • गति (Speed): वे बहुत छोटे "सर्च बीम" (जैसे कि कम विकल्पों को देखना) का उपयोग कर सकते थे और फिर भी सही आइटम्स ढूंढ सकते थे। इसने खोज के समय को आधा कर दिया।
  • सटीकता (Accuracy): AI पुराने सिस्टम की तुलना में "नेबरहुड्स" को बहुत अधिक बार सही ढंग से ढूंढ पाया।
  • व्यावसायिक प्रभाव (Business Impact): क्योंकि AI ने बेहतर आइटम्स तेज़ी से खोजे, इसलिए लोगों ने अधिक खरीदारी की। इस सिस्टम ने बिक्री (GMV) में 1.15% और क्लिक-टू-बाय रेट (UCTCVR) में 0.40% की वृद्धि की।
  • प्रभुत्व (Dominance): यह नया "ड्रीमिंग" चैनल उनके सर्च का सबसे महत्वपूर्ण हिस्सा बन गया, जो उनके सर्च सिस्टम के माध्यम से की जाने वाली सभी खरीदारी के 72% से अधिक के लिए जिम्मेदार था।

सारांश में:
लेखकों ने पूरे सर्च सिस्टम को एक जादुई AI से बदलने की कोशिश नहीं की। इसके बजाय, उन्होंने AI को एक बेहतर नक्शा (आइटम्स को नेबरहुड्स में समूहित करना) और एक बेहतर कोच (एक्सपर्ट-गाइडेड आरएल) दिया ताकि यह सीखने में मदद मिल सके। इसने सर्च को तेज़, अधिक सटीक और कंपनी के लिए काफी अधिक लाभदायक बना दिया।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →