← नवीनतम पेपर
🤖 AI

SR-Agent: An Experience-Driven Agentic Framework for Post-Ranking Strategies Refinement in E-Commerce Recommendation

यह शोध पत्र SR-Agent को प्रस्तुत करता है, जो पहला तैनात एजेंटिक फ्रेमवर्क है जो यूजर सिमुलेशन, डायग्नोस्टिक विश्लेषण और बाधित एक्शन निष्पादन को एकीकृत करके औद्योगिक ई-कॉमर्स अनुशंसा प्रणालियों में पोस्ट-रैंकिंग रणनीतियों के निरंतर परिशोधन को स्वचालित करता है, जिसके परिणामस्वरूप ऑर्डर वॉल्यूम और यूजर एंगेजमेंट में मापने योग्य सुधार होता है और साथ ही परिचालन लागत में भी उल्लेखनीय कमी आती है।

मूल लेखक: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

प्रकाशित 2026-07-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanchen Yang, Kaiwen Yang, Junpeng Zhuang, Yang He, Keting Cen, Bochao Liu, Zhongbo Sun, An Liu, Zhongteng Han, Chenyi Lei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, जादुई सुपरमार्केट में घूम रहे हैं जहाँ आपकी पसंद के आधार पर अलमारियाँ तुरंत खुद को पुनर्गठित कर लेती हैं। यह ई-कॉमर्स अनुशंसा प्रणाली (e-commerce recommendation systems) की दुनिया है। वर्षों से, ये डिजिटल दुकानदार एक ही चीज़ के प्रति जुनूनी रहे हैं: यह सटीक भविष्यवाणी करना कि आप किस एक वस्तु पर क्लिक करेंगे या उसे खरीदेंगे। वे विशेषज्ञ जुआरियों की तरह हैं, जो आपकी अगली चाल पर दांव लगाते हैं। लेकिन यहाँ एक पेच है: सिर्फ इसलिए कि कोई वस्तु एक "अच्छा दांव" है, इसका मतलब यह नहीं है कि पूरी खरीदारी का अनुभव अच्छा होगा। यदि स्टोर आपको एक के बाद एक पाँच एक जैसी लाल स्नीकर्स दिखाता है, या एक ही प्रकार के हथौड़े के दस अलग-अलग ब्रांड दिखाता है, तो आप ऊब सकते हैं, भ्रमित हो सकते हैं, या चिढ़ सकते हैं। यह सटीकता (accuracy) (सही वस्तु का अनुमान लगाना) और उपयोगकर्ता अनुभव (user experience) (पूरी यात्रा को मजेदार और उपयोगी बनाना) के बीच का अंतर है।

इसे ठीक करने के लिए, ऑनलाइन स्टोर पोस्ट-रैंकिंग रणनीतियों (post-ranking strategies) का उपयोग करते हैं। इन्हें स्टोर मैनेजर की नियम पुस्तिका के रूप में समझें। कंप्यूटर द्वारा सर्वोत्तम वस्तुएं चुनने के बाद, मैनेजर हस्तक्षेप करता है और कहता है, "ठीक है, लेकिन एक साथ तीन लाल जूते मत दिखाओ," या "सुनिश्चित करें कि हम विभिन्न कीमतों का मिश्रण दिखाएं।" समस्या यह है कि ये नियम पुस्तिकाएं आमतौर पर मनुष्यों द्वारा लिखी जाती हैं और फिर एक शेल्फ पर छोड़ दी जाती हैं, जो स्थिर और अपरिवर्तनीय होती हैं। लेकिन उत्पादों और लोगों की दुनिया हमेशा बदलती रहती है; नए आइटम आते हैं, रुझान बदलते हैं, और जो नियम कल अच्छा था, वह आज बुरा हो सकता है। जब ये नियम पुराने पड़ जाते हैं, तो खरीदारी का अनुभव बोझिल हो जाता है। बड़ा सवाल वैज्ञानिकों और इंजीनियरों के लिए यह है: हम हर एक शॉपिंग लिस्ट को पढ़ने और नियमों को फिर से लिखने के लिए थके हुए इंसानों की एक सेना को काम पर रखे बिना इन नियम पुस्तिकाओं को अपडेट कैसे रखें?

यहीं पर यह पेपर SR-Agent का परिचय देता है, जो एक नए प्रकार की "डिजिटल जासूस" टीम है जिसे इन शॉपिंग सूचियों को स्वचालित रूप से ठीक करने के लिए डिज़ाइन किया गया है। शोधकर्ताओं ने, कुआईशौ (Kuaishore) ई-कॉमर्स प्लेटफॉर्म के साथ मिलकर, एक ऐसा सिस्टम बनाया है जो एक स्व-सुधार लूप (self-correcting loop) की तरह कार्य करता है। अनुशंसाओं (recommendations) की प्रतीक्षा करने के बजाय, SR-Agent लगातार अनुशंसाओं पर नज़र रखता है, पहचानता है कि कब "मैनेजर के नियम" विफल हो रहे हैं, पता लगाता है कि वे क्यों विफल हुए, और फिर सुरक्षित रूप से एक छोटा, विशिष्ट सुधार प्रस्तावित करता है।

यहाँ टीम कैसे काम करती है:

  1. UserSim एजेंट (सहानुभूति रखने वाला): सिस्टम का यह हिस्सा एक वास्तविक खरीदार होने का नाटक करता है। यह अनुशंसित वस्तुओं की एक सूची देखता है और पूछता है, "यदि मैं एक इंसान होता, तो क्या मैं इन तीन समान वस्तुओं को देखकर ऊब जाता?" यह केवल क्लिक को नहीं गिनता; यह "बुरे मामलों" (bad cases) को देखता है, जैसे कि एक सूची में बिखरे हुए बिल्कुल एक जैसे दिखने वाले पाँच पैंट के जोड़े देखना।
  2. एनालिसिस एजेंट (जासूस): एक बार जब UserSim को कोई बुरा मामला मिलता है, तो एनालिसिस एजेंट उसकी जांच करता है। वह पूछता है, "नियम पुस्तिका ने ऐसा क्यों होने दिया?" शायद "समान वस्तुओं" का नियम बहुत ढीला है, या शायद स्टोर की श्रेणियां अव्यवस्थित हैं। यह अव्यवस्थित समस्या को एक स्पष्ट निदान में बदल देता है, जैसे "हमें इस विशिष्ट सत्र के लिए पैंट के नियम को सख्त करने की आवश्यकता है।"
  3. स्ट्रेटेजी रिफाइनमेंट हार्नेस (सावधान वास्तुकार): यह सुरक्षा गार्ड है। यह जासूस के निदान को लेता है और उसे ठीक करने की कोशिश करता है, लेकिन केवल सख्त सीमाओं के भीतर। यह केवल छोटे, पूर्व-अनुमोदित परिवर्तन कर सकता है, जैसे किसी संख्या को थोड़ा सा बदलना या किसी श्रेणी लेबल को ठीक करना। किसी भी परिवर्तन को लाइव करने से पहले, यह एक कठोर चार-चरणीय परीक्षण से गुजरता है: यह बुरे मामलों का पुन: परीक्षण करता है, पुराने ट्रैफिक पर परिवर्तन का अनुकरण करता है, एक मनुष्य से इसकी दोबारा जांच करवाता है, और अंत में ऑनलाइन एक छोटा, सुरक्षित प्रयोग चलाता है।

इस "स्व-विकसित" (self-evolving) प्रणाली के परिणाम काफी उत्साहजनक हैं। जब टीम ने एक महीने के लिए कुआईशौ के प्लेटफॉर्म पर SR-Agent का परीक्षण किया, तो उन्होंने पाया कि इसने न केवल खरीदारी के अनुभव को बेहतर बनाया; बल्कि इसने व्यवसाय को भी बेहतर बनाया। इस प्रणाली ने ऑर्डरों की संख्या में 0.71% की वृद्धि की, लोगों को स्टोर में गहराई तक ब्राउज़ करने में 0.34% की मदद की, और उपयोगकर्ताओं को श्रेणियों की एक विस्तृत श्रृंखला पर क्लिक करने में 0.48% की मदद की।

शायद इससे भी अधिक प्रभावशाली इसकी गति है। इन नियमों को ठीक करने का पुराना तरीका इसमें शामिल था कि मनुष्य सूचियों का निरीक्षण करते, निदान करते और अपडेट के लिए हफ्तों इंतजार करते। SR-Agent ने इस पूरे चक्र को केवल 3 से 5 दिनों में समेट दिया। हालांकि यह प्रणाली अभी भी सुरक्षा सुनिश्चित करने के लिए लगभग 1% काम की यादृच्छिक रूप से जांच करने के लिए मनुष्यों का उपयोग करती है, इसने हजारों समस्याओं को खोजने और समाधान प्रस्तावित करने का भारी काम स्वचालित रूप से संभाला।

पेपर सावधानी से नोट करता है कि यह कोई जादुई छड़ी नहीं है जो सब कुछ तुरंत हल कर देती है। यह प्रणाली छोटे, सीमित बदलाव करने और उनसे सीखने के माध्यम से काम करती है। उनके परीक्षणों में, विशिष्ट बुरे मामलों को ठीक करने की प्रणाली की क्षमता पहली कोशिश में लगभग 49% से बढ़कर दसवें अपडेट तक 83% हो गई, जो दर्शाता है कि यह जितना अधिक चलती है, उतनी ही स्मार्ट होती जाती है। एक धीमी, मैनुअल प्रक्रिया को एक तेज़, स्वचालित लूप में बदलकर, SR-Agent दिखाता है कि हम उन मनुष्यों को थकाए बिना जो उन्हें प्रबंधित करते हैं, ऑनलाइन शॉपिंग के अनुभवों को ताज़ा और रोमांचक बनाए रख सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →