← नवीनतम पेपर
🤖 AI

SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems

यह शोध पत्र SA-RSQ का प्रस्ताव करता है, जो मल्टी-मोडल रिकमेंडर सिस्टम के लिए एक बहुमुखी ढांचा है जो कॉम्पैक्ट (इंडेक्स, प्रोबेबिलिटी) टुपल्स को स्टोर करने के लिए स्पार्स एक्टिवेशन-आधारित रेसिडुअल सॉफ्ट क्वांटाइजेशन का उपयोग करता है, जो स्टोरेज दक्षता और रिकंस्ट्रक्शन क्वालिटी के बीच प्रभावी ढंग से संतुलन बनाता है और औद्योगिक अनुप्रयोगों में CTR और CPM में महत्वपूर्ण सुधार प्राप्त करता है।

मूल लेखक: Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

प्रकाशित 2026-08-25
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आज के विशाल डिजिटल बाजारों में, रिकमेंडर सिस्टम (recommender systems) हमारे जीवन के अदृश्य पुस्तकालयाध्यक्षों की तरह कार्य करते हैं, जो हमें अगला वीडियो देखने, अगला गाना सुनने या अगला भोजन ऑर्डर करने का सुझाव देते हैं। इसे कुशलतापूर्वक करने के लिए, ये सिस्टम उन वस्तुओं की गहरी समझ पर निर्भर करते हैं जिन्हें वे पेश करते हैं। हाल के वर्षों में, इंजीनियरों ने इन वस्तुओं का वर्णन करने के लिए अविश्वसनीय रूप से विस्तृत, उच्च-आयामी (high-dimensional) मानचित्रों के साथ शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करना शुरू कर दिया है। कल्पना कीजिए कि किसी उत्पाद का एक एकल विवरण केवल एक साधारण लेबल नहीं है, बल्कि एक जटिल, बहु-स्तरीय चित्र है जिसमें उसके स्वरूप, अर्थ और संदर्भ के बारे में हजारों विशिष्ट विवरण शामिल हैं। जबकि ये समृद्ध विवरण सिस्टम को समान वस्तुओं के बीच सूक्ष्म अंतर समझने में मदद करते हैं, लेकिन इनके साथ एक भारी कीमत भी आती है। अरबों वस्तुओं के लिए इन विशाल चित्रों को संग्रहीत और संसाधित करने के लिए इतनी अधिक कंप्यूटर मेमोरी और ऊर्जा की आवश्यकता होती है कि यह पूरे सिस्टम को धीमा कर देता है, जिससे यह वास्तविक दुनिया के उपयोग के लिए बहुत धीमा और महंगा हो जाता है।

इसे हल करने के लिए, इंजीनियरों ने पारंपरिक रूप से इन विस्तृत चित्रों को छोटे, असतत (discrete) कोड में सिकोड़ने की कोशिश की है, ठीक वैसे ही जैसे एक उच्च-रिज़ॉल्यूशन वाली तस्वीर को एक एकल, छोटे आइकन में संपीड़ित (compress) किया जाता है। हालाँकि, इस अत्यधिक संपीड़न के कारण अक्सर चित्र धुंधला हो जाता है, जिससे सिस्टम उन सूक्ष्म विवरणों को खो देता है जो एक वस्तु को दूसरी वस्तु से अलग करते हैं। यह एक कठिन समझौता है: या तो समृद्ध विवरण बनाए रखें और सिस्टम को धीमा करें, या डेटा को सिकोड़ें और उस सटीकता को खो दें जो अच्छे सुझाव देने के लिए आवश्यक है। टियांनजिन यूनिवर्सिटी और मेइतुआन (Meituan) के शोधकर्ताओं ने एक नया दृष्टिकोण प्रस्तावित किया है जो एक मध्य मार्ग खोजने का प्रयास करता है, जिससे सिस्टम विस्तृत विवरणों की समृद्धि को बनाए रखते हुए उन्हें एक स्थान-कुशल तरीके से संग्रहीत कर सकता है जो सटीकता से समझौता नहीं करता है।

शोधकर्ताओं ने 'स्पार्स एक्टिवेशन-बेस्ड रेसिडुअल सॉफ्ट क्वांटाइजेशन' (Sparse Activation-based Residual Soft Quantization) नामक एक विधि विकसित की, जिसे SA-RSQ कहा जाता है। प्रत्येक वस्तु को एक एकल, कठोर श्रेणी या एक छोटे, निश्चित कोड में बदलने के बजाय, यह नया ढांचा वस्तु के विवरण को कुछ प्रमुख निर्माण खंडों (building blocks) के एक लचीले संयोजन के रूप में मानता है। इसे एक जटिल स्वाद का वर्णन करने जैसा समझें, न कि शब्दकोश से एक एकल शब्द चुनकर, बल्कि कुछ चुनिंदा सामग्रियों को चुनने और यह निर्दिष्ट करने के माध्यम से कि प्रत्येक का कितना उपयोग किया जाना चाहिए। सिस्टम एक वस्तु के उच्च-आयामी विवरण को देखता है और संभावनाओं के एक बड़े पुस्तकालय में से सबसे प्रासंगिक "सामग्रियों" की पहचान करता है। इसके बाद, यह केवल इन चयनित सामग्रियों के नाम और उनके मिश्रण के सटीक अनुपात को संग्रहीत करता है।

यह दृष्टिकोण पिछले तरीकों की तुलना में एक महत्वपूर्ण लाभ प्रदान करता है। पुराने तकनीकों ने अक्सर एक एकल कोड या एक सघन संख्या ब्लॉक के बीच चयन करने के लिए मजबूर किया, जिससे सूक्ष्मता का नुकसान या भंडारण लागत में उछाल आया। हालाँकि, नई विधि, सूचना की जटिलता से भंडारण स्थान की मात्रा को अलग कर देती है। विवरण के सबसे महत्वपूर्ण हिस्सों को उनके भार (weights) के साथ संग्रहीत करके, सिस्टम आवश्यकता पड़ने पर मूल वस्तु के अत्यधिक सटीक संस्करण को पुनर्गठित कर सकता है। महत्वपूर्ण रूप से, यह प्रक्रिया 'डिफरेंशिएबल' (differentiable) है, जिसका अर्थ है कि सिस्टम प्रशिक्षण के दौरान प्राप्त फीडबैक से सीधे अपने विकल्पों को सीख और सुधार सकता है, बजाय इसके कि वह अनुमानों पर निर्भर रहे जो अक्सर त्रुटियों का कारण बनते हैं।

टीम ने एक खाद्य-वितरण विज्ञापन मंच के विशाल, वास्तविक दुनिया के डेटासेट पर इस ढांचे का परीक्षण किया, जिसमें करोड़ों वस्तुएं शामिल थीं। उन्होंने सख्त भंडारण सीमाओं के तहत कई मौजूदा संपीड़न तकनीकों के विरुद्ध अपने तरीके का परीक्षण किया, जो प्रति वस्तु 8 बाइट्स से 48 बाइट्स तक थी। परिणामों ने दिखाया कि उनका दृष्टिकोण अन्य सभी से लगातार बेहतर रहा। अत्यंत छोटे भंडारण आकार के बावजूद, नए तरीके ने उपयोगकर्ताओं द्वारा क्लिक किए जाने की भविष्यवाणी करने में उच्च स्तर की सटीकता बनाए रखी। जब उन्हें 32 या 48 बाइट्स जैसे थोड़े अधिक स्थान की अनुमति दी गई, तो प्रदर्शन और बेहतर हुआ, जिसने परीक्षण किए गए सभी तरीकों में उच्चतम स्कोर प्राप्त किया। सिस्टम वस्तुओं के सूक्ष्म विवरणों को संरक्षित करने में सक्षम था, जिससे "टकराव" (collisions) की समस्या को रोका जा सका जहाँ विभिन्न वस्तुएं आपस में भ्रमित हो जाती हैं, जो कि पुराने संपीड़न प्रणालियों की एक आम समस्या है।

ऑफलाइन परीक्षणों के अलावा, शोधकर्ताओं ने खाद्य-वितरण मंच पर एक लाइव ऑनलाइन प्रयोग में इस प्रणाली को तैनात किया। एक सप्ताह की अवधि के दौरान, उन्होंने एक नियंत्रित परीक्षण चलाया जहाँ नए तरीके को वास्तविक उपयोगकर्ता ट्रैफ़िक के एक हिस्से को दिखाया गया। परिणाम मूर्त थे: इस नए ढांचे का उपयोग करने वाले सिस्टम ने विज्ञापनों पर उपयोगकर्ताओं के क्लिक करने की दर में 2.51 प्रतिशत की वृद्धि उत्पन्न की, और प्रति हजार इंप्रेशन (impressions) उत्पन्न राजस्व में 3.66 प्रतिशत की वृद्धि हुई। ये लाभ बिना सिस्टम को धीमा किए प्राप्त किए गए, जो यह सिद्ध करता है कि जटिल डेटा को संपीड़ित करना बुद्धिमानीपूर्ण सिफारिशें बनाने के लिए आवश्यक बुद्धिमत्ता को खोए बिना संभव है।

अध्ययन ने एक संभावित भविष्य के अनुप्रयोग की भी खोज की जहाँ सिस्टम केवल एक अगली वस्तु की भविष्यवाणी नहीं करता है, बल्कि आने वाली वस्तु की एक संभाव्यता वितरण (probability distribution) की भविष्यवाणी करता है, ठीक वैसे ही जैसे एक भाषा मॉडल वाक्य में अगले शब्द की भविष्यवाणी करता है। हालांकि यह एक प्रारंभिक जांच थी, शुरुआती परिणामों ने सुझाव दिया कि यह संभाव्यता आधारित दृष्टिकोण जनरेटिव रिकमेंडेशन कार्यों के लिए अच्छी तरह से काम कर सकता है, जो यह खोलता है कि ये सिस्टम कैसे विकसित हो सकते हैं। शोधकर्ताओं ने उल्लेख किया कि हालांकि परिणाम आशाजनक हैं, लेकिन वे मालिकाना डेटा और विशिष्ट कॉन्फ़िगरेशन पर आधारित हैं, और विभिन्न क्षेत्रों में इन निष्कर्षों की पुष्टि करने के लिए आगे के कार्य की आवश्यकता है।

अंततः, यह कार्य प्रदर्शित करता है कि भंडारण दक्षता और डेटा गुणवत्ता के बीच का कठोर समझौता अपरिहार्य नहीं है। एक लचीली, स्पार्स रिप्रजेंटेशन का उपयोग करके जो प्रमुख विशेषताओं के भारित संयोजन के माध्यम से एक वस्तु के सार को पकड़ती है, यह संभव है कि ऐसे रिकमेंडर सिस्टम बनाए जाएं जो तेज़ और सटीक दोनों हों। एक वास्तविक औद्योगिक सेटिंग में इस पद्धति की सफलता यह सुझाव देती है कि ऐसी तकनीकें अरबों डेटा को संभालने के लिए एक मानक उपकरण बन सकती हैं, यह सुनिश्चित करते हुए कि हमारे विकल्पों का मार्गदर्शन करने वाली प्रणालियाँ उतनी ही बुद्धिमान और सूक्ष्म बनी रहें जितना कि वह जानकारी जिसे वे संसाधित करती हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →