MMRM: A Multiplex Multimodal Representation Model for Product Ranking in E-commerce Search
यह शोध पत्र MMRM का प्रस्ताव करता है, जो एक एकीकृत ढांचा है जो विविध सहयोगात्मक संकेतों के साथ मल्टीमॉडल लार्ज लैंग्वेज मॉडल्स को संरेखित करता है ताकि मल्टीप्लेक्स आइटम और यूजर रिप्रेजेंटेशन उत्पन्न किए जा सकें, जिससे JD सर्च इंजन में ई-कॉमर्स सर्च रैंकिंग प्रदर्शन और दक्षता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, सुपर-फास्ट डिजिटल मॉल (जैसे JD.com) चला रहे हैं जहाँ लाखों लोग जींस की एक आदर्श जोड़ी खोजने के लिए दौड़ रहे हैं। उन्हें वह खोजने में मदद करने के लिए जो वे चाहते हैं, आपको एक स्मार्ट असिस्टेंट की आवश्यकता है जो न केवल उत्पाद टैग पर लिखे टेक्स्ट को पढ़े बल्कि उसकी तस्वीर भी "देख" सके, उसकी शैली (स्टाइल) को समझ सके और यह भी जान सके कि खरीदार वास्तव में क्या ढूंढ रहा है।
लंबे समय तक, इन सहायकों के पास एक पेचीदा समस्या थी। वे उन छात्रों की तरह थे जिन्होंने एक समय में केवल एक विशिष्ट परीक्षा के लिए पढ़ाई की। यदि उन्होंने "सर्च" (खोज) के लिए पढ़ाई की, तो वे किसी टेक्स्ट क्वेरी को उत्पाद से मिलाने में माहिर थे। यदि उन्होंने "कार्ट" के लिए पढ़ाई की, तो वे इस बात में माहिर थे कि लोग अपनी शॉपिंग कार्ट में क्या डालते हैं। लेकिन एक ही "सुपर-स्टूडेंट" (एक सामान्य मल्टीमॉडल लार्ज लैंग्वेज मॉडल) को एक साथ कई अलग-अलग प्रकार के टेस्ट के लिए पढ़ाने की कोशिश करने से अक्सर एक भ्रमित करने वाला ढेर बन जाता था। पुराने तरीकों ने एक ही "सुपर-स्टूडेंट" को केवल एक प्रकार के सिग्नल से सीखने के लिए मजबूर किया, या उन्होंने छात्र के नोट्स को तथ्यों की एक जेनेरिक सूची की तरह माना जिससे यह वास्तव में भविष्यवाणी नहीं की जा सकती थी कि उपयोगकर्ता आगे क्या चाहेगा।
यह पेपर एक नया सिस्टम पेश करता है जिसे MMRM (मल्टीप्लेक्स मल्टीमॉडल रिप्रेजेंटेशन मॉडल) कहा जाता है, जो एक सिंगल, हाई-टेक किचन लेकिन चार अलग-अलग, विशेष रेसिपी बुक्स वाले एक मास्टर शेफ की तरह काम करके इस समस्या को हल करता है।
बड़ा विचार: एक किचन, चार विशेषज्ञ शेफ
हर कार्य के लिए चार अलग-अलग किचन (मॉडल्स) बनाने के बजाय, MMRM एक साझा "बैकबोन" (किचन खुद) का उपयोग करता है लेकिन इसे चार विशेष "टोपियाँ" या टोकन देता है: [SEARCH], [CLICK], [CART], और [ORDER]।
इसे एक बहुमुखी अभिनेता की तरह समझें। जब वे [SEARCH] टोपी पहनते हैं, तो वे एक जासूस की तरह व्यवहार करते हैं जो टेक्स्ट सुराग को उत्पाद से मिलाता है। जब वे [CART] टोपी बदलते हैं, तो वे एक स्टाइलिस्ट की तरह व्यवहार करते हैं जिन्हें पता होता है कि लोग वास्तव में किन चीजों को एक साथ खरीदते हैं। जादू यह है कि यह अभिनेता बिना मंच छोड़े तुरंत टोपी बदल सकता है। एक ही किचन के एक ही चक्कर में, मॉडल चार अलग-अलग प्रकार के संकेतों (सिग्नल्स) से एक साथ सीखता है:
- सर्च क्लिक्स: जब कोई "जींस" टाइप करता है और एक परिणाम पर क्लिक करता है।
- क्लिक सेशन्स: जब कोई एक आइटम से दूसरे आइटम पर क्रमवार क्लिक करता है।
- कार्ट सेशन्स: जब कोई क्रम में आइटम्स को अपने कार्ट में जोड़ता है।
- ऑर्डर सेशन्स: जब कोई वास्तव में आइटम्स का एक क्रम खरीदता है।
लेखकों ने पाया कि ये सिग्नल्स बहुत अलग हैं। एक सर्च क्लिक एक व्यापक "मुझे इसमें दिलचस्पी है" जैसा है, जबकि एक ऑर्डर सेशन एक "मुझे वास्तव में यह विशिष्ट कॉम्बो चाहिए" जैसा है। इन अंतरों को अनदेखा करने और उन सभी के साथ एक जैसा व्यवहार करने से पुराने मॉडल्स बहुत कुछ मिस कर देते थे। MMRM, हालांकि, इन चारों को एक साथ सीखता है, जिससे एक ही उत्पाद के चार अलग-अलग "रिप्रेजेंटेशन" (या मानसिक मानचित्र) बनते हैं, जो अलग-अलग कामों के लिए ट्यून किए गए हैं।
"मल्टीप्लेक्स यूजर स्ट्रैटेजी"
एक बार जब मॉडल के पास उत्पादों के ये चार अलग-अलग मानचित्र होते हैं, तो उसे यह समझना होता है कि आप क्या चाहते हैं। पेपर तर्क देता है कि आप हर किसी के लिए केवल एक जेनेरिक मैप का उपयोग नहीं कर सकते। इसके बजाय, MMRM एक "मल्टीप्लेक्स यूजर रिप्रेजेंटेशन" रणनीति का उपयोग करता है।
कल्पना कीजिए कि आप ब्राउज़ कर रहे हैं। सिस्टम आपके इतिहास को देखता है। यदि आप केवल सर्च कर रहे हैं, तो यह [SEARCH] मैप का उपयोग करता है ताकि उन आइटम्स को खोजा जा सके जो आपके द्वारा क्लिक किए गए आइटम्स के समान हैं। यदि आप एक कार्ट बना रहे हैं, तो यह [CART] मैप पर स्विच हो जाता है ताकि यह देखा जा सके कि आमतौर पर कौन सी चीजें एक साथ चलती हैं। यह एक व्यक्तिगत शॉपर की तरह है जो अपनी रणनीति बदलता रहता है कि क्या आप केवल विंडो-शॉपिंग कर रहे हैं या खरीदने के लिए तैयार हैं। वे आपके विशिष्ट व्यवहार अनुक्रम (सीक्वेंस) को उत्पाद के सही "टोपी" के साथ मिलाते हैं, जिससे एक अत्यधिक व्यक्तिगत सिफारिश मिलती है।
उन्होंने क्या खारिज किया
पेपर स्पष्ट रूप से दो सामान्य दृष्टिकोणों के विरुद्ध तर्क देता है:
- केवल एक सिग्नल का उपयोग करना: वे दिखाते हैं कि केवल सर्च डेटा (या केवल कार्ट डेटा) पर मॉडल को प्रशिक्षित करने से वह अन्य महत्वपूर्ण संबंधों के प्रति अंधा रह जाता है। आप केवल एक को चुनकर बाकी को अनदेखा नहीं कर सकते।
- "वन-साइज़-फिट्स-ऑल" एम्बेडिंग: उन्होंने पाया कि केवल एक जेनेरिक उत्पाद विवरण को लेना और उसे रैंकिंग मॉडल में डाल देने से मल्टीटास्क परिदृश्यों में अच्छा काम नहीं करता है। यह "एम्बेडिंग एंटैंगलमेंट" का कारण बनता है, जहाँ मॉडल भ्रमित हो जाता है क्योंकि वह एक ही नोट का उपयोग सर्च क्वेरी और कार्ट प्रेडिक्शन के लिए एक साथ करने की कोशिश कर रहा है। MMRM इसे अलग-अलग रिप्रेजेंटेशन रखकर खारिज करता है।
प्रमाण: वास्तविक नंबर, वास्तविक परिणाम
लेखकों ने केवल अनुमान नहीं लगाया; उन्होंने एक बड़े पैमाने पर इसका परीक्षण किया।
- ट्रेनिंग डेटा: उन्होंने सर्च के लिए 0.3 बिलियन ट्रिपलेट्स (तीन संबंधित आइटम्स के समूह) के एक विशाल डेटासेट का उपयोग किया, और कार्ट एवं ऑर्डर व्यवहार के लिए और भी बड़े डेटासेट (ऑर्डर के लिए 3 साल तक का डेटा) का उपयोग किया।
- मॉडल: उन्होंने 8 NVIDIA H800 GPUs पर एक 4-बिलियन पैरामीटर वाला मॉडल (एक बहुत बड़ा AI) प्रशिक्षित किया।
- परिणाम: अपने परीक्षणों में, MMRM ने सभी पिछले "सिंगल-टास्क" मॉडल्स और उन "मल्टी-टास्क" मॉडल्स को पछाड़ दिया जिन्होंने इस विशेष टोपी प्रणाली का उपयोग नहीं किया था।
- वास्तविक दुनिया का प्रभाव: वे कंप्यूटर सिमुलेशन तक ही सीमित नहीं रहे। उन्होंने इसे वास्तविक JD.com सर्च इंजन पर तैनात किया। लाखों दैनिक उपयोगकर्ताओं के साथ एक सप्ताह के परीक्षण में, नए सिस्टम ने सुधार किया:
- क्लिक-थ्रू रेट (CTR) में 0.42% की वृद्धि
- ऐड-टू-कार्ट रेट (ACR) में 0.37% की वृद्धि
- कन्वर्जन रेट (CVR) में 0.35% की वृद्धि
लेखक नोट करते हैं कि हालांकि ये प्रतिशत छोटे दिखते हैं, लेकिन लाखों उपयोगकर्ताओं वाले प्लेटफॉर्म में, 0.10% का उछाल भी भारी राजस्व वृद्धि की ओर ले जाता है। इन सिद्ध लाभों के कारण, यह सिस्टम अब पूरी तरह से लाइव है और लाखों लोगों को उनके उत्पाद खोजने में मदद कर रहा है।
संक्षेप में, MMRM खरीदारी को समझने के लिए AI को सिखाने का एक स्मार्ट और अधिक लचीला तरीका है। यह "सब कुछ जानने वाला लेकिन किसी में भी माहिर नहीं" बनने के बजाय, एक कुशल मस्तिष्क के साथ चार विशिष्ट मोड का उपयोग करके कई कार्यों में माहिर बनने में मदद करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।