Aligning Multimodal Sequential Recommendations via Robust Direct Preference Optimization with Sparse MoE
यह शोधपत्र RoDPO को प्रस्तुत करता है, जो मल्टीमॉडल अनुक्रमिक अनुशंसाओं (multimodal sequential recommendations) के लिए एक सुदृढ़ डायरेक्ट प्रेफरेंस ऑप्टिमाइज़ेशन (Direct Preference Optimization) फ्रेमवर्क है, जो डिटरमिनिस्टिक हार्ड नेगेटिव्स को एक डायनेमिक कैंडिडेट पूल से स्टोकेस्टिक सैंपलिंग द्वारा प्रतिस्थापित करके रैंकिंग प्रदर्शन को बढ़ाता है ताकि फॉल्स नेगेटिव ग्रेडिएंट्स को कम किया जा सके, जबकि वैकल्पिक रूप से कुशल स्केलिंग के लिए एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (Mixture-of-Experts) एनकोडर का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक पर्सनल शॉपर हैं जो एक बहुत ही नखरेबाज ग्राहक के लिए काम करते हैं। आपका काम यह देखना है कि उन्होंने अतीत में क्या खरीदा है और फिर अनुमान लगाना है कि वे आगे क्या खरीदना चाहेंगे।
यह पेपर इस बारे में है कि उस पर्सनल शॉपर को अपना काम बेहतर करने के लिए कैसे सिखाया जाए, विशेष रूप से तब जब ग्राहक हर देखी गई चीज़ पर स्पष्ट "थम्स अप" (पसंद) या "थम्स डाउन" (नापसंद) नहीं छोड़ता है।
यहाँ समस्या और समाधान की कहानी दी गई है, जिसे सरल भागों में विभाजित किया गया है:
1. समस्या: "साइलेंट कस्टमर" का जाल
ऑनलाइन शॉपिंग की दुनिया में, हमारे पास इस बारे में बहुत डेटा होता है कि लोगों ने क्या खरीदा ( "पॉजिटिव" आइटम)। लेकिन हमारे पास उन चीजों की भी एक विशाल सूची होती जिन्हें उन्होंने नहीं खरीदा।
- पुराना तरीका (एक भोला दृष्टिकोण): कल्पना कीजिए कि शॉपर यह मान लेता है कि यदि ग्राहक ने कोई विशिष्ट वस्तु नहीं खरीदी, तो इसका मतलब है कि उन्हें वह पसंद नहीं आई। इसलिए, यदि ग्राहक ने iPhone खरीदा लेकिन Android केबल नहीं खरीदा, तो शॉपर सोचता है, "ओह, उन्हें निश्चित रूप से Android केबल पसंद नहीं है!" और वह यह सुनिश्चित करने की कोशिश करता है कि वे उसे फिर कभी न देखें।
- वास्तविकता: संभव है कि ग्राहक ने Android केबल देखा ही न हो, या वे किसी और चीज़ में व्यस्त थे। उन्होंने उसे नापसंद नहीं किया; बस उन्होंने उसके साथ कोई इंटरैक्शन नहीं किया।
- गलती: अतीत में, कंप्यूटर मॉडल इन "नहीं खरीदे गए" आइटम्स को आक्रामक रूप से दंडित करके सीखने की कोशिश करते थे। लेकिन क्योंकि मॉडल ने "नहीं खरीदने" को "नापसंद करने" के रूप में माना, इसलिए इसने अनजाने में उन आइटम्स को भी दंडित कर दिया जिन्हें ग्राहक वास्तव में पसंद करता था लेकिन अभी तक देख नहीं पाया था। यह वैसा ही था जैसे शॉपर उस उपहार के लिए चिल्ला रहा हो जिसे ग्राहक वास्तव में चाहता था, "इसे मत खरीदना!"
2. समाधान: "स्टोकेस्टिक टॉप-K सैंपलिंग" (रूलेट व्हील)
लेखकों ने महसूस किया कि ग्राहक द्वारा न खरीदी गई चीज़ों के प्रति बहुत सख्त होना मॉडल को भ्रमित कर रहा था और गलत अनुमान लगाने पर मजबूर कर रहा था।
उन्होंने एक नई रणनीति प्रस्तावित की जिसे Stochastic Top-K Negative Sampling कहा जाता है। आइए एक उपमा का उपयोग करें:
- पुराना तरीका (हार्ड नेगेटिव्स): मॉडल उस एक अकेली वस्तु को चुनता है जो ग्राहक द्वारा खरीदी गई चीज़ के सबसे करीब दिखती है (जैसे, iPhone यूजर के लिए Android केबल) और कहता है, "यह दुश्मन है! मैं इस वस्तु को कड़ी सजा दूँगा!" यह जोखिम भरा है क्योंकि वह "दुश्मन" वास्तव में एक पसंदीदा आइटम हो सकता है जिसे ग्राहक ने अभी तक क्लिक नहीं किया है।
- नया तरीका (Stochastic Top-K): केवल एक "दुश्मन" चुनने और उस पर हमला करने के बजाय, मॉडल उन शीर्ष 50 आइटम्स को देखता है जो ग्राहक द्वारा खरीदी गई चीज़ के समान दिखते हैं। फिर, यह उस सूची में से रैंडमली (यादृच्छिक रूप से) एक को इस विशिष्ट ट्रेनिंग राउंड के लिए "दुश्मन" के रूप में चुनता है।
यह बेहतर क्यों है?
एक शिक्षक द्वारा छात्र को ग्रेड देने के बारे में सोचें।
- यदि शिक्षक उस एक सबसे कठिन सवाल को चुनता है जिसे छात्र ने गलत किया और हर दिन उसी के लिए उसे डांटता रहता है, तो छात्र भ्रमित हो सकता है यदि वह सवाल वास्तव में एक ट्रिकी सवाल था या यदि छात्र का उस दिन बुरा दिन था।
- लेकिन यदि शिक्षक 50 कठिन सवालों की सूची में से एक रैंडम सवाल चुनता है, तो छात्र एक विशिष्ट गलती पर अटकने के बजाय सामान्य कठिनाई को संभालने के लिए सीखता है। यह सीखने की प्रक्रिया को सुचारू बनाता है और मॉडल को उन चीजों के लिए दंडित करने से रोकता है जो छात्र वास्तव में जानता है।
3. "विशेषज्ञ टीम" (Sparse MoE)
इसे और भी स्मार्ट बनाने के लिए, लेखकों ने एक "मिक्सचर ऑफ एक्सपर्ट्स" (MoE) लेयर जोड़ी है।
- उपमा: कल्पना कीजिए कि आपका पर्सनल शॉपर केवल एक व्यक्ति नहीं है, बल्कि 4 विशेषज्ञों की एक टीम है। एक खिलौनों में माहिर है, एक घरेलू सामान में, एक ब्यूटी प्रोडक्ट्स में और एक इलेक्ट्रॉनिक्स में।
- ट्रिक: जब कोई ग्राहक खिलौने देखता है, तो सिस्टम केवल "टॉय एक्सपर्ट" और "जनरल एक्सपर्ट" को जगाता है। यह "होम गुड्स एक्सपर्ट" को नहीं जगाता है। यह मदद के लिए तैयार विशेषज्ञों की एक बड़ी टीम का लाभ उठाते हुए ऊर्जा (कंप्यूटिंग पावर) बचाता है।
4. परिणाम: एक स्मार्ट शॉपर
जब उन्होंने वास्तविक Amazon डेटा पर इस नए सिस्टम (RoDPO) का परीक्षण किया:
- बेहतर अनुमान: सिस्टम वास्तव में लोग आगे क्या खरीदना चाहते हैं, इसका अनुमान लगाने में काफी बेहतर हो गया।
- कोई अतिरिक्त लागत नहीं: भले ही सिस्टम अधिक स्मार्ट है, लेकिन यह सिफारिश (recommendation) देते समय अधिक समय नहीं लेता है। यह एक बड़े सिर की आवश्यकता के बिना एक तेज़ दिमाग होने जैसा है।
- "फॉल्स नेगेटिव" का समाधान: "नेगेटिव एग्जांपल्स" चुनने के लिए "रूलेट व्हील" पद्धति का उपयोग करके, सिस्टम ने उन आइटम्स को दंडित करना बंद कर दिया जिन्हें लोग वास्तव में पसंद करते थे, जिससे ग्राहक बहुत खुश हुए।
सारांश
यह पेपर रिकमेंडेशन सिस्टम की एक आम समस्या को हल करता है: यह न मानें कि "क्लिक न करना" का मतलब "पसंद न करना" है।
इकाइयों को आक्रामक रूप से दंडित करने के बजाय (जो अक्सर उल्टा असर करता है), नया तरीका "चुनौतीपूर्ण" आइटम्स की एक सूची से रैंडमली सैंपल लेकर मॉडल को धीरे से दिशा देता है। यह AI को अधिक मजबूत, कम भ्रमित और यह अनुमान लगाने में बहुत बेहतर बनाता है कि आप वास्तव में आगे क्या खरीदना चाहते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।