A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems
यह शोध पत्र PRL-PUTS को प्रस्तुत करता है, जो एक प्रोडक्शन-रेडी, रँकर-स्वतंत्र सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो पिंटरेस्ट के होमफीड में मल्टी-ऑब्जेक्टिव ट्रेड-ऑफ्स को गतिशील रूप से अनुकूलित करने के लिए पारेटो स्वीपिंग के माध्यम से व्यक्तिगत उपयोगिता-भार (यूटिलिटी-वेट) ट्यूनिंग को स्वचालित करता है, जिसके परिणामस्वरूप बिना किसी सर्विंग लेटेंसी को बढ़ाए महत्वपूर्ण जुड़ाव (एंगेजमेंट) में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
Pinterest की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ लाखों किताबें (Pins) लगातार आगंतुकों को सुझाई जा रही हैं। इस लाइब्रेरी में एक बहुत ही समझदार लाइब्रेरियन (Ranker) है जो हर किताब को देखता है और विभिन्न मानदंडों के आधार पर यह भविष्यवाणी करता है कि एक विशिष्ट आगंतुक उसे कितना पसंद करेगा: "क्या वे इस पर क्लिक करेंगे?" "क्या वे इसे अपने बोर्ड पर सेव करेंगे?" "क्या वे इससे संबंधित कोई अन्य चित्र देखेंगे?"
पुराना तरीका: "एक ही नियम सबके लिए" वाली रूलबुक
अतीत में, लाइब्रेरी प्रबंधकों को यह तय करना पड़ता था कि इन भविष्यवाणियों को एक एकल स्कोर में कैसे जोड़ा जाए ताकि यह तय किया जा सके कि कौन सी किताबें पहले दिखाई जाएँगी। वे एक सरल सूत्र का उपयोग करते थे:
कुल स्कोर = (क्लिक्स × वेट A) + (सेव्स × वेट B)
समस्या यह थी कि वेट A और वेट B हाथ से सेट किए गए थे। यदि प्रबंधक अधिक 'सेव्स' चाहते, तो वे मैन्युअल रूप से वेट B को बढ़ा देते। लेकिन यह धीमा, कठोर और सभी के लिए बिल्कुल एक जैसा था। पार्टी के आइडिया ढूंढ रहा एक किशोर और होम डेकोर की तलाश कर रहा एक पेशेवर, दोनों को सिफारिशों के लिए बिल्कुल एक ही "रेसिपी" मिलती थी, भले ही उनकी ज़रूरतें पूरी तरह से अलग हों। यह एक शेफ की तरह था जो एक बच्चे के सूप और एक अनुभवी फूड क्रिटिक के सूप, दोनों के लिए नमक की बिल्कुल समान मात्रा का उपयोग करता है।
नया समाधान: PRL-PUTS (एक स्मार्ट, अनुकूलन योग्य Sous-Chef)
यह पेपर PRL-PUTS को पेश करता है, जो एक स्मार्ट, अनुकूलन योग्य 'सॉस-शेफ' (Sous-Chef) की तरह काम करता है जो लाइब्रेरियन के ठीक बगल में खड़ा है।
- यह लाइब्रेरियन को दोबारा नहीं लिखता: मुख्य लाइब्रेरियन (Ranker) बिल्कुल वैसा ही रहता है। PRL-PUTS लाइब्रेरियन को फिर से प्रशिक्षित करने या किताबों को पढ़ने का तरीका बदलने की कोशिश नहीं करता। यह बस उनके ऊपर स्थित होता है।
- यह वास्तविक समय (Real-Time) में रेसिपी को एडजस्ट करता है: प्रत्येक आगंतुक के अनुरोध के लिए, PRL-PUTS संदर्भ (Context) को देखता है (यह व्यक्ति कौन है? वह अभी क्या कर रहा है?) और तुरंत निर्णय लेता है: "इस विशिष्ट व्यक्ति के लिए, आइए 'सेव्स' पर थोड़ा अधिक जोर दें," या "इस व्यक्ति के लिए, आइए 'संबंधित चित्रों' पर अधिक जोर दें।"
- यह अनुभव से सीखता है: वेट्स का अनुमान लगाने के बजाय, PRL-PUTS एक 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) एजेंट है। यह एक सुरक्षित, नियंत्रित तरीके से विभिन्न "रेसिपी" (वेट संयोजनों) को आजमाता है, देखता है कि क्या होता है (क्या उपयोगकर्ता ने जुड़ाव दिखाया?), और सीखता है कि किस प्रकार के व्यक्ति के लिए कौन सी रेसिपी सबसे अच्छी काम करती है।
"पारेटो स्वीपिंग" (Pareto Sweeping) ट्रिक: विकल्पों का मेनू
एक सिफारिश प्रणाली (Recommendation System) को प्रबंधित करने का सबसे कठिन हिस्सा यह है कि आप हमेशा हर चीज़ में नहीं जीत सकते। यदि आप "सेव्स" के लिए बहुत अधिक दबाव डालते हैं, तो आपको "क्लिक्स" कम मिल सकते हैं।
पेपर एक चतुर गवर्नेंस टूल पेश करता है जिसे Pareto Sweeping कहा जाता है। कल्पना करें कि सिस्टम केवल एक सबसे अच्छी रेसिपी नहीं चुनता। इसके बजाय, यह संभावित रेसिपीओं का एक पूरा मेनू (एक "Pareto Frontier") तैयार करता है।
- रेसिपी A: सेव्स को अधिकतम करती है, क्लिक्स को थोड़ा कम करती है।
- रेसिपी B: एक आदर्श संतुलन।
- रेसिची C: क्लिक्स को अधिकतम करती है, सेव्स को थोड़ा कम करती है।
बिजनेस लीडर्स (हितधारक) इस मेनू को देख सकते हैं और कह सकते हैं, "आज, हमारा लक्ष्य अधिक सेव्स प्राप्त करना है, इसलिए आइए सिस्टम को रेसिपी A पर स्विच करें।" वे इसे एक सिंगल डायल (एक पैरामीटर जिसे कहा जाता है) को घुमाकर तुरंत कर सकते हैं, बिना पूरे AI मॉडल को फिर से प्रशिक्षित किए या नए अपडेट के लिए हफ्तों इंतजार किए।
यह वास्तविक दुनिया में कैसे काम करता है (Pinterest Homefeed)
टीम ने इसका परीक्षण Pinterest Homefeed (मुख्य फीड जो उपयोगकर्ता लॉग इन करते समय देखते हैं) पर किया।
- गति: यह इतना तेज़ चलता है कि उपयोगकर्ताओं को कोई देरी महसूस नहीं होती। यह एक वेटर की तरह है जो भोजन परोसने के दौरान ही शेफ के कान में एक सुझाव फुसफुसा देता है।
- सुरक्षा: यदि सिस्टम में कोई गड़बड़ी आती है, तो यह तुरंत पुराने, सुरक्षित मैन्युअल वेट्स पर वापस चला जाता है।
- परिणाम: जब उन्होंने कुछ उपयोगकर्ताओं के लिए "सेव्स" को प्राथमिकता देने के लिए डायल को घुमाया, तो उन्होंने "सफल सत्रों" (Successful Sessions) में 0.13% की वृद्धि देखी (ऐसे सत्र जहाँ उपयोगकर्ताओं ने वास्तव में कुछ सकारात्मक किया)। यह सुनने में छोटा लग सकता है, लेकिन लाखों उपयोगकर्ताओं वाले प्लेटफॉर्म पर, यह एक बड़ी जीत है।
मुख्य निष्कर्ष
यह पेपर सिद्ध करता है कि अपने रिकमेंडेशन इंजन को स्मार्ट बनाने के लिए आपको उसे पूरी तरह से फिर से बनाने की आवश्यकता नहीं है। इसके ऊपर एक छोटा, स्मार्ट लेयर जोड़कर जो प्रत्येक उपयोगकर्ता के लिए "रेसिपी" को व्यक्तिगत बनाता है और प्रबंधकों को ट्रेड-ऑफ (समझौते) के विकल्पों का एक मेनू देता है, आप बेहतर परिणाम प्राप्त कर सकते हैं, तेज़ी से अनुकूलित हो सकते हैं और सिस्टम को स्थिर रख सकते हैं।
संक्षेप में: PRL-PUTS एक कठोर, वैश्विक नियम पुस्तिका को एक लचीली, व्यक्तिगत बातचीत में बदल देता है जो सिस्टम और उपयोगकर्ता के बीच होती है, जिसे एक सरल डायल द्वारा प्रबंधित किया जाता है जिसे बिजनेस लीडर्स अपनी प्राथमिकताओं को बदलने के लिए कभी भी घुमा सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।