← नवीनतम पेपर
🤖 machine learning

A Production-Ready RL Framework for Personalized Utility Tuning with Pareto Sweeping in Pinterest Recommender Systems

यह शोध पत्र PRL-PUTS को प्रस्तुत करता है, जो एक प्रोडक्शन-रेडी, रँकर-स्वतंत्र सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) ढांचा है जो पिंटरेस्ट के होमफीड में मल्टी-ऑब्जेक्टिव ट्रेड-ऑफ्स को गतिशील रूप से अनुकूलित करने के लिए पारेटो स्वीपिंग के माध्यम से व्यक्तिगत उपयोगिता-भार (यूटिलिटी-वेट) ट्यूनिंग को स्वचालित करता है, जिसके परिणामस्वरूप बिना किसी सर्विंग लेटेंसी को बढ़ाए महत्वपूर्ण जुड़ाव (एंगेजमेंट) में सुधार होता है।

मूल लेखक: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yichu Zhou, Mehdi Ben Ayed, Lin Yang, Jiacong He, Andreanne Lemay, Jiaye Wang, Jaewon Yang, Josie Zeng, Dhruvil Deven Badani, Yijie Dylan Wang, Jiajing Xu, Charles Rosenberg

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

Pinterest की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ लाखों किताबें (Pins) लगातार आगंतुकों को सुझाई जा रही हैं। इस लाइब्रेरी में एक बहुत ही समझदार लाइब्रेरियन (Ranker) है जो हर किताब को देखता है और विभिन्न मानदंडों के आधार पर यह भविष्यवाणी करता है कि एक विशिष्ट आगंतुक उसे कितना पसंद करेगा: "क्या वे इस पर क्लिक करेंगे?" "क्या वे इसे अपने बोर्ड पर सेव करेंगे?" "क्या वे इससे संबंधित कोई अन्य चित्र देखेंगे?"

पुराना तरीका: "एक ही नियम सबके लिए" वाली रूलबुक

अतीत में, लाइब्रेरी प्रबंधकों को यह तय करना पड़ता था कि इन भविष्यवाणियों को एक एकल स्कोर में कैसे जोड़ा जाए ताकि यह तय किया जा सके कि कौन सी किताबें पहले दिखाई जाएँगी। वे एक सरल सूत्र का उपयोग करते थे:

कुल स्कोर = (क्लिक्स × वेट A) + (सेव्स × वेट B)

समस्या यह थी कि वेट A और वेट B हाथ से सेट किए गए थे। यदि प्रबंधक अधिक 'सेव्स' चाहते, तो वे मैन्युअल रूप से वेट B को बढ़ा देते। लेकिन यह धीमा, कठोर और सभी के लिए बिल्कुल एक जैसा था। पार्टी के आइडिया ढूंढ रहा एक किशोर और होम डेकोर की तलाश कर रहा एक पेशेवर, दोनों को सिफारिशों के लिए बिल्कुल एक ही "रेसिपी" मिलती थी, भले ही उनकी ज़रूरतें पूरी तरह से अलग हों। यह एक शेफ की तरह था जो एक बच्चे के सूप और एक अनुभवी फूड क्रिटिक के सूप, दोनों के लिए नमक की बिल्कुल समान मात्रा का उपयोग करता है।

नया समाधान: PRL-PUTS (एक स्मार्ट, अनुकूलन योग्य Sous-Chef)

यह पेपर PRL-PUTS को पेश करता है, जो एक स्मार्ट, अनुकूलन योग्य 'सॉस-शेफ' (Sous-Chef) की तरह काम करता है जो लाइब्रेरियन के ठीक बगल में खड़ा है।

  1. यह लाइब्रेरियन को दोबारा नहीं लिखता: मुख्य लाइब्रेरियन (Ranker) बिल्कुल वैसा ही रहता है। PRL-PUTS लाइब्रेरियन को फिर से प्रशिक्षित करने या किताबों को पढ़ने का तरीका बदलने की कोशिश नहीं करता। यह बस उनके ऊपर स्थित होता है।
  2. यह वास्तविक समय (Real-Time) में रेसिपी को एडजस्ट करता है: प्रत्येक आगंतुक के अनुरोध के लिए, PRL-PUTS संदर्भ (Context) को देखता है (यह व्यक्ति कौन है? वह अभी क्या कर रहा है?) और तुरंत निर्णय लेता है: "इस विशिष्ट व्यक्ति के लिए, आइए 'सेव्स' पर थोड़ा अधिक जोर दें," या "इस व्यक्ति के लिए, आइए 'संबंधित चित्रों' पर अधिक जोर दें।"
  3. यह अनुभव से सीखता है: वेट्स का अनुमान लगाने के बजाय, PRL-PUTS एक 'रीइन्फोर्समेंट लर्निंग' (Reinforcement Learning) एजेंट है। यह एक सुरक्षित, नियंत्रित तरीके से विभिन्न "रेसिपी" (वेट संयोजनों) को आजमाता है, देखता है कि क्या होता है (क्या उपयोगकर्ता ने जुड़ाव दिखाया?), और सीखता है कि किस प्रकार के व्यक्ति के लिए कौन सी रेसिपी सबसे अच्छी काम करती है।

"पारेटो स्वीपिंग" (Pareto Sweeping) ट्रिक: विकल्पों का मेनू

एक सिफारिश प्रणाली (Recommendation System) को प्रबंधित करने का सबसे कठिन हिस्सा यह है कि आप हमेशा हर चीज़ में नहीं जीत सकते। यदि आप "सेव्स" के लिए बहुत अधिक दबाव डालते हैं, तो आपको "क्लिक्स" कम मिल सकते हैं।

पेपर एक चतुर गवर्नेंस टूल पेश करता है जिसे Pareto Sweeping कहा जाता है। कल्पना करें कि सिस्टम केवल एक सबसे अच्छी रेसिपी नहीं चुनता। इसके बजाय, यह संभावित रेसिपीओं का एक पूरा मेनू (एक "Pareto Frontier") तैयार करता है।

  • रेसिपी A: सेव्स को अधिकतम करती है, क्लिक्स को थोड़ा कम करती है।
  • रेसिपी B: एक आदर्श संतुलन।
  • रेसिची C: क्लिक्स को अधिकतम करती है, सेव्स को थोड़ा कम करती है।

बिजनेस लीडर्स (हितधारक) इस मेनू को देख सकते हैं और कह सकते हैं, "आज, हमारा लक्ष्य अधिक सेव्स प्राप्त करना है, इसलिए आइए सिस्टम को रेसिपी A पर स्विच करें।" वे इसे एक सिंगल डायल (एक पैरामीटर जिसे α\alpha कहा जाता है) को घुमाकर तुरंत कर सकते हैं, बिना पूरे AI मॉडल को फिर से प्रशिक्षित किए या नए अपडेट के लिए हफ्तों इंतजार किए।

यह वास्तविक दुनिया में कैसे काम करता है (Pinterest Homefeed)

टीम ने इसका परीक्षण Pinterest Homefeed (मुख्य फीड जो उपयोगकर्ता लॉग इन करते समय देखते हैं) पर किया।

  • गति: यह इतना तेज़ चलता है कि उपयोगकर्ताओं को कोई देरी महसूस नहीं होती। यह एक वेटर की तरह है जो भोजन परोसने के दौरान ही शेफ के कान में एक सुझाव फुसफुसा देता है।
  • सुरक्षा: यदि सिस्टम में कोई गड़बड़ी आती है, तो यह तुरंत पुराने, सुरक्षित मैन्युअल वेट्स पर वापस चला जाता है।
  • परिणाम: जब उन्होंने कुछ उपयोगकर्ताओं के लिए "सेव्स" को प्राथमिकता देने के लिए डायल को घुमाया, तो उन्होंने "सफल सत्रों" (Successful Sessions) में 0.13% की वृद्धि देखी (ऐसे सत्र जहाँ उपयोगकर्ताओं ने वास्तव में कुछ सकारात्मक किया)। यह सुनने में छोटा लग सकता है, लेकिन लाखों उपयोगकर्ताओं वाले प्लेटफॉर्म पर, यह एक बड़ी जीत है।

मुख्य निष्कर्ष

यह पेपर सिद्ध करता है कि अपने रिकमेंडेशन इंजन को स्मार्ट बनाने के लिए आपको उसे पूरी तरह से फिर से बनाने की आवश्यकता नहीं है। इसके ऊपर एक छोटा, स्मार्ट लेयर जोड़कर जो प्रत्येक उपयोगकर्ता के लिए "रेसिपी" को व्यक्तिगत बनाता है और प्रबंधकों को ट्रेड-ऑफ (समझौते) के विकल्पों का एक मेनू देता है, आप बेहतर परिणाम प्राप्त कर सकते हैं, तेज़ी से अनुकूलित हो सकते हैं और सिस्टम को स्थिर रख सकते हैं।

संक्षेप में: PRL-PUTS एक कठोर, वैश्विक नियम पुस्तिका को एक लचीली, व्यक्तिगत बातचीत में बदल देता है जो सिस्टम और उपयोगकर्ता के बीच होती है, जिसे एक सरल डायल द्वारा प्रबंधित किया जाता है जिसे बिजनेस लीडर्स अपनी प्राथमिकताओं को बदलने के लिए कभी भी घुमा सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →