Multi-Objective Ranking for Live-Streaming: Balancing Fresh and Delayed Signals with Segment-Aware Targeting
यह शोध पत्र लाइव-स्ट्रीमिंग अनुशंसा के लिए एक स्केलेबल बहु-उद्देश्यीय रैंकिंग प्रणाली प्रस्तुत करता है जो एक सेगमेंट-अवेयर टारगेटिंग मॉड्यूल और एक पैरामीटर-कुशल मल्टी-गेट मिक्स्चर-ऑफ-एक्सपर्ट्स (MMoE) आर्किटेक्चर के माध्यम से ताज़ा और विलंबित उपयोगकर्ता संकेतों को प्रभावी ढंग से संतुलित करता है, जिसके परिणामस्वरूप विविध उपयोगकर्ता वर्गों में दैनिक सक्रिय दर्शकों, जुड़ाव और राजस्व में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हलचल भरे डिजिटल शहर के चौक से गुजर रहे हैं जहाँ हजारों लोग लगातार प्रदर्शन कर रहे हैं, बातचीत कर रहे हैं और कहानियाँ साझा कर रहे हैं। यह लाइव-स्ट्रीमिंग की दुनिया है, जहाँ वास्तविक समय में जादू होता है। लेकिन इस शहर के चौक को चलाने वाले लोगों के लिए, एक पेचीदा पहेली है: यह कैसे तय किया जाए कि किस दर्शक को कौन सा कलाकार दिखाया जाए? यह एक "सिफारिश प्रणाली" (recommendation system) का काम है, जो एक डिजिटल मैचमेकर की तरह है जो यह अनुमान लगाने की कोशिश करता है कि आपको आगे क्या पसंद आएगा।
अतीत में, ये मैचमेकर उन उत्साही पुस्तकालयाध्यक्षों की तरह थे जिन्हें केवल उस किताब की परवाह थी जिसे आपने अभी उठाया है। लेकिन लाइव-स्ट्रीमिंग में, कहानी अधिक जटिल है। कभी-कभी, एक दर्शक किसी स्ट्रीमर को कुछ मिनटों तक देखता है, थोड़ी चैट करता है, और फिर चला जाता है। वे कुछ दिनों तक वापस नहीं आते, या वे अचानक कुछ हफ्तों बाद सब्सक्राइब करने या पैसे भेजने का निर्णय ले सकते हैं। ये क्रियाएं जमीन में बोए गए बीजों की तरह हैं; वे तुरंत अंकुरित नहीं होते। यदि मैचमेकर केवल अगले पांच मिनटों में होने वाली घटनाओं को देखता है, तो वह उन बीजों को छोड़ देता है जो बाद में उगेंगे। इसके अलावा, शहर का चौक विभिन्न प्रकार के लोगों से भरा है: कुछ नए पर्यटक हैं जो बस एक त्वरित शो देखना चाहते हैं, जबकि अन्य नियमित लोग हैं जो कलाकारों के साथ गहरे संबंध बनाना चाहते हैं। सभी के साथ बिल्कुल एक जैसा व्यवहार करना अक्सर खराब सिफारिशों का कारण बनता है। यह शोध पत्र यह समझने में मदद करता है कि एक स्मार्ट मैचमेकर कैसे बनाया जाए जो तत्काल उत्साह और इन संबंधों के दीर्घकालिक विकास, दोनों को समझ सके।
चुनौती: "इंतजार करो और देखो" की समस्या (The "Wait-and-See" Problem)
इस पेपर के लेखकों ने, जो Twitch में कार्यरत थे, एक अनूठी समस्या का सामना किया। ऑनलाइन शॉपिंग में, यदि आप किसी उत्पाद पर क्लिक करते हैं और उसे नहीं खरीदते हैं, तो संभावना है कि आप उसे बाद में नहीं खरीदेंगे। लेकिन लाइव-स्ट्रीमिंग में, एक दर्शक एक चैनल पर क्लिक कर सकता है, कुछ देर देख सकता है, और फिर तीन दिन बाद स्ट्रीमर को फॉलो करने या सब्सक्रिप्शन के लिए भुगतान करने के लिए वापस आ सकता है।
समस्या यह है कि ये "बड़ी" क्रियाएं (जैसे फॉलो करना या पैसे खर्च करना) दुर्लभ हैं और धीरे-धीरे होती हैं। यदि कंप्यूटर तुरंत इनसे सीखने की कोशिश करता है, तो वह ज्यादातर "नहीं" वाले उत्तर देखता है, जो सिस्टम को भ्रमित कर देता है। यह केक बनाने की प्रक्रिया के पहले पांच मिनटों को देखकर केक बनाना सीखने की कोशिश करने जैसा है; आप कभी नहीं जान पाएंगे कि केक वास्तव में अच्छा बना या नहीं। इसके अतिरिक्त, सिस्टम पक्षपाती होता जा रहा था। क्योंकि "सुपर-फैंस" (जो बहुत चैट और खर्च करते हैं) बहुत सारा डेटा उत्पन्न करते हैं, कंप्यूटर उन्हें इतनी अच्छी तरह से खुश करने के लिए सीखने लगा कि वह उन नए, आकस्मिक दर्शकों को भूल गया जो बस थोड़ा अनुभव लेना चाहते थे।
समाधान: एक तीन-भाग वाली रणनीति
इसे ठीक करने के लिए, टीम ने तीन चतुर युक्तियों के साथ एक नई रैंकिंग प्रणाली बनाई, जो विशेषज्ञ जासूसों की एक टीम की तरह कार्य करती है।
1. समय-यात्रा करने वाली खिड़की (विलंबित संकेत - Delayed Signals)
सबसे पहले, उन्होंने महसूस किया कि उन्हें किसी दर्शक की रुचि का बहुत जल्दी निर्णय लेना बंद करना होगा। यह पूछने के बजाय कि, "क्या उन्हें यह अभी पसंद आया?", उन्होंने पूछा, "क्या उन्हें अगले दो सप्ताह में यह पसंद आया?" उन्होंने एक 14 दिनों की "विलंबित खिड़की" (delayed window) बनाई। यदि किसी दर्शक ने एक चैनल पर क्लिक किया और फिर, दो सप्ताह के भीतर, चैट करने, फॉलो करने या पैसे खर्च करने का निर्णय लिया, तो सिस्टम ने इसे "हाँ" माना। इसने दुर्लभ, बिखरी हुई घटनाओं को एक स्पष्ट तस्वीर में बदल दिया, जिससे कंप्यूटर को यह समझने में मदद मिली कि एक धीमी प्रतिक्रिया भी सकारात्मक हो सकती है।
2. दो-टीम दृष्टिकोण (ताजा बनाम विलंबित - Fresh vs. Delayed)
इसके बाद, उन्होंने महसूस किया कि सभी क्रियाएं एक जैसी नहीं होती हैं। कुछ चीजें, जैसे क्लिक करना या कुछ मिनट देखना, तुरंत होती हैं। अन्य चीजें, जैसे फॉलो करना या खर्च करना, समय लेती हैं। इसलिए, उन्होंने काम को विभाजित किया।
- टीम फ्रेश (FSM): यह टीम तत्काल प्रतिक्रियाओं पर ध्यान केंद्रित करती है। वे देखते हैं कि दर्शक अभी क्या कर रहे हैं ताकि यह अनुमान लगाया जा सके कि वे कुछ मिनटों के लिए रुकेंगे या नहीं।
- टीम डिलेड (DSM): यह टीम लंबे खेल पर ध्यान केंद्रित करती है। वे उस 14-दिवसीय खिड़की का उपयोग यह अनुमान लगाने के लिए करते हैं कि क्या कोई दर्शक अंततः फॉलो करेगा या पैसे खर्च करेगा।
दो अलग-अलग टीमों के होने से, सिस्टम भ्रमित नहीं होता है। यह एक त्वरित "क्लिक" को एक गहरे "सब्सक्रिप्शन" के साथ नहीं मिलाता है।
3. व्यक्तिगत कोच (सेगमेंट-अवेयर टारगेटिंग - Segment-Aware Targeting)
अंत में, उन्होंने देखा कि नए दर्शकों और सुपर-फैंस को अलग-अलग चीजों की आवश्यकता होती है। एक नए दर्शक को वापस आने के लिए उत्साहित, छोटे कंटेंट से बांधने की आवश्यकता होती है। एक सुपर-फैन गहरे जुड़ाव के लिए तैयार होता है और शायद अपने पसंदीदा स्ट्रीमर का समर्थन करने के लिए वित्तीय रूप से योगदान देना चाहता है।
सिस्टम अब एक ऐसे कोच की तरह कार्य करता है जो खिलाड़ी के स्तर को जानता है। नए दर्शकों के लिए, यह उन्हें देखने और चैट करने के लिए प्रेरित करने को प्राथमिकता देता है। समर्पित प्रशंसकों के लिए, यह उन चैनलों को खोजने में मदद करने को प्राथमिकता देता है जिनका वे समर्थन करना चाहेंगे। यह प्रत्येक समूह के लिए एक पूरी तरह से नई प्रणाली बनाने के बजाय, दर्शक के आधार पर सिफारिशों के "स्कोर" को समायोजित करके ऐसा करता है।
गुप्त नुस्खा: MMoE
यह सब करने के लिए कि कंप्यूटर धीमा न हो, उन्होंने Multi-gate Mixture-of-Experts (MMoE) नामक एक स्मार्ट आर्किटेक्चर का उपयोग किया। एक मुख्य शेफ और कई विशेषज्ञ सहायक शेफ (sous-chefs) वाले रेस्तरां की कल्पना करें।
- एक सहायक शेफ "त्वरित ऐपेटाइज़र" (तत्काल क्लिक) का विशेषज्ञ है।
- अन्य सहायक शेफ "जटिल मुख्य व्यंजनों" (गहरा जुड़ाव और खर्च) के विशेषज्ञ हैं।
"गेट" (gate) वह वेटर है जो तय करता है कि किसी विशिष्ट ग्राहक के लिए किस शेफ की सलाह सुननी है। इसने सिस्टम को इन सभी अलग-अलग लक्ष्यों को एक साथ सीखने की अनुमति दी, लेकिन गणित को कुशल बनाए रखा। वास्तव में, इस विधि का उपयोग करके, उन्होंने सब कुछ चलाने के लिए अलग-अलग मॉडल चलाने की तुलना में कंप्यूटर पैरामीटर्स (मॉडल के "मस्तिष्क कोशिकाएं") की संख्या को 41.9% कम कर दिया, जबकि बेहतर परिणाम प्राप्त किए।
परिणाम: सभी के लिए जीत
टीम ने लाखों वास्तविक उपयोगकर्ताओं के साथ इस नई प्रणाली का परीक्षण किया। परिणाम उत्साहजनक थे:
- अधिक दर्शक: दैनिक सक्रिय दर्शकों (DAV) की संख्या में 0.09% की वृद्धि हुई। हालांकि यह सुनने में छोटा लगता है, लेकिन लाखों उपयोगकर्ताओं की दुनिया में, यह हर साल लाखों अधिक "व्यूअर डेज़" (viewer days) में बदल जाता है।
- खुश प्रशंसक: समर्पित प्रशंसकों के लिए, "कैप्ड एवरेज रेवेन्यू पर यूजर" (ARPU) में 0.56% की वृद्धि हुई, जिसका अर्थ है कि सबसे अधिक संलग्न उपयोगकर्ताओं ने अपने पसंदीदा स्ट्रीमरों का समर्थन करने के लिए थोड़ा अधिक खर्च किया।
- नए दोस्त: सिस्टम ने नए दर्शकों को टिके रहने में मदद की, जिससे उनकी सहभागिता में 0.15% की वृद्धि हुई।
- अधिक फॉलो: नए चैनल फॉलो की संख्या में 0.27% की वृद्धि हुई।
इससे भी बेहतर, सिस्टम तेज़ था। यह 110 मिलीसेकंड (पलक झपकने से भी तेज़) के भीतर ये जटिल निर्णय ले सकता था, जिससे यह सिद्ध हुआ कि आप स्मार्ट और तेज़ दोनों हो सकते हैं। उन्होंने मोबाइल ऐप पर भी इसका परीक्षण किया और क्लिक और लाइक जैसी सकारात्मक अंतःक्रियाओं में 1.12% की वृद्धि देखी।
उन्होंने क्या नहीं किया
लेखकों ने यह नोट करने में सावधानी बरती कि क्या काम नहीं आया। उन्होंने नए दर्शकों के प्रति पूर्वाग्रह को ठीक करने के लिए उनके डेटा को प्रशिक्षण के दौरान अधिक भार (weight) देकर (अनिवार्य रूप से कंप्यूटर पर नए उपयोगकर्ताओं के बारे में ज़ोर देकर) कोशिश की, लेकिन इससे मदद नहीं मिली और चीजें जटिल हो गईं। इसके बजाय, उन्होंने पाया कि मॉडल के प्रशिक्षित होने के बाद, भार (weights) को समायोजित करना (सिफारिश के समय) ही कुंजी थी। उन्होंने यह भी पाया कि सभी लक्ष्यों को एक ही विशाल मॉडल में डालने की कोशिश करने से सिस्टम तत्काल जुड़ाव की भविष्यवाणी करने में और खराब हो गया, जिससे यह साबित हुआ कि "फ्रेश" और "डिलेड" संकेतों को अलग रखना महत्वपूर्ण था।
संक्षेप में, यह पेपर दिखाता है कि एक महान लाइव-स्ट्रीमिंग सिफारिश प्रणाली बनाने के लिए, आपको बीजों को उगने के लिए पर्याप्त धैर्यवान होना चाहिए, नए और पुराने प्रशंसकों के साथ अलग व्यवहार करने के लिए पर्याप्त स्मार्ट होना चाहिए, और यह सब पलक झपकते ही करने के लिए पर्याप्त कुशल होना चाहिए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।