← नवीनतम पेपर
💻 computer science

Action-Aware Generative Sequence Modeling for Short Video Recommendation

यह शोध पत्र एक्शन-अवेयर जेनेरेटिव सीक्वेंस नेटवर्क (A2Gen) का प्रस्ताव करता है, जो एक नवीन मॉडल है जो शॉर्ट वीडियो अनुशंसा में पारंपरिक बाइनरी क्लासिफिकेशन की सीमाओं को दूर करने के लिए उपयोगकर्ता क्रियाओं के टेम्पोरल पैटर्न का लाभ उठाता है, और कुआईशौ (Kuaishou) पर व्यापक ऑफलाइन और बड़े पैमाने पर ऑनलाइन ए/बी टेस्टिंग के माध्यम से वॉच टाइम, इंटरेक्शन रेट और यूजर रिटेंशन में महत्वपूर्ण सुधार प्राप्त करता है।

मूल लेखक: Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

प्रकाशित 2026-04-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenhao Li, Zihan Lin, Zhengxiao Guo, Jie Zhou, Shukai Liu, Yongqi Liu, Chuan Luo, Chaoyi Ma, Ruiming Tang, Han Li

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने फोन पर एक छोटा वीडियो देख रहे हैं। यह अलग-अलग चीजों का मिश्रण है: शायद एक मजेदार चुटकुला, एक गंभीर समाचार क्लिप, एक आकर्षक गाना, और फिर अचानक एक विज्ञापन।

पुराना तरीका (The "One-Size-Fits-All" Approach)
पारंपरिक अनुशंसा प्रणाली (recommendation systems) पूरे वीडियो को पनीर के एक ठोस ब्लॉक की तरह मानती है। यदि आप वीडियो को "Like" करते हैं, तो सिस्टम यह मान लेता है कि आपने उसमें मौजूद सब कुछ पसंद किया है।

  • समस्या: मान लीजिए कि वीडियो एक इंटरव्यू है जहाँ अतिथि "रोनाल्डो" के बजाय "मेस्सी" को चुनता है। आप ठीक उसी क्षण वीडियो को "Like" करते हैं क्योंकि आप मेस्सी को पसंद करते हैं। लेकिन बाकी का वीडियो केवल रोनाल्डो के हाइलाइट्स है। पुराना सिस्टम सोचता है, "ओह, उन्होंने वीडियो को पसंद किया, इसलिए वे रोनाल्डो को भी पसंद करते होंगे!" और फिर आपको रोनाल्डो के वीडियो दिखाने लगता है। आप परेशान हो जाते हैं क्योंकि आपने केवल मेस्सी वाले हिस्से को पसंद किया था।

नई अंतर्दsubseteq (समय ही सब कुछ है)
इस शोध पत्र के लेखकों ने महसूस किया कि आपने बटन क्लिक किया या नहीं, इससे भी ज्यादा महत्वपूर्ण यह है कि आपने उसे कब क्लिक किया।

  • उपमा: एक वीडियो को एक मूवी ट्रेलर की तरह समझें। यदि आप नायक के सफल होने के ठीक समय पर तालियाँ बजाते हैं (एक "Like"), तो आप उस विशिष्ट क्षण के प्रति अपनी प्रतिक्रिया दे रहे हैं। यदि आप अंत में तालियाँ बजाते हैं, तो शायद आप केवल शिष्टाचार निभा रहे हैं। समय (timing) सिस्टम को ठीक से बताता है कि किस हिस्से ने आपको खुश किया।
  • खोज: लाखों वीडियोों का विश्लेषण करके, उन्होंने पाया कि "Likes" और "Follows" अक्सर विशिष्ट "peaks" (हाइलाइट्स) में होते हैं। यदि आप वीडियो खत्म होने से पहले ही किसी क्रिएटर को "Follow" करते हैं, तो इसका मतलब है कि आप उस व्यक्ति को पसंद करते हैं, न कि अनिवार्य रूप से उस विशिष्ट सामग्री को जो आपने अभी देखी।

समाधान: A2Gen (The "Storyteller" Model)
यह पेपर A2Gen (Action-Aware Generative Sequence Network) नामक एक नया मॉडल पेश करता है। यह अनुमान लगाने के बजाय कि क्या आप वीडियो पसंद करेंगे, A2Gen इस बात की भविष्यवाणी करने की कोशिश करता है कि आप इसे देखने की पूरी कहानी (story) कैसे बनाएंगे।

यह कैसे काम करता है, इसे सरल भागों में विभाजित किया गया है:

  1. The Context-Aware Attention Module (CAM) – "द स्मार्ट रीडर"
    कल्पना कीजिए कि एक पाठक जो न केवल शब्द पढ़ता है बल्कि कमरे के माहौल को भी समझता है। CAM आपके पिछले कार्यों और विशिष्ट वीडियो सामग्री को एक साथ देखता है। वह जानता है कि कॉमेडी वीडियो पर "Like" का मतलब एक न्यूज़ वीडियो पर "Like" से अलग होता है। यह उस क्षण के संदर्भ (context) पर ध्यान देता है।

  2. The Hierarchical Sequence Encoder (HSE) – "द मेमोरी बैंक"
    यह हिस्सा आपकी दीर्घकालिक आदतों को याद रखता है। यह आपके इतिहास को एक लाइब्रेरियन की तरह देखता है जो किताबों को व्यवस्थित करता है। यह केवल यह नहीं देखता कि "यूजर X ने 100 वीडियो देखे।" यह पैटर्न देखता है: "यूजर X आमतौर पर विज्ञापनों को स्किप करता है लेकिन म्यूजिक वीडियो पसंद करता है, और वह 15 सेकंड के बाद क्रिएटर्स को 'Follow' करता है।" यह आपकी अनूठी शैली का एक गहरा प्रोफाइल बनाता है।

  3. The Action-seq Autoregressive Generator (AAG) – "द क्रिस्टल बॉल"
    यही जादुई हिस्सा है। केवल "हाँ/ना" कहने के बजाय, AAG आपके भविष्य के कार्यों के पूरे क्रम (sequence) की भविष्यवाणी करने वाले एक क्रिस्टल बॉल की तरह कार्य करता है।

  • यह पूछता है: "यदि हम यह वीडियो दिखाएं, तो क्या यूजर इसे देखना शुरू करेगा? क्या वह 5-सेकंड के निशान पर 'Like' करेगा? क्या वह 10-सेकंड के निशान पर क्रिएटर को 'Follow' करेगा? वह कब रुक जाएगा?"
  • यह हर क्लिक के क्रम और सटीक समय की भविष्यवाणी करता है, जैसे कि होने से पहले ही किसी फिल्म की कहानी की भविष्यवाणी करना।

यह क्यों महत्वपूर्ण है (परिणाम)
टीम ने इसका परीक्षण Kuaishou पर किया, जो करोड़ों उपयोगकर्ताओं वाला एक विशाल शॉर्ट-वीडियो प्लेटफॉर्म है। उन्होंने अपने पुराने सिस्टम को A2Gen से बदल दिया और एक बड़ा प्रयोग (A/B टेस्टिंग) चलाया।

  • परिणाम: क्योंकि सिस्टम अब यह समझता है कि आप वास्तव में वीडियो के किन हिस्सों का आनंद लेते हैं, यह बेहतर कंटेंट की सिफारिश करता है।
  • आंकड़े:
    • लोगों ने 0.34% अधिक वीडियो समय बिताया (यह सुनने में छोटा लग सकता है, लेकिन लाखों उपयोगकर्ताओं के साथ, यह बहुत अधिक समय है)।
    • लोगों ने अधिक इंटरैक्शन (लाइक, फॉलो, कमेंट) किया (8.1% अधिक)।
    • सबसे महत्वपूर्ण बात यह है कि अधिक लोग अगले दिन वापस आए (रिटेंशन 0.162% बढ़ गया), जिसका अर्थ है लगभग दस लाख अतिरिक्त दैनिक उपयोगकर्ता प्लेटफॉर्म पर बने रहे।

संक्षेप में
यह पेपर तर्क देता है कि हमें वीडियो को एक एकल "हाँ/नहीं" वाली वस्तु के रूप में नहीं देखना चाहिए। इसके बजाय, हमें इसे क्षणों की एक टाइमलाइन के रूप में देखना चाहिए। यह भविष्यवाणी करके कि आप कब और किस क्रम में प्रतिक्रिया देंगे, ऐप अंततः आपकी वास्तविक पसंद को समझ सकता है और आपको वे वीडियो दिखा सकता है जिन्हें आप वास्तव में देखना चाहते हैं, बजाय इसके कि वह केवल एक सिंगल क्लिक के आधार पर अनुमान लगाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →