M3TR: Temporal Retrieval Enhanced Multi-Modal Micro-video Popularity Prediction
यह शोध पत्र M3TR का प्रस्ताव करता है, जो एक टेम्पोरल रिट्रीवल-एन्हांस्ड मल्टी-मोडल फ्रेमवर्क है जो स्वयं-उत्तेजित (self-exciting) उपयोगकर्ता फीडबैक डायनेमिक्स को मॉडल करने के लिए मांबा-हॉक्स प्रोसेस (Mamba-Hawkes Process) और लोकप्रियता के विकास को कैप्चर करने के लिए एक टेम्पोरल-अवेयर रिट्रीवल मैकेनिज्म का लाभ उठाता है, जिससे माइक्रो-वीडियो लोकप्रियता भविष्यवाणी में अत्याधुनिक प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
शॉर्ट-फॉर्म वीडियो कंटेंट के विशाल, उथल-पुथल भरे महासागर में, जहाँ हर दिन लाखों क्लिप अपलोड किए जाते हैं, एक अकेला सवाल रिकमेंडेशन एल्गोरिदम के इंजनों को चलाता है: कौन सा वीडियो दुनिया का ध्यान आकर्षित करेगा, और कितने समय के लिए? इस लोकप्रियता का पूर्वानुमान लगाना केवल लाइक या शेयर गिनने का मामला नहीं है; यह व्यक्तियों की क्षणिक, अक्सर अराजक प्रतिक्रियाओं के आधार पर भीड़ के भविष्य के व्यवहार का अनुमान लगाने का एक प्रयास है। वर्षों से, शोधकर्ता ऐसे मॉडल बनाने की कोशिश कर रहे हैं कि जो वीडियो की सफलता के भविष्य को उसके कंटेंट—वह कैसा दिखता है, कैसा सुनाई देता है, और उसके बारे में टेक्स्ट क्या कहता है—का विश्लेषण करके देख सकें। उन्होंने यह भी ट्रैक करने की कोशिश की कि उपयोगकर्ता समय के साथ एक वीडियो के साथ कैसे इंटरैक्ट करते हैं, उन इंटरैक्शन को एक साधारण लाइन ग्राफ के रूप में माना जो ऊपर या नीचे जाता है। हालाँकि, ये दृष्टिकोण अक्सर मानवीय जुड़ाव की गहरी, अधिक जटिल लय को समझने में विफल रहते हैं। वे यह समझने में विफल रहते हैं कि लाइक्स का एक उछाल शेयर्स की एक लहर को ट्रिगर कर सकता है, या नकारात्मक टिप्पणियों की अचानक बाढ़ किसी वीडियो की गति को तुरंत खत्म कर सकती है, चाहे वह वीडियो खुद कितना भी सुंदर क्यों न हो।
शंघाई जियाओ टोंग यूनिवर्सिटी और क्वीन्स यूनिवर्सिटी बेलफास्ट के शोधकर्ताओं की एक टीम ने इस पहेली को सुलझाने का एक नया तरीका प्रस्तावित किया है, जिसमें उन्होंने एक सिस्टम पेश किया है जिसे वे M3TR कहते हैं। केवल यह देखने के बजाय कि एक वीडियो किस चीज़ से बना है, या यूजर फीडबैक को समय के साथ बदलते एक साधारण नंबर के रूप में मानने के बजाय, यह नया दृष्टिकोण लोकप्रियता को घटनाओं के एक जीवित, सांस लेते अनुक्रम (सीक्वेंस) के रूप में देखता है। शोधकर्ताओं ने महसूस किया कि किसी वीडियो के भविष्य को समझने के लिए, आपको मानवीय प्रतिक्रियाओं की विशिष्ट, जटिल श्रृंखला अभिक्रिया (चेन रिएक्शन) को समझना होगा। उन्होंने एक ऐसा सिस्टम बनाया है जो एक वीडियो की सफलता के अद्वितीय "टेम्पोरल डीएनए" (समय संबंधी डीएनए) को पहचानना सीखता है। इसका अर्थ यह है कि सिस्टम केवल यह नहीं पूछता, "क्या यह वीडियो बिल्लियों के बारे में है?" बल्कि यह पूछता है, "क्या यह वीडियो उन अन्य वीडियो की उत्तेजना और गिरावट के समान पैटर्न का पालन करता है जो प्रसिद्ध हुए थे, भले ही वे अन्य वीडियो खाना पकाने या नृत्य के बारे में क्यों न हों?" यूजर इंटरैक्शन एक-दूसरे को कैसे प्रभावित करते हैं इसकी गहरी समझ को एक स्मार्ट सर्च इंजन के साथ जोड़कर, जो समान लोकप्रियता इतिहास वाले वीडियो खोजता है, टीम ने एक ऐसा टूल बनाया है जो भविष्य को पहले से कहीं अधिक स्पष्ट रूप से देखता है।
उनकी खोज का मूल आधार यह है कि उन्होंने लोगों के वीडियो के प्रति प्रतिक्रिया करने के तरीके को कैसे मॉडल किया। अतीत में, सिस्टम अक्सर एक "लाइक", एक "शेयर" और एक "कमेंट" को स्वतंत्र घटनाओं के रूप में देखते थे, या उन्हें बस एक एकल स्कोर में जोड़ देते थे। शोधकर्ता जानते थे कि यह गलत था। वे समझते थे कि ये क्रियाएं गहराई से जुड़ी हुई हैं: लाइक्स का उछाल अधिक शेयर्स को प्रोत्साहित कर सकता है, जबकि विवादास्पद टिप्पणियों की लहर आगे के जुड़ाव को दबा सकती है। इसे पकड़ने के लिए, उन्होंने एक नई विधि विकसित की जो यूजर फीडबैक को स्व-उत्तेजित (self-exciting) घटनाओं की एक श्रृंखला के रूप में देखती है, जहाँ एक क्रिया स्वाभाविक रूप से अगली क्रिया को ट्रिगर करती है, लेकिन जहाँ उस ट्रिगर की प्रकृति संदर्भ के आधार पर बदल सकती है। उन्होंने इन अनुक्रमों में दीर्घकालिक पैटर्न को सीखने के लिए एक परिष्कृत न्यूरल नेटवर्क आर्किटेक्चर का उपयोग किया, जिससे सिस्टम यह देखने में सक्षम हुआ कि एक विशिष्ट प्रकार की टिप्पणी लोकप्रियता के अंत का संकेत दे सकती है, भले ही वीडियो अभी भी लाइक प्राप्त कर रहा हो। सकारात्मक गति और एक झूठी चोटी (false peak) के बीच अंतर करने की यह क्षमता एक महत्वपूर्ण सफलता थी।
एक बार जब सिस्टम ने एक वीडियो के इंटरैक्शन के जटिल इतिहास को सटीक रूप से मैप करना सीख लिया, तो शोधकर्ताओं के सामने अगली चुनौती आई: उस ज्ञान का उपयोग भविष्य की भविष्यवाणी करने के लिए कैसे किया जाए। पारंपरिक तरीके अन्य वीडियो खोजते जो दिखने या सुनने में समान होते। यदि आपके पास बिल्ली का वीडियो होता, तो सिस्टम अन्य बिल्ली वाले वीडियो खोजता। शोधकर्ताओं ने इस दृष्टिकोण को त्रुटिपूर्ण पाया। एक बिल्ली का वीडियो लोकप्रियता में धीमी, स्थिर वृद्धि वाला हो सकता है, जबकि दूसरे बिल्ली वाले वीडियो में अचानक विस्फोट हो सकता है और फिर वह फीका पड़ सकता है। कंटेंट वही था, लेकिन उनकी सफलता की कहानी पूरी तरह से अलग थी। उनके नए सिस्टम, M3TR ने खोज के नियमों को बदल दिया। केवल कंटेंट को मैच करने के बजाय, इसने लोकप्रियता की "कहानी" को मैच किया। इसने ऐतिहासिक वीडियो के एक विशाल पुस्तकालय को खोजा ताकि उन उदाहरणों को पाया जा सके जो जुड़ाव के समान पैटर्न साझा करते थे—ऐसे वीडियो जो उसी तरह से बढ़े और गिरे, चाहे वे बिल्लियों, कारों या खाना पकाने के बारे में ही क्यों न हों।
कंटेंट-मैचिंग से पैटर्न-मैचिंग की ओर यह बदलाव अविश्वसनीय रूप से शक्तिशाली साबित हुआ। जब शोधकर्ताओं ने दो बड़े डेटासेट्स से वास्तविक दुनिया के डेटा पर अपने सिस्टम का परीक्षण किया, तो परिणाम चौंकाने वाले थे। नया मॉडल सभी पिछले तरीकों से काफी बेहतर प्रदर्शन करता है, जिससे इसके भविष्यवाणियों में त्रुटि 19.3 प्रतिशत तक कम हो गई। सरल शब्दों में, यह अनुमान लगाने में बहुत अधिक सटीक था कि आने वाले घंटों और दिनों में कितने लोग वीडियो देखेंगे, लाइक करेंगे या शेयर करेंगे। सिस्टम सबसे कठिन मामलों को संभालने में विशेष रूप से अच्छा था: वे वीडियो जो मजबूती से शुरू हुए लेकिन फिर फीके पड़ गए, या वे वीडियो जो अचानक वायरल होने से पहले सुप्त अवस्था में रहे। पिछले वीडियो के विशिष्ट प्रक्षेपवक्र (ट्रैजेक्टरी) से सीखकर, मॉडल यह पहचानने में सक्षम था कि कोई वीडियो कब रुकने वाला है या कब तेजी से बढ़ने वाला है, कुछ ऐसा जिसे पुराने मॉडल पूरी तरह से मिस कर देते थे।
शोधकर्ताओं ने यह भी प्रदर्शित किया कि उनका दृष्टिकोण वास्तविक दुनिया के उपयोग के लिए व्यावहारिक है। हालांकि सिस्टम को वीडियो पैटर्न का पुस्तकालय बनाने के लिए काफी कंप्यूटिंग पावर की आवश्यकता होती है, लेकिन यह कार्य पहले से (ऑफलाइन) किया जाता है। एक बार पुस्तकालय बन जाने के बाद, सिस्टम वास्तविक समय में नए वीडियो के लिए भविष्यवाणियां कर सकता है, जो एक सेकंड के अंश में सबसे प्रासंगिक ऐतिहासिक उदाहरण ढूंढ लेता है। यह दो-चरणीय प्रक्रिया सुनिश्चित करती है कि सिस्टम उपयोगकर्ताओं के लिए तेज़ और कुशल बना रहे, भले ही डेटा का पुस्तकालय लाखों वीडियो तक बढ़ जाए। अध्ययन इस बात की पुष्टि करता है कि लोगों के कंटेंट के साथ इंटरैक्ट करने की गतिशील, विकसित होती कहानी को समझना, केवल कंटेंट का विश्लेषण करने की तुलना में भविष्यवाणी के लिए कहीं अधिक महत्वपूर्ण है। केवल चित्र को देखने के बजाय मानवीय ध्यान की लय को सुनकर, शोधकर्ताओं ने वायरल मीडिया की अप्रत्याशित दुनिया में नेविगेट करने का एक नया, अधिक विश्वसनीय तरीका प्रदान किया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।