← नवीनतम पेपर
💻 computer science

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

यह शोध पत्र CLARA का प्रस्ताव करता है, जो एक नवीन क्लिप-स्तरीय मल्टीमॉडल फ्रेमवर्क है जो एडेप्टिव अलाइनमेंट के साथ वीडियो को फाइन-ग्रेन्ड सीक्वेंस के रूप में मॉडल करके, टेम्पोरल डिपेंडेंसीज़ के लिए कॉन्ट्रास्टिव लर्निंग और VLM-व्युत्पन्न तर्कों (rationales) के माध्यम से घृणास्पद वीडियो डिटेक्शन को बेहतर बनाता है, जिससे कई डेटासेट्स पर अत्याधुनिक प्रदर्शन प्राप्त होता है।

मूल लेखक: Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

प्रकाशित 2026-08-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

अरबों लोगों की स्क्रीन पर, एक नए प्रकार की बातचीत हो रही है। यह वीडियो प्लेटफॉर्म के तीव्र, स्क्रॉल होते प्रवाह में होती है जहाँ एक चुटकुला, समाचार क्लिप, या एक व्यक्तिगत व्लॉग पल भर में हानिरहित से हानिकारक में बदल सकता है। एक लिखित पोस्ट के विपरीत, जहाँ अर्थ शब्दों में स्थिर होता है, एक वीडियो ध्वनि, चलते हुए चित्रों और बोले गए भाषा की एक जटिल परत को अपने साथ लेकर चलता है। खतरा इस बात में निहित है कि ये तत्व आपस में कैसे क्रिया करते हैं। एक घृणास्पद संदेश एक ही वाक्य में चिल्लाकर नहीं कहा जा सकता; इसके बजाय, यह दृश्यों के एक क्रम, स्वर के बदलाव, या एक दृश्य संकेत के माध्यम से धीरे-धीरे उभर सकता है जो केवल उस संदर्भ में समझ में आता है जो पहले आया था। इस तरह की सामग्री का पता लगाना इंटरनेट के लिए एक बड़ी चुनौती है, क्योंकि सबसे खतरनाक संकेत अक्सर संक्षिप्त, छिपे हुए और उस विशिष्ट क्षण पर निर्भर होते हैं जब वे दिखाई देते हैं।

वर्षों से, कंप्यूटर वैज्ञानिक मशीनों को इस प्रकार की हानि को पहचानने के लिए सिखाने का प्रयास कर रहे हैं। शुरुआती प्रयासों ने टेक्स्ट (पाठ) पर ध्यान केंद्रित किया, जिसमें क्रोधित शब्दों को खोजा गया। बाद में, वे छवियों और मीम्स (memes) की ओर बढ़े, यह समझने की कोशिश की कि चित्र और कैप्शन एक साथ कैसे काम करते हैं। लेकिन वीडियो एक अनूठी समस्या पेश करते हैं। वे केवल छवियों का संग्रह या भाषण का ट्रांसक्रिप्ट नहीं हैं; वे एक बहता हुआ टाइमलाइन हैं जहाँ अर्थ समय के साथ बदलता है। यदि कोई कंप्यूटर पूरे वीडियो को एक एकल ब्लॉक के रूप में देखता है, तो वह अक्सर उन छोटे, महत्वपूर्ण क्षणों को चूक जाता है जहाँ वास्तव में घृणा होती है। यह केवल पहले और अंतिम वाक्य को पढ़कर एक कहानी को समझने की कोशिश करने जैसा है; बीच के महत्वपूर्ण कथानक बिंदु सारांश में खो जाते हैं।

एसेक्स विश्वविद्यालय और एक्सेटर विश्वविद्यालय के शोधकर्ताओं की एक टीम ने इसे हल करने का एक नया तरीका प्रस्तावित किया है। वे अपने सिस्टम को CLARA कहते हैं। वीडियो को एक बड़े, अपरिवर्तनीय ऑब्जेक्ट के रूप में मानने के बजाय, CLARA इसे छोटे, अर्थपूर्ण टुकड़ों में तोड़ देता है। कल्पना कीजिए कि एक वीडियो एक लंबे वाक्य की तरह है; CLARA इसे एक बार में पूरा नहीं पढ़ता है। इसके बजाय, यह भाषण के हर स्वाभाविक विराम पर रुकता है, जिससे छोटे क्लिप्स की एक श्रृंखला बनती है जो बोले जा रहे शब्दों के साथ तालमेल बिठाती है। इन छोटे खंडों पर ध्यान केंद्रित करके, सिस्टम घृणास्पद विचार के उन क्षणभंगुर पलों को पकड़ सकता है जहाँ उसे पेश किया गया है, भले ही वह विचार एक मिनट की तटस्थ सामग्री में दबा हुआ हो।

शोधकर्ताओं ने पाया कि घृणास्पद वीडियो अक्सर संकेतों के मिश्रण पर निर्भर करते हैं। एक वक्ता एक परेशान करने वाली छवि दिखाते समय शांत आवाज का उपयोग कर सकता है, या एक तटस्थ वाक्यांश का उपयोग कर सकता है जबकि पृष्ठभूमि का संगीत आक्रामक हो जाता है। इसे संभालने के लिए, CLARA एक लचीली प्रणाली का उपयोग करता है जो प्रत्येक छोटे क्लिप के लिए यह तय करती है कि कौन से संकेत सबसे अधिक महत्वपूर्ण हैं। कभी-कभी टेक्स्ट (पाठ) कुंजी होता है; अन्य समय में, यह ध्वनि या दृश्य दृश्य होता है। सिस्टम पूरे वीडियो के लिए एक एकल नियम लागू नहीं करता है। इसके बजाय, यह अनुकूलित होता है, वीडियो के आगे बढ़ने के साथ विभिन्न प्रकार की जानकारी को अलग-अलग महत्व देता है। यह इसे एक स्थिर पैटर्न को देखने के बजाय, यह देखने की अनुमति देता है कि एक घृणास्पद संदेश कैसे विकसित होता है।

यह सुनिश्चित करने के लिए कि सिस्टम व्यापक परिदृश्य को समझ सके, शोधकर्ताओं ने इसमें बुद्धिमत्ता की एक दूसरी परत जोड़ी। उन्होंने एक शक्तिशाली आर्टिफिशियल इंटेलिजेंस टूल का उपयोग किया, जिसे छवियों और टेक्स्ट का वर्णन करने और उनके बारे में तर्क देने के लिए प्रशिक्षित किया गया है, ताकि वीडियो के इरादे का एक उच्च-स्तरीय सारांश तैयार किया जा सके। यह सारांश एक मार्गदर्शक के रूप में कार्य करता है, जिससे सिस्टम को यह समझने में मदद मिलती है कि छोटे क्लिप मिलकर एक बड़े, संभावित रूप से हानिकारक नैरेटिव (कथा) को कैसे बनाते हैं। सिस्टम फिर इन विस्तृत क्लिप-स्तरीय अवलोकनों को उच्च-स्तरीय सारांश के साथ जोड़ता है, जिससे वीडियो की सामग्री की एक पूर्ण तस्वीर बनती है। यह दृष्टिकोण सुनिश्चित करता है कि सिस्टम केवल अलग-थलग क्षणों को ही नहीं देखता, बल्कि तर्क या कहानी के प्रवाह को भी समझता है।

टीम ने इस नई पद्धति का परीक्षण दुनिया भर के विभिन्न सोशल मीडिया प्लेटफॉर्म से लिए गए घृणास्पद वीडियो के तीन अलग-अलग संग्रहों पर किया। परिणाम स्पष्ट थे: नया सिस्टम लगातार मौजूदा सर्वोत्तम तरीकों से बेहतर प्रदर्शन करता रहा। यह हानिरहित वीडियो को गलती से चिह्नित किए बिना घृणास्पद वीडियो की सही पहचान करने में बेहतर था। शोधकर्ताओं ने यह देखने के लिए परीक्षण भी किया कि क्या होगा यदि वे सिस्टम के हिस्सों को हटा दें। जब उन्होंने वीडियो को क्लिप में तोड़ने की क्षमता को हटाया, या जब उन्होंने उच्च-स्तरीय मार्गदर्शन को हटाया, तो सिस्टम का प्रदर्शन गिर गया। इसने पुष्टि की कि उनके डिज़ाइन का हर हिस्सा आवश्यक था। समग्र संदर्भ पर नज़र रखते हुए छोटे, विशिष्ट क्षणों पर ध्यान केंद्रित करने की क्षमता ही सफलता की कुंजी थी।

अध्ययन बताता है कि हानिकारक सामग्री का पता लगाने का भविष्य इस प्रकार के विस्तृत, समय-जागरूक विश्लेषण में निहित है। वीडियो को वास्तव में अनुभव करने के मानवीय तरीके का सम्मान करते हुए—टुकड़े-टुकड़े में, क्षण-दर-क्षण—मशीनें अंततः घृणा भाषण की सूक्ष्म, विकसित होती प्रकृति को देखना सीख सकती हैं। शोधकर्ताओं ने यह दावा नहीं किया कि उन्होंने ऑनलाइन घृणा की समस्या को हमेशा के लिए हल कर दिया है, लेकिन उन्होंने इस काम के लिए एक काफी सटीक उपकरण प्रदान किया है। उनका काम दिखाता है कि वीडियो में खतरे को समझने के लिए, आप केवल पूरी तस्वीर को ही नहीं देख सकते; आपको कहानी को unfolding (प्रकट होते हुए) देखना होगा, एक बार में एक छोटा क्लिप।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →