Prompts to Summaries: Zero-Shot Language-Guided Video Summarization with Large Language and Video Models
यह शोध पत्र "प्रॉम्प्ट्स-टू-समरीज़" (Prompts-to-Summaries) प्रस्तुत करता है, जो एक नवीन ज़ीरो-शॉट फ्रेमवर्क है जो बिना किसी प्रशिक्षण डेटा के वीडियो-लैंग्वेज मॉडल कैप्शन को उपयोगकर्ता-निर्देशित वीडियो सारांशों में बदलने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जो मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त करते हुए पिछले अनसुपरवाइज्ड तरीकों से बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास वीडियो फाइलों का एक विशाल पुस्तकालय है—आपकी छुट्टियों, सुरक्षा कैमरों या यूट्यूब के हजारों घंटों के फुटेज। आप बेहतरीन पलों को खोजना चाहते हैं, लेकिन सब कुछ देखना असंभव है। आमतौर पर, एक "हाइलाइट रील" बनाने के लिए आपको एक ऐसे कंप्यूटर प्रोग्राम की आवश्यकता होती है जिसे उन हजारों उदाहरणों पर प्रशिक्षित किया गया हो जिन्हें इंसान एक अच्छे सारांश के रूप में देखते हैं। लेकिन क्या होगा यदि आप किसी ऐसे वीडियो के लिए सारांश चाहते हैं जिसे कंप्यूटर ने पहले कभी नहीं देखा है, या आप उससे कह सकें कि "मुझे केवल मज़ेदार कुत्ते वाले पल दिखाएं" या "उबाऊ हिस्सों को छोड़ दें"?
यह पेपर एक नया टूल पेश करता है जिसे "प्रॉम्प्ट्स-टू-समरीज़" (Prompts-to-Summaries) कहा जाता है। इसे एक स्मार्ट, ज़ीरो-ट्रेनिंग वीडियो एडिटर के रूप में समझें जो दो विशिष्ट सहायकों की एक टीम की तरह काम करता है: एक विजुअल ऑब्जर्वर (दृश्य पर्यवेक्षक) और एक स्टोरीटेलर क्रिटिक (कथाकार आलोचक)।
यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:
1. विजुअल ऑब्जर्वर (द वीडियोएलएम - VideoLM)
सबसे पहले, सिस्टम वीडियो को देखता है। चूंकि कंप्यूटर एक साथ 2 घंटे का वीडियो नहीं पढ़ सकता (यह बहुत अधिक डेटा है), इसलिए विजुअल ऑब्जर्वर वीडियो को छोटे, तार्किक टुकड़ों में काट देता है जिन्हें "सीन" (दृश्य) कहा जाता है।
- उपमा: एक फिल्म संपादक की कल्पना करें जो एक कच्ची टेप को देख रहा है और उसे अलग-अलग दृश्यों में काट रहा है: "कार चेज़," "डिनर पार्टी," "बारिश का तूफान।"
- जादू: यह ऑब्जर्वर केवल काटता ही नहीं; यह हर सीन के लिए एक छोटा सा कैप्शन भी लिखता है, जैसे कि फिल्म का सबटाइटल। "एक आदमी पार्क में कुत्ते के साथ दौड़ रहा है।"
2. स्टोरीटेलर क्रिटिक (द एलएलएम - LLM)
इसके बाद, सिस्टम उन सभी कैप्शंस को लेता है और उन्हें एक स्टोरीटेलर क्रिटिक (एक लार्ज लैंग्वेज मॉडल, जैसे इस चैट के पीछे का AI) को सौंप देता है।
- काम: आप क्रिटिक को एक विशिष्ट निर्देश (एक "प्रॉम्प्ट") देते हैं। उदाहरण के लिए: "कुत्ते पर ध्यान केंद्रित करते हुए एक सारांश बनाएं, लेकिन दौड़ने वाले हिस्से को अनदेखा करें।"
- क्रिया: क्रिटिक हर सीन के कैप्शन को पढ़ता है और उन्हें 1 से 100 के पैमाने पर रेट करता है। वह खुद से पूछता है: "क्या यह सीन उपयोगकर्ता के अनुरोध के अनुकूल है? क्या यह पूरी कहानी के लिए महत्वपूर्ण है?"
- परिणाम: क्रिटिक एक स्कोरकार्ड बनाता है। कुत्तों वाले सीन उच्च स्कोर प्राप्त करते हैं; केवल दौड़ने वाले सीन कम स्कोर पाते हैं।
3. स्मूथ ट्रांज़िशन (द ग्लू - जोड़ने वाला तत्व)
यदि क्रिटिक केवल उच्चतम स्कोर वाले सीन चुन लेता, तो वीडियो अजीब तरह से उछल-कूद कर सकता था (जैसे, पार्क से किचन और फिर वापस पार्क में)।
- समाधान: सिस्टम एक "स्मूथिंग" तकनीक का उपयोग करता है। यह स्कोर को एक ऊबड़-खाबड़ ढलान के बजाय एक कोमल लहर की तरह मानता है। यदि कोई सीन महत्वपूर्ण है, तो उसके ठीक पहले और बाद के फ्रेम को भी महत्व में थोड़ा बढ़ावा दिया जाता है। यह सुनिश्चित करता है कि अंतिम वीडियो स्वाभाविक रूप से प्रवाहित हो, न कि एक स्लाइड शो की तरह।
4. द फाइनल कट (अंतिम संपादन)
अंत में, सिस्टम उच्चतम स्कोर वाले फ्रेमों को जोड़कर एक छोटा, सुसंगत वीडियो बनाता है।
- परिणाम: आपको एक कस्टम हाइलाइट रील मिलती है जो आपके विशिष्ट अनुरोध के अनुरूप होती है, जिसे बिना किसी बड़े डेटासेट पर प्रशिक्षित हुए बनाया गया है।
यह एक बड़ी बात क्यों है?
- कोई प्रशिक्षण आवश्यक नहीं: अधिकांश वीडियो एडिटर उन छात्रों की तरह होते हैं जिन्हें कोई काम करने से पहले विशिष्ट पाठ्यपुस्तकों (डेटासेट) पर वर्षों तक अध्ययन करना पड़ता है। यह नया तरीका एक ऐसे प्रतिभाशाली व्यक्ति की तरह है जो किसी भी किताब को तुरंत पढ़ सकता है। यह किसी भी वीडियो पर काम करता है, चाहे वह कुकिंग शो हो या सुरक्षा कैमरा, बिना किसी पूर्व अभ्यास के।
- आप निर्देशक हैं: आप कुछ भी मांग सकते हैं। "मुझे केवल वे हिस्से दिखाएं जहां लोग हंस रहे हैं," या "किसी भी हिंसा को हटा दें।" यह सिस्टम प्राकृतिक भाषा को समझता है, न कि केवल कोड को।
- विशेषज्ञों को मात देना: आश्चर्यजनक रूप से, यह "नो-ट्रेनिंग" विधि कई जटिल, भारी प्रशिक्षण वाली विधियों से बेहतर प्रदर्शन करती है जिन्हें वर्षों से अध्ययन किया जा रहा है।
"सीक्रेट सॉस" (गुप्त नुस्खा)
लेखकों ने एक नया टेस्ट भी बनाया है जिसे VidSum-Reason कहा जाता है। कल्पना कीजिए कि आप कंप्यूटर से पूछते हैं, "मुझे वे हिस्से दिखाएं जहां पात्र को एहसास होता है कि वह खो गया है।" इसके लिए AI को केवल एक "व्यक्ति" या "कार" को पहचानने के बजाय, भावनाओं और तर्क को समझने की आवश्यकता है। यह नया टूल इन गहरे, सोच-आधारित अनुरोधों को सफलतापूर्वक संभालने वाले पहले उपकरणों में से एक है।
संक्षेप में: यह पेपर हमें एक सार्वभौमिक वीडियो समराइज़र देता है जो आपकी आवाज़ सुनता है, आपके इरादे को समझता है, और आपके वीडियो को तुरंत एडिट करता है, और वह भी बिना पहले से किसी डेटा के पहाड़ पर प्रशिक्षित हुए। यह वीडियो डेटा के अराजक प्रवाह को एक व्यक्तिगत, पठनीय कहानी में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।