← नवीनतम पेपर
💻 computer science

See More, Store Less: Memory-Efficient Resolution for Video Moment Retrieval

यह शोधपत्र SMORE का प्रस्ताव करता है, जो एक वीडियो मोमेंट रिट्रीवल के लिए मेमोरी-कुशल फ्रेमवर्क है, जो डेंस फ्रेम प्रोसेसिंग की मेमोरी सीमाओं को पार करते हुए क्वेरी-गाइडेड कैप्शन, इम्पॉर्टेंस मॉड्यूलेशन और एडेप्टिव फ्रेम कंप्रेशन का उपयोग करके कई बेंचमार्क पर अत्याधुनिक प्रदर्शन प्राप्त करता है।

मूल लेखक: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

प्रकाशित 2026-01-15
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mingyu Jeon, Sungjin Han, Jinkwon Hwang, Minchol Kwon, Jonghee Kim, Junyeong Kim

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास 2 घंटे की एक फिल्म है, लेकिन आपके पास उसे लिखने के लिए केवल एक छोटी सी नोटबुक है। आपको एक विशिष्ट दृश्य ढूँढना है जिसका विवरण कुछ इस तरह हो: "वह क्षण जब पिल्ला लाल गेंद का पीछा करता है।"

समस्या:
अधिकांश वर्तमान AI सिस्टम इस समस्या को दो तरीकों से हल करने की कोशिश करते हैं, और दोनों में ही कमियां हैं:

  1. "स्पार्स स्नैपशॉट" (Sparse Snapshot) दृष्टिकोण: वे हर कुछ सेकंड में फिल्म की कुछ यादृच्छिक (random) तस्वीरें लेते हैं। यदि पिल्ला उन स्नैपशॉट के बीच में स्क्रीन पर दौड़ता है, तो AI उसे पूरी तरह से मिस कर देता है। यह किताब को केवल पेज 1, पेज 50 और पेज 100 देखकर पढ़ने जैसा है।
  2. "फुल डिस्क्रिप्शन" (Full Description) दृष्टिकोण: वे फिल्म के हर एक सेकंड का विस्तृत सारांश लिखने की कोशिश करते हैं। यह सब कुछ कैप्चर कर लेता है, लेकिन यह आपके नोटपैड (मेमोरी) को इतनी जल्दी भर देता है कि कंप्यूटर इसे पूरा करने से पहले ही क्रैश हो जाता है।

समाधान: SMORE (See MORE, store less)
लेखक एक नया फ्रेमवर्क प्रस्तावित करते हैं जिसे SMORE कहा जाता है। इसे एक सुपर-स्मार्ट, मेमोरी-कुशल सहायक के रूप में समझें जो स्क्रिप्ट पढ़ना शुरू करने से पहले ही जानता है कि आप वास्तव में क्या खोज रहे हैं।

SMORE तीन सरल तरीकों का उपयोग करके कैसे काम करता है, यहाँ दिया गया है:

1. "कस्टमाइज्ड हाइलाइटर" (Query-Guided Captions)

सामान्य नोट्स जैसे "एक कुत्ता चल रहा है" लिखने के बजाय, SMORE पहले आपके विशिष्ट प्रश्न को सुनता है।

  • पुराना तरीका: AI लिखता है, "एक कुत्ता चल रहा है।" (सामान्य, शायद यह आपको विशिष्ट दृश्य खोजने में मदद न करे)।
  • SMORE का तरीका: यदि आप पूछते हैं, "पिल्ला गेंद का पीछा कहाँ कर रहा है?", तो AI वीडियो को देखता है और लिखता है, "एक पिल्ला गेंद का पीछा कर रहा है।"
  • उपमा (Analogy): कल्पना कीजिए कि एक लाइब्रेरियन, जो केवल किताबों को उनके रंग के आधार पर सूचीबद्ध करने के बजाय, आपके अनुरोध को पढ़ता है ("मुझे अंतरिक्ष के बारे में एक किताब चाहिए") और फिर प्रासंगिक किताबों पर एक विशेष नोट लिखता है, "यह वाला अंतरिक्ष के बारे में है!" यह सुनिश्चित करता है कि नोट्स बिल्कुल आपकी खोज से मेल खाते हों।

2. "वॉल्यूम नॉब" (Query-Aware Importance)

सभी नोट्स समान रूप से महत्वपूर्ण नहीं होते। कुछ दृश्य केवल बैकग्राउंड शोर हैं; अन्य मुख्य घटना हैं।

  • कैसे काम करता है: SMORE आपके द्वारा लिखे गए प्रत्येक नोट को एक "वॉल्यूम नॉब" देता है। यदि कोई नोट आपकी खोज से पूरी तरह मेल खाता है, तो यह वॉल्यूम को ऊपर कर देता है (उच्च महत्व)। यदि कोई नोट अप्रासंगिक चीज़ों के बारे में है (जैसे कि जब आपने पिल्ले के बारे में पूछा था तब बैकग्राउंड में एक बिल्ली सो रही थी), तो यह वॉल्यूम को नीचे कर देता है।
  • उपमा: यह एक डीजे (DJ) की तरह है जो प्लेलिस्ट मिक्स कर रहा है। जब वह गाना आता जिसे आप सुनना चाहते हैं, तो डीजे वॉल्यूम बढ़ा देता है। जब कोई ऐसा गाना बजता जिसकी आपको परवाह नहीं है, तो वह उसे धीमा कर देता है ताकि वह आपको विचलित न करे। यह AI को वीडियो के केवल "तेज़" (महत्वपूर्ण) हिस्सों पर ध्यान केंद्रित करने में मदद करता है।

3. "स्मार्ट कंप्रेसर" (Structured Visual Compression)

वीडियो में अक्सर कई फ्रेम होते हैं जो लगभग एक जैसे दिखते हैं (जैसे कि एक सीधी सड़क पर 10 सेकंड तक कार का चलना)। हर एक फ्रेम को स्टोर करना जगह की बर्बादी है।

  • कैसे काम करता है: SMORE लगातार आने वाले फ्रेम्स को देखता है। यदि दो फ्रेम लगभग एक जैसे हैं, तो यह एक को फेंक नहीं देता (जिससे जानकारी का नुकसान होता है)। इसके बजाय, यह उन्हें एक एकल, संक्षिप्त सारांश में गणितीय रूप से "दबा" (squash) देता है जो सबसे महत्वपूर्ण विवरणों को बनाए रखता है।
  • उपमा: कल्पना कीजिए कि आपके पास सूर्यास्त की 100 तस्वीरों का ढेर है जहाँ सूरज मुश्किल से हिलता है। सभी 100 तस्वीरें रखने के बजाय, आप बेहतरीन 5 तस्वीरें लेते हैं और उन्हें एक उच्च-गुणवत्ता वाली "सुपर-फोटो" में मिला देते हैं जो 100 अलग-अलग फाइलों की आवश्यकता के बिना पूरी गति को कैप्चर करती है।

परिणाम

पेपर ने इस सिस्टम का परीक्षण तीन प्रमुख वीडियो डेटाबेस (QVHighlights, Charades-STA, और ActivityNet-Captions) पर किया।

  • प्रदर्शन (Performance): SMORE ने सही वीडियो क्षणों को खोजने में वर्तमान सर्वश्रेष्ठ मॉडल्स (जैसे Chrono और LLaVA-MR) को पीछे छोड़ दिया।
  • दक्षता (Efficiency): इसने यह काम कम मेमोरी का उपयोग करते हुए किया। जहाँ अन्य शीर्ष मॉडल्स को चलाने के लिए एक विशाल, महंगे कंप्यूटर चिप (80GB मेमोरी) की आवश्यकता थी, वहीं SMORE एक छोटे, अधिक सामान्य चिप (48GB मेमोरी) पर बेहतर परिणाम प्राप्त करने में सक्षम था।

संक्षेप में:
SMORE एक ऐसे जासूस की तरह है जो केवल अंधे होकर पूरे केस फाइल को नहीं पढ़ता है। इसके बजाय, वह आपके द्वारा दिए गए विशिष्ट सुराग को पढ़ता है, प्रासंगिक पृष्ठों को हाइलाइट करता है, शोर को कम करता है, और उबाऊ हिस्सों को संक्षेप में लिखता है ताकि वह रहस्य को तेज़ी से और कम कागज़ के साथ सुलझा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →