← नवीनतम पेपर
🤖 machine learning

Divide, then Ground: Adapting Frame Selection to Query Types for Long-Form Video Understanding

यह शोध पत्र DIG को पेश करता है, जो एक प्रशिक्षण-मुक्त (training-free) ढांचा है जो वैश्विक (global) और स्थानीयकृत (localized) प्रश्नों के बीच अंतर करके दीर्घकालिक वीडियो समझ को बढ़ाता है ताकि पूर्व के लिए कुशल समान सैंपलिंग (uniform sampling) और उत्तर के लिए विशिष्ट क्वेरी-जागरूक चयन (query-aware selection) लागू किया जा सके, जिससे कम्प्यूटेशनल ओवरहेड को कम करते हुए मौजूदा बेसलाइनों से बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Jialuo Li, Bin Li, Jiahao Li, Yan Lu

प्रकाशित 2026-03-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jialuo Li, Bin Li, Jiahao Li, Yan Lu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप अपने एक दोस्त को 3 घंटे की फिल्म समझाने की कोशिश कर रहे हैं, लेकिन आपके पास केवल 5 मिनट हैं। आप उन्हें पूरी फिल्म नहीं दिखा सकते, इसलिए आपको कुछ विशिष्ट दृश्य (scenes) चुनने होंगे।

समस्या यह है: आप सही दृश्य कैसे चुनेंगे?

लंबे समय तक, AI शोधकर्ताओं ने दो मुख्य तरीकों का उपयोग करने की कोशिश की:

  1. "स्किप-ट्रैक" विधि (यूनिफॉर्म सैंपलिंग): आप बस हर 10 मिनट में आगे बढ़ते हैं और एक रैंडम क्लिप दिखाते हैं। यह तेज़ और आसान है, लेकिन आप सबसे महत्वपूर्ण प्लॉट ट्विस्ट को मिस कर सकते हैं क्योंकि वह मिनट 14 पर हुआ था।
  2. "डिटेक्टिव" विधि (क्वेरी-अवेयर सिलेक्शन): आप पूरी फिल्म देखते हैं, हर सेकंड का विश्लेषण करते हैं, और प्रश्न के आधार पर एकदम सटीक दृश्य चुनते हैं। यह बहुत सटीक है, लेकिन इसमें बहुत समय लगता है और बहुत अधिक ऊर्जा (कंप्यूटिंग पावर) खर्च होती है।

यह पेपर, जिसका शीर्षक "डिवाइड, देन ग्राउंड" (DIG) है, तर्क देता है कि हमें हर सवाल के लिए डिटेक्टिव बनने की ज़रूरत नहीं है। इसके बजाय, हमें सवालों को दो प्रकारों में विभाजित करना चाहिए और प्रत्येक के लिए एक अलग रणनीति का उपयोग करना चाहिए।

मुख्य विचार: दो प्रकार के प्रश्न

लेखकों ने महसूस किया कि वीडियो के बारें में पूछे जाने वाले प्रश्न दो श्रेणियों में आते हैं:

  1. "गिस्ट" (Gist) वाले प्रश्न (ग्लोबल क्वेरीज़):

    • उदाहरण: "यह वीडियो किस बारे में है?" या "इसका मुख्य विषय क्या है?"
    • उपमा: कल्पना कीजिए कि आप पूछ रहे हैं, "इस पार्टी का माहौल कैसा है?" आपको हर नाचते हुए व्यक्ति को देखने की ज़रूरत नहीं है। आपको माहौल समझने के लिए बस कमरे के कुछ वाइड शॉट्स की आवश्यकता है।
    • समाधान: इनके लिए, सरल "स्कीप-ट्रैक" विधि पूरी तरह से काम करती है! यह तेज़, कुशल और काम को पूरा करने वाली है। ज़्यादा सोचने की कोई ज़रूरत नहीं है।
  2. "विशिष्ट विवरण" (Specific Detail) वाले प्रश्न (लोकलाइज्ड क्वेरीज़):

    • उदाहरण: "उस आदमी ने 12वें मिनट पर जो कार चलाई थी, उसका रंग क्या था?" या "कार्टून स्पंज कैसे चला?"
    • उपमा: कल्पना कीजिए कि आप पूछ रहे हैं, "क्या वेटर ने ट्रे गिरा दी?" यदि आप केवल रैंडम क्लिप दिखाते हैं, तो हो सकता है कि आप उस सटीक सेकंड को मिस कर दें जब ट्रे गिरी थी। आपको उस विशिष्ट क्षण को खोजने की आवश्यकता है।
    • समाधान: इनके लिए, "स्कीप-ट्रैक" विधि विफल हो जाती है। आपको उस विशिष्ट दृश्य को खोजने के लिए "डिटेक्टिव" विधि की आवश्यकता है।

परिचय: DIG - एक स्मार्ट वीडियो असिस्टेंट

लेखकों ने DIG (डिवाइड, देन ग्राउंड) नामक एक सिस्टम बनाया है जो एक स्मार्ट वीडियो एडिटर की तरह काम करता है। यह इस प्रकार काम करता है:

चरण 1: "ट्रैफिक पुलिस" (क्वेरी आइडेंटिफिकेशन)

सबसे पहले, DIG प्रश्न को देखता है और एक सुपर-स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) से पूछता है: "क्या यह एक 'गिस्ट' प्रश्न है या एक 'विशिष्ट विवरण' वाला प्रश्न?"

  • यदि यह एक गिस्ट प्रश्न है, तो ट्रैफिक पुलिस "फास्ट लेन" का झंडा लहराती है।
  • यदि यह एक विशिष्ट विवरण वाला प्रश्न है, तो ट्रैफिक पुलिस "डिटोर" (डायवर्जन) का झंडा लहराती है।

स्टेप 2: रणनीति

  • यदि यह एक गिस्ट प्रश्न है (फास्ट लेन):
    DIG पूरे वीडियो से रैंडम, समान रूप से अंतराल पर फ्रेम निकाल लेता है। यह एक फोटो एल्बम को जल्दी से पलटने जैसा है ताकि सामान्य विचार मिल सके। यह बहुत तेज़ और सस्ता है।

  • यदि यह एक विशिष्ट विवरण वाला प्रश्न है (डिटोर):
    DIG "डिटेक्टिव मोड" में जाता है जिसमें तीन चरणों की प्रक्रिया होती है:

    1. सीन परिवर्तन ढूँढना (CAFS): यह वीडियो को स्कैन करता है ताकि यह पता चल सके कि सीन वास्तव में कहाँ बदल रहा है (जैसे फिल्म में कट)। यह प्रत्येक सीन से एक "प्रतिनिधि" (representative) फ्रेम चुनता है। यह वीडियो के उबाऊ, दोहराव वाले हिस्सों के बिना, वीडियो के विजुअल फ्लो का एक संक्षिप्त, साफ सारांश बनाता है।
    2. "प्रासंगिकता स्कोर" (रिवॉर्ड असाइनमेंट): यह AI से पूछता है: "हे, इस विशिष्ट फ्रेम को देखते हुए, क्या यह प्रश्न का उत्तर देने में मदद करता है? क्या अगले कुछ सेकंड में उत्तर होने की संभावना है?" यह फ्रेम को एक स्कोर (0 से 100) देता है।
    3. "रिफाइंड कट" (वीडियो रिफाइनमेंट): यह उच्च स्कोर वाले फ्रेम और उनके आस-पास के वीडियो सेगमेंट को लेता है, उन्हें एक नए, छोटे "हाइलाइट रील" में जोड़ता है, और फिर प्रश्न का उत्तर देने के लिए उस रील को मुख्य AI को फीड करता है।

यह गेम-चेंजर क्यों है?

इसे खाना पकाने की तरह सोचें:

  • पुराने तरीके ऐसे थे जैसे केवल एक माइक्रोवेव (बहुत धीमा) या कैंपफायर (बहुत अव्यवस्थित) का उपयोग करके 100 लोगों के लिए एक शानदार भोजन बनाने की कोशिश करना। वे हर एक ऑर्डर के लिए एक ही जटिल चीज़ करने की कोशिश करते थे।
  • DIG एक स्मार्ट किचन की तरह है। यदि आप एक साधारण सलाद (ग्लोबल क्वेरी) ऑर्डर करते हैं, तो यह बस सामग्री को एक कटोरे में मिला देता है (यूनिफॉर्म सैंपलिंग)। यदि आप एक जटिल स्टेक (लोकलाइज्ड क्वेरी) ऑर्डर करते हैं, तो यह ग्रिल को चालू करता है और उसे पूरी सटीकता के साथ तैयार करता है (स्पेशलाइज्ड पाइपलाइन)।

परिणाम:

  • गति: यह बहुत सारी कंप्यूटिंग पावर बचाता है क्योंकि यह सरल प्रश्नों के लिए जटिल खोज करने में समय बर्बाद नहीं करता है।
  • सटीकता: यह वीडियो के केवल प्रासंगिक हिस्सों पर ध्यान केंद्रित करके कठिन प्रश्नों को सही ढंग से हल करता है।
  • स्केलेबिलिटी: यह तब भी काम करता है जब आप इसे विशाल वीडियो (256 फ्रेम या उससे अधिक) देते हैं, जहाँ अन्य तरीके आमतौर पर भ्रमित हो जाते हैं और विफल हो जाते हैं।

संक्षेप में

यह पेपर हमें सिखाता है कि "एक ही तरीका सबके लिए फिट नहीं होता"। शुरू करने से पहले, यह सरल प्रश्न पूछकर कि, "क्या मुझे पूरी तस्वीर चाहिए या सिर्फ एक विशिष्ट विवरण?", हम AI वीडियो समझ को तेज़ और स्मार्ट बना सकते हैं। यह कड़ी मेहनत करने के बजाय स्मार्ट तरीके से काम करने के बारे में है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →